Kort bericht · 1 min lezen
TensorRT-LLM 1.3.0rc29 schrapt AutoDeploy en voegt ondersteuning voor Qwen3.5 FP8 toe
De release verwijdert de functie AutoDeploy en maakt het mogelijk Qwen3.5-checkpoints met globale FP8-schaling te laden.
Oossa · Over Oossa
NVIDIA heeft op 29 september 2026 TensorRT-LLM versie 1.3.0rc29 uitgebracht. De update verwijdert de integratie van AutoDeploy, een ingrijpende wijziging voor gebruikers die de API ervan aanroepen, en voegt ondersteuning toe voor het laden van Qwen-3.5-modelcheckpoints met globale FP8-schaling. Ook is het buildsysteem aangepast: een verouderde CMake-optie is geschrapt.
Waarom het ertoe doet
Ontwikkelaars moeten hun code aanpassen omdat de AutoDeploy-aanroepen ontbreken. Tegelijkertijd kunnen nieuwe Qwen-3.5-modellen nu met de snellere FP8-precisie draaien.
Bronnen en referenties
| # | Bron | Medium | Datum | Kernpunt |
|---|---|---|---|---|
| 1 | NVIDIA/TensorRT-LLM v1.3.0rc29 ↗ | TensorRT-LLM | 29 sep 2026 | ## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio |
1 bronnen
Laatst bijgewerkt:
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.