Breve · 1 min di lettura
TensorRT-LLM 1.3.0rc29 rimuove AutoDeploy e aggiunge il supporto FP8 per Qwen3.5
La release elimina la funzionalità AutoDeploy e consente di caricare checkpoint Qwen3.5 con scaling FP8 globale.
Oossa · Chi è Oossa
NVIDIA ha rilasciato TensorRT-LLM versione 1.3.0rc29 il 29 settembre 2026. L’aggiornamento elimina l’integrazione AutoDeploy, una modifica incompatibile con le versioni precedenti per chi ne utilizzava l’API, e aggiunge il supporto al caricamento di checkpoint dei modelli Qwen‑3.5 che usano scale FP8 globali. La modifica aggiorna anche il sistema di build rimuovendo un’opzione CMake obsoleta.
Perché conta
Gli sviluppatori dovranno modificare il codice che richiama AutoDeploy, mentre i nuovi modelli Qwen‑3.5 potranno ora funzionare con la precisione FP8, più veloce.
Fonti e riferimenti
| # | Fonte | Testata | Data | Punto chiave |
|---|---|---|---|---|
| 1 | NVIDIA/TensorRT-LLM v1.3.0rc29 ↗ | TensorRT-LLM | 29 set 2026 | ## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio |
1 fonti
Ultimo aggiornamento:
Oossa · Newsletter
La settimana dell'IA, spiegata
Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.