Nota · 1 min de leitura
TensorRT-LLM 1.3.0rc29 remove o AutoDeploy e adiciona suporte a FP8 para o Qwen3.5
A versão remove o recurso AutoDeploy e permite carregar checkpoints do Qwen3.5 com escalonamento FP8 global.
Oossa · Sobre a Oossa
A NVIDIA lançou a versão 1.3.0rc29 do TensorRT-LLM em 29 de setembro de 2026. A atualização remove a integração com o AutoDeploy, uma mudança incompatível para quem utilizava a API do recurso, e adiciona suporte ao carregamento de checkpoints do modelo Qwen‑3.5 que usam escalas FP8 globais. A mudança também atualiza o sistema de compilação, eliminando uma opção obsoleta do CMake.
Por que importa
Os desenvolvedores terão de adaptar o código que usa as chamadas do AutoDeploy, enquanto os novos modelos Qwen‑3.5 poderão ser executados com a precisão FP8, mais rápida.
Fontes e referências
| # | Fonte | Veículo | Data | Ponto principal |
|---|---|---|---|---|
| 1 | NVIDIA/TensorRT-LLM v1.3.0rc29 ↗ | TensorRT-LLM | 29 de set. de 2026 | ## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio |
1 fontes
Última atualização:
Oossa · Newsletter
A semana em IA, explicada
Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.