OossaA IA evolui rápido. Nós explicamos de forma simples.
Newsletter

Nota · 1 min de leitura

TensorRT-LLM 1.3.0rc29 remove o AutoDeploy e adiciona suporte a FP8 para o Qwen3.5

A versão remove o recurso AutoDeploy e permite carregar checkpoints do Qwen3.5 com escalonamento FP8 global.

Oossa · Sobre a Oossa

A NVIDIA lançou a versão 1.3.0rc29 do TensorRT-LLM em 29 de setembro de 2026. A atualização remove a integração com o AutoDeploy, uma mudança incompatível para quem utilizava a API do recurso, e adiciona suporte ao carregamento de checkpoints do modelo Qwen‑3.5 que usam escalas FP8 globais. A mudança também atualiza o sistema de compilação, eliminando uma opção obsoleta do CMake.

Por que importa

Os desenvolvedores terão de adaptar o código que usa as chamadas do AutoDeploy, enquanto os novos modelos Qwen‑3.5 poderão ser executados com a precisão FP8, mais rápida.

Este artigo foi útil?

Fontes e referências

#FonteVeículoDataPonto principal
1NVIDIA/TensorRT-LLM v1.3.0rc29 ↗TensorRT-LLM29 de set. de 2026## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio

1 fontes

Última atualização:

Oossallms.txt.md

Compartilhar

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.