OossaL'IA évolue vite. Nous l'expliquons simplement.
Newsletter

Brève · 1 min de lecture

TensorRT-LLM 1.3.0rc29 supprime AutoDeploy et prend en charge Qwen3.5 en FP8

Cette version supprime la fonctionnalité AutoDeploy et permet de charger des checkpoints Qwen3.5 avec une mise à l’échelle FP8 globale.

Oossa · À propos d’Oossa

NVIDIA a publié TensorRT-LLM version 1.3.0rc29 le 29 septembre 2026. La mise à jour supprime l’intégration AutoDeploy, une rupture de compatibilité pour les utilisateurs qui faisaient appel à son API, et ajoute la prise en charge, au chargement, des checkpoints de modèles Qwen‑3.5 utilisant des facteurs d’échelle FP8 globaux. Elle met également à jour le système de compilation en supprimant une option CMake obsolète.

Pourquoi c'est important

Les développeurs devront adapter leur code aux appels AutoDeploy qui ne sont plus disponibles, tandis que les nouveaux modèles Qwen‑3.5 pourront désormais fonctionner avec la précision FP8, plus rapide.

Cet article vous a-t-il été utile ?

Sources et références

#SourceMédiaDateÀ retenir
1NVIDIA/TensorRT-LLM v1.3.0rc29 ↗TensorRT-LLM29 sept. 2026## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio

1 sources

Dernière mise à jour:

Oossallms.txt.md

Partager

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.