Kurzmeldung · 1 Min. Lesezeit
TensorRT-LLM 1.3.0rc29 streicht AutoDeploy und ergänzt FP8-Unterstützung für Qwen3.5
Das Release entfernt die AutoDeploy-Funktion und ermöglicht das Laden von Qwen3.5-Checkpoints mit globaler FP8-Skalierung.
Oossa · Über Oossa
NVIDIA hat TensorRT-LLM Version 1.3.0rc29 am 29. September 2026 veröffentlicht. Das Update entfernt die AutoDeploy-Integration – eine inkompatible Änderung für Nutzer, die deren API aufgerufen haben – und ergänzt die Unterstützung für Qwen-3.5-Modell-Checkpoints, die beim Laden globale FP8-Skalierungsfaktoren verwenden. Außerdem wurde das Build-System aktualisiert und eine veraltete CMake-Option entfernt.
Warum es wichtig ist
Entwickler müssen ihren Code anpassen, weil die AutoDeploy-Aufrufe wegfallen. Neue Qwen-3.5-Modelle lassen sich nun mit der schnelleren FP8-Präzision ausführen.
Quellen und Referenzen
| # | Quelle | Medium | Datum | Kernaussage |
|---|---|---|---|---|
| 1 | NVIDIA/TensorRT-LLM v1.3.0rc29 ↗ | TensorRT-LLM | 29.09.2026 | ## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio |
1 Quellen
Zuletzt aktualisiert:
Oossa · Newsletter
Die KI-Woche, erklärt
Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.