OossaKI entwickelt sich schnell. Wir erklären es einfach.
Newsletter

Kurzmeldung · 1 Min. Lesezeit

TensorRT-LLM 1.3.0rc29 streicht AutoDeploy und ergänzt FP8-Unterstützung für Qwen3.5

Das Release entfernt die AutoDeploy-Funktion und ermöglicht das Laden von Qwen3.5-Checkpoints mit globaler FP8-Skalierung.

Oossa · Über Oossa

NVIDIA hat TensorRT-LLM Version 1.3.0rc29 am 29. September 2026 veröffentlicht. Das Update entfernt die AutoDeploy-Integration – eine inkompatible Änderung für Nutzer, die deren API aufgerufen haben – und ergänzt die Unterstützung für Qwen-3.5-Modell-Checkpoints, die beim Laden globale FP8-Skalierungsfaktoren verwenden. Außerdem wurde das Build-System aktualisiert und eine veraltete CMake-Option entfernt.

Warum es wichtig ist

Entwickler müssen ihren Code anpassen, weil die AutoDeploy-Aufrufe wegfallen. Neue Qwen-3.5-Modelle lassen sich nun mit der schnelleren FP8-Präzision ausführen.

War dieser Artikel hilfreich?

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1NVIDIA/TensorRT-LLM v1.3.0rc29 ↗TensorRT-LLM29.09.2026## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio

1 Quellen

Zuletzt aktualisiert:

Oossallms.txt.md

Teilen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.