简讯 · 1 分钟阅读
TensorRT-LLM 1.3.0rc29 移除 AutoDeploy,新增对 Qwen3.5 FP8 的支持
此次发布移除了 AutoDeploy 功能,并支持加载采用全局 FP8 缩放的 Qwen3.5 检查点。
Oossa · 关于 Oossa
NVIDIA 于 2026 年 9 月 29 日发布 TensorRT-LLM 1.3.0rc29。此次更新删除了 AutoDeploy 集成;对于调用其 API 的用户来说,这是一个不兼容变更。此外,更新还支持加载采用全局 FP8 缩放的 Qwen-3.5 模型检查点,并通过移除一项过时的 CMake 选项更新了构建系统。
为什么重要
开发者需要调整代码,移除对 AutoDeploy 调用的依赖;与此同时,新的 Qwen-3.5 模型现在可以使用速度更快的 FP8 精度运行。
这篇文章有帮助吗?
来源与参考
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | NVIDIA/TensorRT-LLM v1.3.0rc29 ↗ | TensorRT-LLM | 2026年9月29日 | ## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio |
1 个来源
最后更新:
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。