OossaAI 发展迅速。我们用简单的话讲清楚。
新闻简报

简讯 · 1 分钟阅读

TensorRT-LLM 1.3.0rc29 移除 AutoDeploy,新增对 Qwen3.5 FP8 的支持

此次发布移除了 AutoDeploy 功能,并支持加载采用全局 FP8 缩放的 Qwen3.5 检查点。

Oossa · 关于 Oossa

NVIDIA 于 2026 年 9 月 29 日发布 TensorRT-LLM 1.3.0rc29。此次更新删除了 AutoDeploy 集成;对于调用其 API 的用户来说,这是一个不兼容变更。此外,更新还支持加载采用全局 FP8 缩放的 Qwen-3.5 模型检查点,并通过移除一项过时的 CMake 选项更新了构建系统。

为什么重要

开发者需要调整代码,移除对 AutoDeploy 调用的依赖;与此同时,新的 Qwen-3.5 模型现在可以使用速度更快的 FP8 精度运行。

这篇文章有帮助吗?

来源与参考

#来源发布方日期要点
1NVIDIA/TensorRT-LLM v1.3.0rc29 ↗TensorRT-LLM2026年9月29日## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio

1 个来源

最后更新:

Oossallms.txt.md

分享

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。