OossaAI는 빠르게 발전하고 있습니다. 저희가 쉽게 설명해 드립니다.
뉴스레터

짧은 소식 · 1 분 읽기

TensorRT-LLM 1.3.0rc29, AutoDeploy 제거하고 Qwen3.5 FP8 지원 추가

이번 릴리스에서는 AutoDeploy 기능을 제거하고, 전역 FP8 스케일을 사용하는 Qwen3.5 체크포인트를 불러오는 기능을 추가했다.

Oossa · Oossa 소개

NVIDIA가 2026년 9월 29일 TensorRT-LLM 버전 1.3.0rc29를 출시했다. 이번 업데이트에서는 API를 호출하던 사용자에게 호환성을 깨뜨리는 변경 사항으로 AutoDeploy 통합 기능을 제거하고, 전역 FP8 스케일을 사용하는 Qwen‑3.5 모델 체크포인트를 불러오는 기능을 추가했다. 또한 더 이상 사용되지 않는 CMake 옵션을 삭제해 빌드 시스템도 업데이트했다.

왜 중요한가

개발자는 사라진 AutoDeploy 호출에 맞춰 코드를 수정해야 한다. 한편 새로운 Qwen‑3.5 모델을 더 빠른 FP8 정밀도로 실행할 수 있게 됐다.

이 기사가 도움이 되었나요?

출처 및 참고 자료

#출처매체날짜핵심 내용
1NVIDIA/TensorRT-LLM v1.3.0rc29 ↗TensorRT-LLM2026. 9. 29.## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio

1 개 출처

최종 업데이트:

Oossallms.txt.md

공유

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.