짧은 소식 · 1 분 읽기
TensorRT-LLM 1.3.0rc29, AutoDeploy 제거하고 Qwen3.5 FP8 지원 추가
이번 릴리스에서는 AutoDeploy 기능을 제거하고, 전역 FP8 스케일을 사용하는 Qwen3.5 체크포인트를 불러오는 기능을 추가했다.
Oossa · Oossa 소개
NVIDIA가 2026년 9월 29일 TensorRT-LLM 버전 1.3.0rc29를 출시했다. 이번 업데이트에서는 API를 호출하던 사용자에게 호환성을 깨뜨리는 변경 사항으로 AutoDeploy 통합 기능을 제거하고, 전역 FP8 스케일을 사용하는 Qwen‑3.5 모델 체크포인트를 불러오는 기능을 추가했다. 또한 더 이상 사용되지 않는 CMake 옵션을 삭제해 빌드 시스템도 업데이트했다.
왜 중요한가
개발자는 사라진 AutoDeploy 호출에 맞춰 코드를 수정해야 한다. 한편 새로운 Qwen‑3.5 모델을 더 빠른 FP8 정밀도로 실행할 수 있게 됐다.
이 기사가 도움이 되었나요?
출처 및 참고 자료
| # | 출처 | 매체 | 날짜 | 핵심 내용 |
|---|---|---|---|---|
| 1 | NVIDIA/TensorRT-LLM v1.3.0rc29 ↗ | TensorRT-LLM | 2026. 9. 29. | ## Highlights - Model Support - Support Qwen3.5 checkpoints with global FP8 scales across model loading paths #19519 - Optimize Gemma4 visio |
1 개 출처
최종 업데이트:
Oossa · 뉴스레터
이번 주 AI, 쉽게 정리
매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.