짧은 소식 · 1 분 읽기
LlamAmpere v0.4, RTX 3090에서 초당 95토큰 이상 생성
개발자에 따르면 Llama.cpp 포크의 최신 버전은 RTX 3090 한 대에서 270억 매개변수의 Qwen 모델을 262K 토큰 컨텍스트로 실행할 수 있다. 생성 토큰이 10만 개에 이르는 동안에도 보고된 속도가 유지됐다.
Oossa · Oossa 소개
개발자 JakeATX가 Nvidia Ampere 그래픽카드에 맞춰 튜닝한 Llama.cpp 포크, LlamAmpere v0.4를 공개했다. JakeATX는 Reddit 게시물에서 RTX 3090 한 대로 270억 매개변수의 Qwen 모델을 사용해 토큰 10만 개를 생성하는 동안 초당 95토큰 넘는 속도를 기록했다고 밝혔다.
테스트에는 압축 모델을 사용했으며 컨텍스트 창은 262,144토큰으로 설정했다. JakeATX는 v0.4가 이전 버전보다 약 10% 빨라졌고 지원하는 컨텍스트도 10% 넘게 늘었다고 설명했다. 이는 개발자가 보고한 결과이며, 독립적인 벤치마크 결과는 아니다.
왜 중요한가
보고된 결과가 다른 사용자 환경에서도 재현된다면, 구형 그래픽카드 한 대로도 매우 긴 텍스트 생성 작업을 유용한 속도로 처리할 수 있다는 점을 보여준다.
이 기사가 도움이 되었나요?
출처 및 참고 자료
| # | 출처 | 매체 | 날짜 | 핵심 내용 |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 2026. 9. 28. | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 개 출처
최종 업데이트:
Oossa · 뉴스레터
이번 주 AI, 쉽게 정리
매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.