OossaAI는 빠르게 발전하고 있습니다. 저희가 쉽게 설명해 드립니다.
뉴스레터

짧은 소식 · 1 분 읽기

LlamAmpere v0.4, RTX 3090에서 초당 95토큰 이상 생성

개발자에 따르면 Llama.cpp 포크의 최신 버전은 RTX 3090 한 대에서 270억 매개변수의 Qwen 모델을 262K 토큰 컨텍스트로 실행할 수 있다. 생성 토큰이 10만 개에 이르는 동안에도 보고된 속도가 유지됐다.

Oossa · Oossa 소개

개발자 JakeATX가 Nvidia Ampere 그래픽카드에 맞춰 튜닝한 Llama.cpp 포크, LlamAmpere v0.4를 공개했다. JakeATX는 Reddit 게시물에서 RTX 3090 한 대로 270억 매개변수의 Qwen 모델을 사용해 토큰 10만 개를 생성하는 동안 초당 95토큰 넘는 속도를 기록했다고 밝혔다.

테스트에는 압축 모델을 사용했으며 컨텍스트 창은 262,144토큰으로 설정했다. JakeATX는 v0.4가 이전 버전보다 약 10% 빨라졌고 지원하는 컨텍스트도 10% 넘게 늘었다고 설명했다. 이는 개발자가 보고한 결과이며, 독립적인 벤치마크 결과는 아니다.

왜 중요한가

보고된 결과가 다른 사용자 환경에서도 재현된다면, 구형 그래픽카드 한 대로도 매우 긴 텍스트 생성 작업을 유용한 속도로 처리할 수 있다는 점을 보여준다.

이 기사가 도움이 되었나요?

출처 및 참고 자료

#출처매체날짜핵심 내용
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA2026. 9. 28.Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 개 출처

최종 업데이트:

Oossallms.txt.md

공유

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.

LlamAmpere v0.4, RTX 3090에서 초당 95토큰 이상 생성 – Oossa