# LlamAmpere v0.4, RTX 3090에서 초당 95토큰 이상 생성

> 개발자에 따르면 Llama.cpp 포크의 최신 버전은 RTX 3090 한 대에서 270억 매개변수의 Qwen 모델을 262K 토큰 컨텍스트로 실행할 수 있다. 생성 토큰이 10만 개에 이르는 동안에도 보고된 속도가 유지됐다.

Oossa · 2026-09-28 · https://oossa.com/ko/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

개발자 JakeATX가 Nvidia Ampere 그래픽카드에 맞춰 튜닝한 Llama.cpp 포크, LlamAmpere v0.4를 공개했다. JakeATX는 Reddit 게시물에서 RTX 3090 한 대로 270억 매개변수의 Qwen 모델을 사용해 토큰 10만 개를 생성하는 동안 초당 95토큰 넘는 속도를 기록했다고 밝혔다.

테스트에는 압축 모델을 사용했으며 컨텍스트 창은 262,144토큰으로 설정했다. JakeATX는 v0.4가 이전 버전보다 약 10% 빨라졌고 지원하는 컨텍스트도 10% 넘게 늘었다고 설명했다. 이는 개발자가 보고한 결과이며, 독립적인 벤치마크 결과는 아니다.

## 팩트

- 보고된 테스트 환경은 Nvidia RTX 3090 한 대와 262,144토큰 컨텍스트를 사용했다.
- 개발자는 v0.4의 속도가 이전 버전보다 약 10% 개선됐다고 밝혔다.

## 왜 중요한가

보고된 결과가 다른 사용자 환경에서도 재현된다면, 구형 그래픽카드 한 대로도 매우 긴 텍스트 생성 작업을 유용한 속도로 처리할 수 있다는 점을 보여준다.

## 출처 및 참고 자료

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

최종 업데이트: 2026-09-28
