# LlamAmpere v0.4 выдаёт более 95 токенов в секунду на RTX 3090

> Разработчик утверждает, что последняя версия форка Llama.cpp способна запускать модель Qwen с 27 млрд параметров и контекстом в 262 тыс. токенов на одной RTX 3090. По его данным, такая скорость сохранялась на протяжении генерации 100 тыс. токенов.

Oossa · 2026-09-28 · https://oossa.com/ru/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

Разработчик JakeATX выпустил версию 0.4 LlamAmpere — форка Llama.cpp, оптимизированного для видеокарт Nvidia Ampere. В публикации на Reddit он сообщил, что при генерации 100 тыс. токенов моделью Qwen с 27 млрд параметров на одной RTX 3090 скорость превышала 95 токенов в секунду.

В тесте использовалась сжатая модель с контекстным окном на 262 144 токена. По словам JakeATX, версия 0.4 примерно на 10% быстрее предыдущей и поддерживает контекст более чем на 10% длиннее. Это результаты, которыми поделился разработчик, а не данные независимого тестирования.

## Факты

- По данным разработчика, в тесте использовалась одна Nvidia RTX 3090 и контекст на 262 144 токена.
- Разработчик утверждает, что скорость версии 0.4 примерно на 10% выше, чем у предыдущей версии.

## Почему это важно

Если эти результаты подтвердятся у других пользователей, они покажут, что даже одна видеокарта предыдущего поколения может с полезной скоростью обрабатывать очень длинные запросы на генерацию текста.

## Источники и ссылки

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Обновлено: 2026-09-28
