OossaИИ быстро развивается. Мы объясняем это просто.
Рассылка

Заметка · 1 мин чтения

LlamAmpere v0.4 выдаёт более 95 токенов в секунду на RTX 3090

Разработчик утверждает, что последняя версия форка Llama.cpp способна запускать модель Qwen с 27 млрд параметров и контекстом в 262 тыс. токенов на одной RTX 3090. По его данным, такая скорость сохранялась на протяжении генерации 100 тыс. токенов.

Oossa · О проекте Oossa

Разработчик JakeATX выпустил версию 0.4 LlamAmpere — форка Llama.cpp, оптимизированного для видеокарт Nvidia Ampere. В публикации на Reddit он сообщил, что при генерации 100 тыс. токенов моделью Qwen с 27 млрд параметров на одной RTX 3090 скорость превышала 95 токенов в секунду.

В тесте использовалась сжатая модель с контекстным окном на 262 144 токена. По словам JakeATX, версия 0.4 примерно на 10% быстрее предыдущей и поддерживает контекст более чем на 10% длиннее. Это результаты, которыми поделился разработчик, а не данные независимого тестирования.

Почему это важно

Если эти результаты подтвердятся у других пользователей, они покажут, что даже одна видеокарта предыдущего поколения может с полезной скоростью обрабатывать очень длинные запросы на генерацию текста.

Эта статья была полезной?

Источники и ссылки

#ИсточникИзданиеДатаГлавное
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 сент. 2026 г.Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 источников

Обновлено:

Oossallms.txt.md

Поделиться

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

LlamAmpere v0.4 выдаёт более 95 токенов в секунду на RTX 3090 – Oossa