Заметка · 1 мин чтения
LlamAmpere v0.4 выдаёт более 95 токенов в секунду на RTX 3090
Разработчик утверждает, что последняя версия форка Llama.cpp способна запускать модель Qwen с 27 млрд параметров и контекстом в 262 тыс. токенов на одной RTX 3090. По его данным, такая скорость сохранялась на протяжении генерации 100 тыс. токенов.
Oossa · О проекте Oossa
Разработчик JakeATX выпустил версию 0.4 LlamAmpere — форка Llama.cpp, оптимизированного для видеокарт Nvidia Ampere. В публикации на Reddit он сообщил, что при генерации 100 тыс. токенов моделью Qwen с 27 млрд параметров на одной RTX 3090 скорость превышала 95 токенов в секунду.
В тесте использовалась сжатая модель с контекстным окном на 262 144 токена. По словам JakeATX, версия 0.4 примерно на 10% быстрее предыдущей и поддерживает контекст более чем на 10% длиннее. Это результаты, которыми поделился разработчик, а не данные независимого тестирования.
Почему это важно
Если эти результаты подтвердятся у других пользователей, они покажут, что даже одна видеокарта предыдущего поколения может с полезной скоростью обрабатывать очень длинные запросы на генерацию текста.
Источники и ссылки
| # | Источник | Издание | Дата | Главное |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 сент. 2026 г. | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 источников
Обновлено:
Oossa · Рассылка
Неделя ИИ — простыми словами
Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.