Nota · 1 min de leitura
LlamAmpere v0.4 registra mais de 95 tokens por segundo em uma RTX 3090
Um desenvolvedor afirma que a versão mais recente do fork do Llama.cpp consegue executar um modelo Qwen de 27 bilhões de parâmetros, com contexto de 262 mil tokens, em uma única RTX 3090. Segundo o relato, a velocidade se manteve ao longo da geração de 100 mil tokens.
Oossa · Sobre a Oossa
O desenvolvedor JakeATX lançou a versão 0.4 do LlamAmpere, um fork do Llama.cpp otimizado para placas de vídeo Nvidia Ampere. Em uma publicação no Reddit, ele relata ter ultrapassado 95 tokens por segundo ao gerar 100 mil tokens com um modelo Qwen de 27 bilhões de parâmetros em uma única RTX 3090.
O teste usou um modelo comprimido e uma janela de contexto configurada para 262.144 tokens. JakeATX afirma que a versão 0.4 foi cerca de 10% mais rápida que a anterior e comportou um contexto mais de 10% maior; esses resultados foram relatados pelo desenvolvedor e não vêm de um benchmark independente.
Por que importa
Se os resultados relatados se confirmarem com outros usuários, eles indicam que uma única placa de vídeo mais antiga pode lidar com execuções de geração de texto muito longas em velocidades úteis.
Fontes e referências
| # | Fonte | Veículo | Data | Ponto principal |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 de set. de 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 fontes
Última atualização:
Oossa · Newsletter
A semana em IA, explicada
Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.