# LlamAmpere v0.4 registra mais de 95 tokens por segundo em uma RTX 3090

> Um desenvolvedor afirma que a versão mais recente do fork do Llama.cpp consegue executar um modelo Qwen de 27 bilhões de parâmetros, com contexto de 262 mil tokens, em uma única RTX 3090. Segundo o relato, a velocidade se manteve ao longo da geração de 100 mil tokens.

Oossa · 2026-09-28 · https://oossa.com/pt/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

O desenvolvedor JakeATX lançou a versão 0.4 do LlamAmpere, um fork do Llama.cpp otimizado para placas de vídeo Nvidia Ampere. Em uma publicação no Reddit, ele relata ter ultrapassado 95 tokens por segundo ao gerar 100 mil tokens com um modelo Qwen de 27 bilhões de parâmetros em uma única RTX 3090.

O teste usou um modelo comprimido e uma janela de contexto configurada para 262.144 tokens. JakeATX afirma que a versão 0.4 foi cerca de 10% mais rápida que a anterior e comportou um contexto mais de 10% maior; esses resultados foram relatados pelo desenvolvedor e não vêm de um benchmark independente.

## Os fatos

- A configuração relatada usou uma Nvidia RTX 3090 e um contexto de 262.144 tokens.
- O desenvolvedor afirma que a versão 0.4 ficou cerca de 10% mais rápida que a anterior.

## Por que importa

Se os resultados relatados se confirmarem com outros usuários, eles indicam que uma única placa de vídeo mais antiga pode lidar com execuções de geração de texto muito longas em velocidades úteis.

## Fontes e referências

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Última atualização: 2026-09-28
