Breve · 1 min de lectura
LlamAmpere v0.4 alcanza más de 95 tokens por segundo en una RTX 3090
Un desarrollador afirma que la última versión de esta bifurcación de Llama.cpp puede ejecutar un modelo Qwen de 27.000 millones de parámetros con un contexto de 262K tokens en una sola RTX 3090. Según los datos publicados, la velocidad se mantuvo durante la generación de 100.000 tokens.
Oossa · Acerca de Oossa
El desarrollador JakeATX publicó la versión 0.4 de LlamAmpere, una bifurcación de Llama.cpp optimizada para las tarjetas gráficas Nvidia Ampere. En una publicación de Reddit, afirma que superó los 95 tokens por segundo al generar 100.000 tokens con un modelo Qwen de 27.000 millones de parámetros en una sola RTX 3090.
La prueba se realizó con un modelo comprimido y una ventana de contexto configurada en 262.144 tokens. JakeATX afirma que la versión 0.4 fue aproximadamente un 10% más rápida que la anterior y admitió más de un 10% más de contexto; se trata de resultados comunicados por el desarrollador, no de una prueba independiente.
Por qué importa
Si otros usuarios obtienen resultados similares, esto sugiere que una sola tarjeta gráfica de una generación anterior puede gestionar sesiones muy largas de generación de texto a velocidades útiles.
Fuentes y referencias
| # | Fuente | Medio | Fecha | Idea clave |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 sept 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 fuentes
Última actualización:
Oossa · Boletín
La semana en IA, explicada
Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.