OossaLa IA avanza rápido. Te lo explicamos de forma sencilla.
Boletín

Breve · 1 min de lectura

LlamAmpere v0.4 alcanza más de 95 tokens por segundo en una RTX 3090

Un desarrollador afirma que la última versión de esta bifurcación de Llama.cpp puede ejecutar un modelo Qwen de 27.000 millones de parámetros con un contexto de 262K tokens en una sola RTX 3090. Según los datos publicados, la velocidad se mantuvo durante la generación de 100.000 tokens.

Oossa · Acerca de Oossa

El desarrollador JakeATX publicó la versión 0.4 de LlamAmpere, una bifurcación de Llama.cpp optimizada para las tarjetas gráficas Nvidia Ampere. En una publicación de Reddit, afirma que superó los 95 tokens por segundo al generar 100.000 tokens con un modelo Qwen de 27.000 millones de parámetros en una sola RTX 3090.

La prueba se realizó con un modelo comprimido y una ventana de contexto configurada en 262.144 tokens. JakeATX afirma que la versión 0.4 fue aproximadamente un 10% más rápida que la anterior y admitió más de un 10% más de contexto; se trata de resultados comunicados por el desarrollador, no de una prueba independiente.

Por qué importa

Si otros usuarios obtienen resultados similares, esto sugiere que una sola tarjeta gráfica de una generación anterior puede gestionar sesiones muy largas de generación de texto a velocidades útiles.

¿Te resultó útil este artículo?

Fuentes y referencias

#FuenteMedioFechaIdea clave
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 sept 2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 fuentes

Última actualización:

Oossallms.txt.md

Compartir

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.

LlamAmpere v0.4 alcanza más de 95 tokens por segundo en una RTX 3090 – Oossa