Un grupo de investigadores presentó APEX, un controlador entrenado que decide cuántos tokens de borrador generar y qué método de especulación utilizar. Se integra en el motor de inferencia vLLM y se probó con el modelo de lenguaje Qwen3-8B. En seis cargas de trabajo de referencia, APEX alcanzó una aceleración de hasta 5,24× frente a la decodificación autorregresiva estándar. La variante APEX‑Depth mantuvo una aceleración de 3,27× y redujo un 41% los tokens desperdiciados en comparación con un borrador fijo de n‑gramas de tamaño 16.
Por qué importa
Los desarrolladores pueden ejecutar modelos de lenguaje grandes con mayor rapidez y a menor costo, lo que hace más asequibles las funciones de IA en tiempo real.