Pesquisadores apresentaram o APEX, um controlador treinado para decidir quantos tokens especulativos gerar e qual método de especulação usar. Ele se integra ao mecanismo de inferência vLLM e foi testado no modelo de linguagem Qwen3-8B. Em seis cargas de trabalho de benchmark, o APEX alcançou uma aceleração de até 5,24× em relação à decodificação autorregressiva padrão. A variante APEX‑Depth manteve a aceleração de 3,27× e reduziu em 41% os tokens desperdiçados, em comparação com uma geração especulativa de n‑gramas de tamanho fixo 16.
Por que importa
Desenvolvedores podem executar grandes modelos de linguagem com mais rapidez e menor custo, tornando recursos de IA em tempo real mais acessíveis.