Исследователи представили APEX — обучаемый контроллер, который выбирает, сколько черновых токенов генерировать и какой метод спекулятивного декодирования использовать. Он интегрируется в движок инференса vLLM и прошёл испытания на языковой модели Qwen3-8B. На шести тестовых задачах APEX обеспечил ускорение до 5,24 раза по сравнению со стандартным авторегрессионным декодированием. Вариант APEX‑Depth сохранил ускорение в 3,27 раза и при этом сократил число неиспользованных токенов на 41% по сравнению с фиксированным черновиком на основе n‑грамм размером 16.
Почему это важно
Разработчики смогут запускать большие языковые модели быстрее и дешевле, делая функции ИИ в реальном времени доступнее.