# 新推理方法加快受格式约束的语言模型输出

> 研究人员推出一款低内存引擎，可将 JSON 和工具调用生成速度提升 1.2–1.3 倍，并大幅缩小语法文件。

Oossa · 2026-10-08 · https://oossa.com/zh/new-inference-method-speeds-up-schema-constrained-language-model-output

由 Arip Asadulaev 领衔的团队发布了一种方法，无需额外内存，就能让语言模型严格遵循指定输出格式。该方法将格式转换成一个微型自动机，并直接在 GPU 上运行掩码。在配备 16 GB 内存的 Apple M2 Pro 上，Qwen‑3.5‑2B 和 4B 模型完成受 schema 约束的信息提取，速度约提升 1.2–1.3 倍；语法文件仅占用 3 MB，而非最高 1.5 GB；服务器还能同时托管 16 套语法。16 个并行运行的工具调用代理完成任务所需时间缩短至原来的 1/2.5。

## 事实

- 发布日期：2026-10-08（“PUBLISHED: Thu Oct 08 2026”）
- 提速幅度：信息提取快 1.2–1.3 倍；工具调用代理快 2.5 倍；语法文件从 1.5 GB 缩至 3 MB

## 为什么重要

开发者可以在单台笔记本电脑的 GPU 上运行更多受约束的 AI 任务，节省时间和内存。

## 来源与参考

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

最后更新: 2026-10-08
