由 Arip Asadulaev 领衔的团队发布了一种方法,无需额外内存,就能让语言模型严格遵循指定输出格式。该方法将格式转换成一个微型自动机,并直接在 GPU 上运行掩码。在配备 16 GB 内存的 Apple M2 Pro 上,Qwen‑3.5‑2B 和 4B 模型完成受 schema 约束的信息提取,速度约提升 1.2–1.3 倍;语法文件仅占用 3 MB,而非最高 1.5 GB;服务器还能同时托管 16 套语法。16 个并行运行的工具调用代理完成任务所需时间缩短至原来的 1/2.5。
为什么重要
开发者可以在单台笔记本电脑的 GPU 上运行更多受约束的 AI 任务,节省时间和内存。