Oossa

新推理方法加快受格式约束的语言模型输出

研究人员推出一款低内存引擎,可将 JSON 和工具调用生成速度提升 1.2–1.3 倍,并大幅缩小语法文件。

简讯作者: Oossa 发布日期: 1 分钟阅读

由 Arip Asadulaev 领衔的团队发布了一种方法,无需额外内存,就能让语言模型严格遵循指定输出格式。该方法将格式转换成一个微型自动机,并直接在 GPU 上运行掩码。在配备 16 GB 内存的 Apple M2 Pro 上,Qwen‑3.5‑2B 和 4B 模型完成受 schema 约束的信息提取,速度约提升 1.2–1.3 倍;语法文件仅占用 3 MB,而非最高 1.5 GB;服务器还能同时托管 16 套语法。16 个并行运行的工具调用代理完成任务所需时间缩短至原来的 1/2.5。

为什么重要

开发者可以在单台笔记本电脑的 GPU 上运行更多受约束的 AI 任务,节省时间和内存。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。