Oossa

新しい推論手法で、形式制約付きの言語モデル出力を高速化

研究チームが、JSONやツール呼び出しの生成を1.2~1.3倍高速化し、文法データのサイズを大幅に削減する省メモリーエンジンを発表した。

短信著者: Oossa公開日: 1 分で読める

Arip Asadulaev氏が率いるチームは、追加メモリーを使わずに言語モデルの出力形式を厳密に制御する手法を発表した。この手法では、形式を小さなオートマトンに変換し、GPU上で直接マスクを適用する。16 GBのApple M2 Proでは、Qwen-3.5-2Bモデルと4Bモデルによるスキーマ制約付きの情報抽出が約1.2~1.3倍速く完了した。文法データのサイズは最大1.5 GBからわずか3 MBに減り、サーバーで16種類の文法を扱えるようになった。ツールを呼び出す16個のエージェントを並列実行した場合、タスク完了までの時間は2.5倍短縮された。

なぜ重要か

開発者は、1台のノートPCのGPUでより多くの制約付きAIタスクを実行し、時間とメモリーを節約できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。