Arip Asadulaev氏が率いるチームは、追加メモリーを使わずに言語モデルの出力形式を厳密に制御する手法を発表した。この手法では、形式を小さなオートマトンに変換し、GPU上で直接マスクを適用する。16 GBのApple M2 Proでは、Qwen-3.5-2Bモデルと4Bモデルによるスキーマ制約付きの情報抽出が約1.2~1.3倍速く完了した。文法データのサイズは最大1.5 GBからわずか3 MBに減り、サーバーで16種類の文法を扱えるようになった。ツールを呼び出す16個のエージェントを並列実行した場合、タスク完了までの時間は2.5倍短縮された。
なぜ重要か
開発者は、1台のノートPCのGPUでより多くの制約付きAIタスクを実行し、時間とメモリーを節約できる。