研究者らはOct 6, 2026、質問ごとに最適なAIエージェントの組み合わせを自動で作るシステム「SHIFT」に関する論文を発表した。SHIFTは実行時にさまざまな構成を試すのではなく、小規模な言語モデルを訓練して最適な設計を予測させ、その後、モンテカルロ木探索を使ってエージェントを組み立てる。この手法は、数学の問題から文書処理、汎用アシスタントのタスクまで、6つのベンチマークにまたがる9,193件のタスクで検証された。
SHIFTの性能は?
実行エンジンにGemini 3.5 Flashを使った場合、SHIFTの平均精度は約80%に達し、通常のプロンプト、プロンプト最適化の工夫、ほかのワークフロー探索手法など、17の競合手法を上回った。最も優れた競合手法との差は7.2ポイントだった。より低コストのSHIFT構成でも、すべてのベースラインを上回りながら、使用トークン数を32%削減した。つまり、必要な計算量も少なくて済んだ。
設計要素を組み合わせる重要性
著者らは、通信構造、指示、ツールを一体として選ぶほうが、いずれか1つだけを選ぶより効果的だと示した。すべてを組み合わせて選ぶことで、指示のみ、またはツールのみを選ぶ場合に比べ、結果が最大9.1ポイント向上した。また、学習した価値関数により、候補の中からより高精度で低コストなハーネスを選べた。
なぜ重要か
AIアシスタントを開発する人にとって、SHIFTは新しい依頼ごとにエージェントの構成を手作業で作り込むことなく、性能を高められる可能性がある。計算コストも抑えられるため、クラウド費用を削減し、より高機能なマルチエージェントサービスを利用者に手頃な価格で提供しやすくなる。