短信 · 1 分で読める
ソフトプロンプトのチューニングで、LLMベンチマークは形式ではなく知識を評価できる
Aleph Alphaは、わずか10個の小さなベクトルを1分ほど学習させるだけで、ベースモデルが指定形式で回答できるようになり、より明確なスコアが得られることを示した。
Oossa · Oossaについて
Aleph Alphaは、学習可能な少数のベクトル(ソフトプロンプト)だけを調整し、凍結した言語モデルにベンチマークが求める正確な回答形式を教える手法を公開した。チューニングは約80ステップで完了し、70億パラメーターのモデルなら約1.5分かかる。モデルの知識を変えずに、指定形式に従う精度をほぼ100%まで高められる。
形式への適応度が上がってもモデルの知識スコアは変わらないため、研究者はベースモデルを公平に比較でき、完全なポストトレーニング後の順位も予測しやすくなる。これにより、計算に数週間かかる作業を節約できる。
なぜ重要か
高コストな完全学習を行わずに、モデルをすばやく評価・順位付けできるため、開発者はモデルが実際に持つ知識に焦点を当てられる。
この記事は役に立ちましたか?
出典と参考資料
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation ↗ | Aleph Alpha | 2026/09/29 |
1 件の出典
最終更新:
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。