# ソフトプロンプトのチューニングで、LLMベンチマークは形式ではなく知識を評価できる

> Aleph Alphaは、わずか10個の小さなベクトルを1分ほど学習させるだけで、ベースモデルが指定形式で回答できるようになり、より明確なスコアが得られることを示した。

Oossa · 2026-09-29 · https://oossa.com/ja/soft-prompt-tuning-helps-llm-benchmarks-focus-on-knowledge-not-format

Aleph Alphaは、学習可能な少数のベクトル（ソフトプロンプト）だけを調整し、凍結した言語モデルにベンチマークが求める正確な回答形式を教える手法を公開した。チューニングは約80ステップで完了し、70億パラメーターのモデルなら約1.5分かかる。モデルの知識を変えずに、指定形式に従う精度をほぼ100％まで高められる。

形式への適応度が上がってもモデルの知識スコアは変わらないため、研究者はベースモデルを公平に比較でき、完全なポストトレーニング後の順位も予測しやすくなる。これにより、計算に数週間かかる作業を節約できる。

## 事実

- ソフトプロンプトのベクトル10個は、70億パラメーターのモデル全体の0.0006％に相当する
- 学習は約80ステップで、70億パラメーターのモデルなら約1.5分かかる

## なぜ重要か

高コストな完全学習を行わずに、モデルをすばやく評価・順位付けできるため、開発者はモデルが実際に持つ知識に焦点を当てられる。

## 出典と参考資料

1. [Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation](https://www.aleph-alpha.com/en/blog/soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation/) – Aleph Alpha, 2026-09-29

最終更新: 2026-09-29
