# 软提示调优让大语言模型基准测试聚焦知识，而非格式

> Aleph Alpha 展示，只需训练十个微小向量约一分钟，就能让基础模型按正确格式作答，从而获得更清晰的评分。

Oossa · 2026-09-29 · https://oossa.com/zh/soft-prompt-tuning-helps-llm-benchmarks-focus-on-knowledge-not-format

Aleph Alpha 发布了一种方法，只需调整少量可学习向量（称为软提示），就能教会冻结状态的语言模型采用基准测试所要求的确切答案格式。调优约需 80 步；对于一款拥有 70 亿参数的模型，大约耗时 1.5 分钟。它能将格式遵循准确率提升至接近 100%，同时不改变模型的知识水平。

由于模型的知识得分保持不变，而格式表现有所提升，研究人员可以公平比较基础模型，并预测它们在完成全面后训练后的排名，从而节省数周的计算资源。

## 事实

- 10 个软提示向量仅占一款 7B 模型参数量的 0.0006%
- 训练约需 80 步；对于 7B 模型，耗时约 1.5 分钟

## 为什么重要

开发者可以不必付出高昂的全面训练成本，快速评估和排列模型名次，重点考察模型真正掌握的知识。

## 来源与参考

1. [Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation](https://www.aleph-alpha.com/en/blog/soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation/) – Aleph Alpha, 2026-09-29

最后更新: 2026-09-29
