Заметка · 1 мин чтения
Настройка с помощью soft prompts помогает оценивать знания LLM, а не формат ответов
Aleph Alpha показала, что обучение всего десяти крошечных векторов в течение минуты позволяет базовым моделям отвечать в нужном формате и делает результаты тестирования точнее.
Oossa · Об Oossa
Aleph Alpha представила метод, который настраивает лишь несколько обучаемых векторов — так называемых soft prompts, — чтобы научить замороженную языковую модель отвечать строго в формате, требуемом бенчмарком. Настройка занимает около 80 шагов, или примерно 1,5 минуты для модели с 7 млрд параметров. Точность соблюдения формата повышается почти до 100%, при этом знания модели не меняются.
Поскольку оценка знаний остается прежней, а форматирование улучшается, исследователи могут объективно сравнивать базовые модели и прогнозировать, как они расположатся в рейтинге после полноценного постобучения. Это позволяет сэкономить недели вычислений.
Почему это важно
Разработчики могут быстро оценивать модели и составлять их рейтинг без затрат на полноценное обучение, сосредоточившись на том, что модель действительно знает.
Источники и ссылки
| # | Источник | Издание | Дата | Главное |
|---|---|---|---|---|
| 1 | Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation ↗ | Aleph Alpha | 29 сент. 2026 г. |
1 источников
Обновлено:
Oossa · Рассылка
Неделя ИИ — простыми словами
Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.