# Геометрическая оценка повышает точность ответов языковых моделей

> Новый метод выявляет направление в скрытых состояниях модели, которое ранжирует ответы на 52 пункта лучше стандартной оценки по вероятности.

Oossa · 2026-10-06 · https://oossa.com/ru/geometric-scoring-boosts-answer-correctness-in-language-models

Исследователи обнаружили, что большие языковые модели хранят геометрический признак правильности ответа. Вычислив средний сдвиг скрытых состояний при переходе от неправильных ответов к правильным, можно получить вектор оценки, который ранжирует варианты без дополнительного дообучения. В испытаниях на пяти моделях с 1 миллиардом–8 миллиардами параметров этот метод превзошёл стандартный подход с нулевым числом примеров, основанный на логарифмической вероятности, на 32 пункта в тестах ARC‑Challenge и MMLU и на 52 пункта в TruthfulQA.

## Как работает метод

Авторы берут пятьдесят размеченных примеров, пропускают их через модель, собирают скрытые представления примерно в середине сети и вычисляют средний вектор, направленный от состояний с неправильными ответами к состояниям с правильными. При использовании модели достаточно одного прямого прохода для каждого варианта ответа и одного скалярного произведения с этим вектором. Текст ответа не генерируется, параметры модели не меняются.

## Что это значит для надёжности моделей

В качестве детектора галлюцинаций геометрический метод достигает AUROC 0.693 против 0.578 у стандартной оценки по вероятности. Исследование также показывает, что признаки правильности при фактических рассуждениях, владении предметными знаниями и правдивости занимают почти ортогональные подпространства. Это означает, что модели хранят отдельные сигналы для разных видов правильности. Возможно, этим объясняется, почему модели часто знают правильный ответ, но не выдают его.

## Факты

- Метод повышает точность оценки без примеров на ARC‑Challenge и MMLU до +32.0 процентного пункта.
- В TruthfulQA прирост составляет от +38.1 до +51.8 процентного пункта.
- В испытаниях участвовали пять моделей с 1 B–8 B параметров из трёх семейств: Llama, Qwen и Gemma.
- Достаточно пятидесяти размеченных примеров; параметры модели не обновляются.
- В качестве детектора галлюцинаций метод показывает AUROC 0.693 против 0.578 у оценки по логарифмической вероятности.

## Почему это важно

Для обычных пользователей этот метод может сделать ответы чат-ботов надёжнее, особенно на фактические вопросы. Он также предлагает способ выявлять вероятные галлюцинации без больших вычислительных затрат. Однако для этого по-прежнему нужен доступ к скрытым состояниям модели, которые не предоставляет большинство общедоступных API.

## Источники и ссылки

1. [Correctness Is a Direction: Geometric Answer Selection in Language Models](https://arxiv.org/abs/2610.04512) – arXiv, 2026-10-06

Обновлено: 2026-10-06
