Европейская ИИ-компания Aleph Alpha провела тестирование китайских языковых моделей: им задали 967 вопросов на политически чувствительные темы. В проверке участвовали Qwen от Alibaba, DeepSeek и Kimi от Moonshot AI. Сбалансированными признали лишь немногие ответы. Остальные повторяли официальные тезисы, уклонялись от ответа или прямо заявляли, что не могут ответить.
Как китайские модели сравниваются с западными?
На том же наборе запретных вопросов западные модели Claude Sonnet 5 и Mistral Small давали сбалансированные ответы в 70 % и 92 % случаев соответственно. DeepSeek V4 Pro отказывалась отвечать примерно на две трети вопросов, а Qwen и Kimi в основном повторяли партийную линию. Даже отвечая на вопросы, не связанные с Китаем, Qwen порой вставляла в ответ защиту интернет-политики Пекина.
Почему возникает предвзятость
Китайские правила регулирования ИИ требуют, чтобы модели, доступные широкой публике, отражали «основные социалистические ценности». Это требование в сочетании с обучающими данными, в которых преобладают одобренные государством источники, приводит к тому, что модели усваивают официальные нарративы. Aleph Alpha также отметила, что Nvidia Nemotron Cascade 2 демонстрировала партийную риторику в 17 % ответов. По оценке компании, причина — несколько тысяч обучающих примеров, созданных самими китайскими моделями.
Почему это важно
Для пользователей в Китае такая предвзятость означает, что чат-боты вряд ли предоставят нейтральную информацию по важным политическим вопросам, ограничивая доступ к разным точкам зрения. За пределами Китая эта тенденция может проявляться и в ответах на неполитические вопросы, незаметно влияя на восприятие политики страны. Исследование также показывает, что нормативная среда может напрямую влиять на поведение ИИ, — это важно для всех, кто выбирает модель для публичных сервисов.