欧州のAI企業Aleph Alphaは、中国語のAIモデルに政治的に敏感なテーマについて967の質問をするベンチマーク調査を実施した。対象となったのはAlibabaのQwen、DeepSeek、Moonshot AIのKimi。回答のうちバランスが取れていると評価されたものはごく一部で、残りは政府の公式見解を繰り返すか、話をそらすか、回答できないと述べた。
中国のモデルは欧米のモデルとどう違うのか
同じタブー視される質問に対し、欧米のモデルであるClaude Sonnet 5とMistral Smallは、それぞれ70 %、92 %の割合でバランスの取れた回答をした。DeepSeekのV4 Proは質問の約3分の2への回答を拒み、QwenとKimiはおおむね党の見解を繰り返した。中国についての質問ではない場合でも、Qwenは回答に北京のインターネット政策を擁護する内容を差し込むことがあった。
偏りが生じる理由
中国のAI規制では、一般向けモデルに「社会主義の核心的価値観」を反映することが求められている。こうした法的背景に加え、政府公認の情報源に偏った学習データによって、モデルは公式見解を内面化していく。Aleph Alphaはまた、NvidiaのNemotron Cascade 2も回答の17 %で党の見解に沿う傾向を示したと指摘した。同社によると、その原因は、中国のモデルが生成した数千件の学習例にあった。
なぜ重要か
中国のユーザーにとって、こうした偏りは、重要な政治問題についてチャットボットから中立的な情報を得にくくし、多様な視点へのアクセスを制限する。中国以外でも、この傾向が政治以外の回答に入り込み、中国の政策に対する認識を目立たない形で左右する可能性がある。またこの調査は、規制環境がAIの振る舞いを直接方向づけることを示しており、一般向けサービスに使うモデルを選ぶ際にも重要な意味を持つ。