欧洲AI公司Aleph Alpha进行了一项基准测试,向中国语言模型提出了967个有关政治敏感议题的问题。受测模型包括阿里巴巴的Qwen、DeepSeek和Moonshot AI的Kimi。研究人员认为,只有少数回答较为平衡;其余回答要么重复官方论述,要么避而不谈,要么直接表示无法回答。
中国模型与西方模型相比如何?
面对同一组禁忌问题,西方模型Claude Sonnet 5和Mistral Small给出平衡回答的比例分别为70 %和92 %。DeepSeek的V4 Pro拒绝回答约三分之二的问题,而Qwen和Kimi大多附和官方立场。即使问题与中国无关,Qwen有时也会在回答中顺带为北京的互联网政策辩护。
偏见为何出现
中国的AI法规要求面向公众的模型体现“社会主义核心价值观”。这一法律背景,加上训练数据中过度包含经官方认可的来源,导致模型将官方叙事内化。Aleph Alpha还指出,Nvidia的Nemotron Cascade 2在17 %的回答中也呈现出官方立场倾向;该公司将此归因于数千条由中国模型生成、后被用于训练的数据样本。
为什么重要
对中国用户而言,这种偏向意味着聊天机器人不太可能就重要政治议题提供中立信息,从而限制他们接触多元观点。对中国以外的用户来说,这种倾向也可能延伸到非政治类回答,潜移默化地影响人们对中国政策的看法。这项研究还表明,监管环境能够直接影响AI的行为;对于任何选择模型来开发面向公众应用的人来说,这一点都很重要。