أجرت شركة الذكاء الاصطناعي الأوروبية Aleph Alpha اختبارًا مرجعيًا طرح 967 سؤالًا عن قضايا سياسية حساسة على نماذج لغوية صينية. وشملت النماذج التي خضعت للاختبار Qwen من Alibaba وDeepSeek وKimi من Moonshot AI. ولم تُقيّم سوى نسبة ضئيلة من الإجابات على أنها متوازنة؛ أما البقية فكررت نقاط الحديث الرسمية، أو راوغت، أو اكتفت بالقول إنها لا تستطيع الإجابة.
كيف تقارن النماذج الصينية بنظيراتها الغربية؟
عند طرح الأسئلة المحظورة نفسها، قدم النموذجان الغربيان Claude Sonnet 5 وMistral Small إجابات متوازنة في 70 % و92 % من الحالات، على التوالي. وامتنع DeepSeek’s V4 Pro عن الإجابة عن نحو ثلثي الأسئلة، في حين كرر Qwen وKimi في الغالب خطاب الحزب. وحتى عندما لم يكن السؤال متعلقًا بالصين، كان Qwen أحيانًا يدرج دفاعًا عن سياسات بكين للإنترنت ضمن إجابته.
لماذا يظهر هذا الانحياز؟
تُلزم اللوائح الصينية للذكاء الاصطناعي النماذج الموجهة للجمهور بأن تعكس «القيم الاشتراكية الجوهرية». ويؤدي هذا الإطار القانوني، إلى جانب بيانات التدريب التي تفرط في تمثيل المصادر المعتمدة من الدولة، إلى استبطان النماذج للروايات الرسمية. وأشارت Aleph Alpha أيضًا إلى أن Nemotron Cascade 2 من Nvidia أظهر أنماطًا تكرر خطاب الحزب في 17 % من الإجابات، وعزت الشركة ذلك إلى بضعة آلاف من أمثلة التدريب التي أنشأتها نماذج صينية.
لماذا يهم
بالنسبة إلى المستخدمين في الصين، يعني هذا الانحياز أن احتمال حصولهم على معلومات محايدة بشأن قضايا سياسية أساسية من روبوتات الدردشة ضعيف، ما يحد من وصولهم إلى وجهات نظر متنوعة. وخارج الصين، قد يمتد هذا التوجه إلى إجابات غير سياسية، فيؤثر بصورة خفية في التصورات عن السياسات الصينية. وتُظهر الدراسة أيضًا أن الأطر التنظيمية يمكن أن توجه سلوك الذكاء الاصطناعي مباشرة، وهو أمر يهم كل من يختار نموذجًا لتطبيقات موجهة للجمهور.