Het Europese AI-bedrijf Aleph Alpha voerde een benchmark uit met 967 vragen over politiek gevoelige onderwerpen aan Chinese taalmodellen. De onderzochte modellen waren Qwen van Alibaba, DeepSeek en Kimi van Moonshot AI. Slechts een klein deel van de antwoorden werd als evenwichtig beoordeeld; de rest herhaalde officiële standpunten, week uit of zei simpelweg geen antwoord te kunnen geven.
Hoe verhouden de Chinese modellen zich tot westerse?
Bij dezelfde reeks taboevragen gaven de westerse modellen Claude Sonnet 5 en Mistral Small respectievelijk 70 % en 92 % van de tijd evenwichtige antwoorden. DeepSeek’s V4 Pro weigerde ongeveer twee derde van de vragen te beantwoorden, terwijl Qwen en Kimi vooral de partijlijn herhaalden. Zelfs bij vragen die niet over China gingen, verwerkte Qwen soms een verdediging van het internetbeleid van Peking in het antwoord.
Waarom de vooringenomenheid ontstaat
Chinese AI-regels verplichten modellen die voor het publiek toegankelijk zijn om de ‘socialistische kernwaarden’ uit te dragen. Die wettelijke context en trainingsdata waarin door de staat goedgekeurde bronnen oververtegenwoordigd zijn, zorgen ervoor dat de modellen officiële narratieven internaliseren. Aleph Alpha merkte ook op dat Nvidia’s Nemotron Cascade 2 in 17 % van de antwoorden patronen van de partijlijn vertoonde. Volgens het bedrijf was dat terug te voeren op enkele duizenden trainingsvoorbeelden die zelf door Chinese modellen waren gegenereerd.
Waarom het ertoe doet
Voor gebruikers in China betekent deze vooringenomenheid dat chatbots waarschijnlijk geen neutrale informatie geven over belangrijke politieke kwesties, waardoor de toegang tot uiteenlopende standpunten wordt beperkt. Buiten China kan die neiging ook doorsijpelen in antwoorden op niet-politieke vragen en zo de beeldvorming over Chinees beleid subtiel beïnvloeden. Het onderzoek laat bovendien zien dat regelgeving de werking van AI rechtstreeks kan sturen. Dat is van belang voor iedereen die een model kiest voor toepassingen gericht op het publiek.