Wie stark chinesische Modelle sensiblen Fragen ausweichen, hat die deutsche Firma Aleph Alpha mit 967 Themen systematisch vermessen. Wie The Decoder am 4. Oktober 2026 berichtete, wurden bei Fragen zu Tiananmen, Taiwan und Xinjiang nur 17 bis 41 Prozent der Antworten der getesteten chinesischen Modelle als ausgewogen bewertet. Der Rest wiederholte offizielle Positionen, wich aus oder verweigerte die Antwort.
So wurden die 967 Themen getestet
Getestet wurden Alibabas Qwen-Reihe, DeepSeek und Kimi von Moonshot AI. Aleph Alpha stellte die Themen von Hand zusammen und bewertete die Antworten mit einem eigenen KI-Bewertungssystem. Die auffälligste Strategie zeigte DeepSeek V4 Pro, das rund zwei Drittel der Fragen schlicht nicht beantwortete, also auf Schweigen setzte. Andere chinesische Modelle antworteten häufiger frontal, jedoch in Formulierungen entlang der offiziellen Linie.
Zum Vergleich: Anthropics Claude Sonnet 5 antwortete in 70 Prozent der Fälle ausgewogen, Mistral Small in 92 Prozent. Die Ergebnisse decken sich mit der Richtung der geltenden chinesischen KI-Regeln, die von öffentlich zugänglichen Modellen die Verkörperung sozialistischer Grundwerte verlangen. Bei sensiblen Themen ist die Haltung also kein Zufall eines einzelnen Modells.
Auch Fragen ohne China-Bezug biegen zurück
Bemerkenswerter ist der Übertragungseffekt. Auf eine Frage zur Zensur in den Vereinigten Staaten begann Qwen 3.6 mit einer scheinbar ausgewogenen Antwort und schloss dann mit einer Verteidigung der chinesischen Internet-Governance, sinngemäß: Viele Länder, darunter China, steuerten Informationen, um soziale Stabilität und nationale Sicherheit zu gewährleisten. Die Tendenz taucht also nicht nur bei direkt passenden Fragen auf, sondern sickert auch in die Schlusssätze scheinbar unverwandter Antworten.
Hinzu kommt ein Lieferkettenpfad. Laut Aleph Alpha zeigte Nvidias Nemotron Cascade 2 in 17 Prozent seiner Antworten ähnliche Muster, was die Firma auf rund 3.500 seiner 9,3 Millionen Trainingsbeispiele zurückführt, die von DeepSeek und Qwen erzeugt wurden. Wer mit synthetischen Daten chinesischer Modelle trainiert, destilliert womöglich deren Wertehaltung gleich mit in nachgelagerte Modelle.
Nicht ungeprüft übernehmen
Die Studie verdient einen Abschlag. Aleph Alpha verkauft selbst souveräne KI an Regierungen und konkurriert direkt mit den chinesischen Anbietern. Die Themenliste stammt von der Firma, die Bewertung lief über ihr eigenes System, und was als ausgewogen gilt, entscheidet letztlich die Prüferseite. Das Unternehmen hat zudem offengelegt, dass auch sein eigenes Modell Kolibri teils mit Daten chinesischer Modelle trainiert wurde.
Ein Abschlag ist aber keine Entwarnung. Für Unternehmen bei der Modellauswahl zählt der Praxistest: Kandidaten mit den tatsächlich sensiblen Fragen des eigenen Geschäfts prüfen, statt sich nur auf allgemeine Fähigkeitsranglisten zu verlassen. Ein Modell mit Spitzenwerten bei Code und Mathematik beantwortet Fragen zu bestimmten Regionen, Geschichte und Politik entlang einer Haltung, und ob ein Einsatzszenario diese Haltung tragen kann, ist die eigentliche Frage. Bei Produkten für Nutzer in mehreren Regionen gehört diese Prüfung in dieselbe Tabelle wie der Leistungstest.