Aleph Alpha-Studie: Politische Voreingenommenheit bei LLMs — China‑Spillover sichtbar

05.10.2026 | Allgemein, KI

Aleph Alpha prüfte 967 politisch sensible Fragen in chinesischen und westlichen Sprachmodellen. Ausgewogene Antworten sind selten.

In Kürze

  • Nur 17–41% der Antworten neutral
  • Pro‑China‑Tendenzen auch ohne Nennung Chinas
  • Trainingsdaten können CCP‑Muster weitergeben

Aleph Alpha hat chinesische und westliche Sprachmodelle auf ihre politische Neutralität geprü­ft — mit durchwachsenen Ergebnissen. In einem Benchmark wurden 967 politisch sensible Themen (etwa Tiananmen, Taiwan, Xinjiang) mehreren Modellen vorgelegt. Nur zwischen 17 und 41 Prozent der Antworten kamen laut Studie ausgeglichen daher; der Rest reproduzierte staatliche Positionen, lenkte ab oder verweigerte die Antwort.

Wie getestet wurde und welche Modelle dabei waren

Getestet wurden unter anderem:

  • Alibaba Qwen (Versionen wie Qwen 3.6 werden explizit genannt)
  • DeepSeek V4 Pro
  • Moonshot AI (Kimi)

Zum Vergleich liefen westliche Modelle wie Claude Sonnet 5 und Mistral Small mit — und lieferten laut Aleph Alpha fast durchweg ausgewogenere Antworten. DeepSeek V4 Pro verweigerte bei rund zwei Dritteln der politisch sensiblen Fragen eine direkte Antwort.

Was bei unpolitischen Fragen passierte

Bei allgemeinen, nicht-politischen Anfragen zeigten die chinesischen Modelle überwiegend ausgeglichene Antworten. Dennoch blieb bei einzelnen Modellen — etwa Qwen 3.6 und DeepSeek V4 Pro — eine leichte Pro‑China‑Tendenz sichtbar.

Spillover‑Effekt: Wenn China nicht einmal Thema ist

Die Studie dokumentiert auch einen sogenannten Spillover‑Effekt: Eine Pro‑China‑Haltung kann auftreten, selbst wenn China gar nicht explizit genannt wird. Als Beispiel nennt Aleph Alpha eine Frage zur Zensur in den USA: Qwen 3.6 begann ausgewogen, endete aber mit einer Passage, die Chinas Informationspolitik rechtfertigte. Eine frühere Analyse des CEIAS hatte Ähnliches festgestellt: Begriffe wie Menschenrechte oder Überwachung lösten bei einigen chinesischen Modellen häufig Pekinger Standardformulierungen aus, etwa die Erwähnung von „Nichteinmischung in innere Angelegenheiten“.

Datenherkunft und mögliche Nebenwirkungen

Aleph Alpha weist darauf hin, dass Trainingsdaten, die von chinesischen Modellen erzeugt wurden und später wiederverwendet werden, CCP‑nahe Muster transportieren können. Als Beispiel nennen die Forschenden Nvidias Nemotron Cascade 2: In 17 Prozent der getesteten Fälle zeigten die Ausgaben parteitreue Muster. Diese wurden auf etwa 3.500 von 9,3 Millionen Trainingszeilen zurückgeführt, die mit DeepSeek und Qwen erzeugt worden seien. In einem konkreten Test verweigerte ein Modell das Schreiben einer Rede zur Anerkennung Taiwans und lieferte stattdessen einen patriotischen Gegentext, der das Ein‑China‑Prinzip verteidigte.

Wirtschaftliche Interessen und Positionierung

Aleph Alpha selbst positioniert sich — zusammen mit Cohere — als Anbieter „souveräner KI“ für Regierungen, also als Alternative zu US‑Anbietern. Das Marktinteresse, Unterschiede zwischen Modellen herauszustellen, nennt die Studie offen als relevantes Motiv.

Breitere Bedeutung und politische Effekte

Die Untersuchungen fassen Forschende so zusammen: Sprachmodelle spiegeln kulturelle und politische Einstellungen ihrer Trainingsdaten wider und lassen sich durch die Auswahl dieser Daten gezielt prägen. Wiederholte, homogene Ausgaben könnten demnach Denkweisen und Ausdrucksformen von Nutzerinnen und Nutzern beeinflussen. Parallelen zieht die Studie zur US‑Szene: Berichten zufolge wurde etwa Elon Musks Grok so angepasst, dass es tendenziell rechtsgerichtetere Antworten produzieren soll.

Was das für Europa heißt

Aleph Alpha weist darauf hin, dass in Europa — solange es an ausreichend vielen eigenen Modellen mit europäischen Wertvorstellungen fehlt — die praktische Auswahl bei Behörden und Unternehmen zwischen fremden Wertesystemen stehen könnte, etwa einer US‑amerikanischen oder einer chinesischen Ausrichtung.

Quellen

  • Quelle: Aleph Alpha
  • Der ursprüngliche Artikel wurde hier veröffentlicht
  • Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.

💡Über das Projekt KI News Daily

Dieser Artikel wurde vollständig mit KI generiert und ist Teil des Projektes KI News Daily der Pickert GmbH. Wir arbeiten an der ständigen Verbesserung der Mechanismen, können aber leider Fehler und Irrtümer nicht ausschließen. Sollte dir etwas auffallen, wende dich bitte umgehend an unseren Support und feedback[at]pickert.io

Vielen Dank! 🙏

Du möchtest deine Prozesse optimieren und automatisieren?

KI News Daily ist unser Showcase für Automatisierung. Wir nutzen unterschiedlichste Technologien, je nachdem, welches Prozessproblem du lösen möchtest. Ins Thema einsteigen kannst du beispielsweise mit unserer KI-Reifegradanalyse.

Aktuelle KI-News auf dem Blog