GPT‑4o verbessert Studententexte – Noten steigen, aber Wissen unklar

31.08.2026 | Allgemein, KI

Randomisierte Bocconi‑Studie: GPT‑4o poliert Texte und hebt Noten – bleibt Verständnis gleich?

In Kürze

  • GPT‑4o erhöht Noten im Schnitt fast um einen Punkt
  • Kausale Unterrichtseinheit fördert originellere, falsifizierbare Ideen
  • Unklar, ob bessere Noten echtes Wissen oder nur besseren KI‑Output zeigen

GPT‑4o macht Texte polierter — ob die Köpfe dahinter mehr wissen, ist offen

Was passiert, wenn Erstsemester Zugang zu einer aktuellen ChatGPT‑Version bekommen? Eine randomisierte Studie an der Bocconi University liefert jetzt konkrete Zahlen: Im November 2025 bearbeiteten 1.053 Studierende in 13 Klassen dieselbe Aufgabe und wurden zufällig einer von vier Gruppen zugeteilt — Kontrollgruppe, eine kurze Unterrichtseinheit zum kausalen Denken, Zugang zu GPT‑4o oder beides zusammen. Die Aufgabe: bis zu 180 Wörter mit Marketing‑Empfehlungen für den Uni‑Merchandise‑Shop.

Wie die Studie durchgeführt wurde

Die Randomisierung passierte auf Klassenebene; alle Teilnehmenden schrieben dieselbe kurze Textaufgabe. Neben der Punktebewertung (Skala 1–5) analysierten die Forschenden weitere Merkmale der Texte: Anzahl und Vielfalt von Ideen, logische Kohärenz, Nähe zu Fachlektoratsempfehlungen und typische Textmerkmale. Einige dieser Merkmale wurden mithilfe von Modellen automatisiert bewertet.

Die wichtigsten Resultate

  • GPT‑4o hebt die Punktzahl deutlich an: Arbeiten, bei denen die KI genutzt wurde, lagen im Schnitt fast einen Punkt höher auf der 1–5‑Skala als die Kontrollgruppe. Solche Texte enthielten im Durchschnitt rund zwei zusätzliche Ideen, wirkten kohärenter und ähnelten stärker den Empfehlungen von Expert:innen. Selbst nachdem Unterschiede in Argumentationsdichte, Ideenanzahl, Vielfalt und Textmerkmalen statistisch berücksichtigt wurden, blieb ein Vorteil für die KI‑Nutzer:innen bestehen. Die Autor:innen sehen das als Hinweis darauf, dass die KI den Output qualitativ verbessert hat — nicht unbedingt auf mehr Wissen der Studierenden.
  • Die Unterrichtseinheit zum kausalen Denken veränderte die klassische Punktzahl nicht positiv; die Arbeiten schnitten leicht schlechter ab. Dafür schrieben Studierende, die die Einheit besucht hatten, öfter aus, warum eine Maßnahme wirken sollte, unter welchen Bedingungen sie scheitern könnte, und lieferten vielfältigere sowie originellere Ideen. Falsifizierbarkeit — also Ideen so zu formulieren, dass man sie widerlegen könnte — trat häufiger auf.
  • Kombinationseffekt: Die Verbindung aus Unterrichtseinheit und KI brachte keinen zusätzlichen Gewinn auf der klassischen Bewertungsskala. Bei Merkmalen des kausalen Denkens ergänzten sich die Effekte jedoch; die gesteigerte Ideenvielfalt der Unterrichtseinheit blieb auch mit KI bestehen.

Was die Ergebnisse zeigen — und was nicht

Die Studie legt nahe, dass herkömmliche Bewertungssysteme konventionelle, gut strukturierte und erwartbare Antworten bevorzugen. Wer origineller denkt oder stärker auf Falsifizierbarkeit setzt, bekam tendenziell schlechtere Noten. KI kann genau jene Texteigenschaften verbessern, die solche Benotungssysteme belohnen — aber die Studie prüft nicht, ob dadurch langfristig mehr verstanden oder behalten wurde. Die Studierenden mussten die Inhalte nicht später ohne KI demonstrieren; ob bessere Noten echtes Verständnis widerspiegeln oder primär besseren KI‑Output, bleibt offen.

Einschränkungen und Interessenkonstellationen

Die Ergebnisse gelten für eine einzelne Universität, eine konkrete Aufgabe und Erstsemester. Einige Messgrößen basieren auf Modellanalysen. OpenAI stellte die untersuchte Technologie bereit und war an der Studie beteiligt; mehrere Autor:innen hatten Verbindungen zu OpenAI. Diese Kontexte nennen die Forschenden selbst als Einschränkungen.

Weitere Befunde aus der Forschungsliteratur

Die Bocconi‑Studie reiht sich in ein Bild ein, das andere Analysen ebenfalls zeichnen: Eine große US‑Auswertung mit mehr als 500.000 Hochschulnoten fand nach dem Erscheinen von ChatGPT vor allem in Kursen mit viel Schreiben, Programmieren oder Hausaufgaben mehr Spitzenbewertungen. Kontrollierte Experimente zeigten jedoch, dass Teilnehmer:innen ohne KI schlechter abschnitten, wenn ihnen die KI zuvor direkte Antworten geliefert hatte. Eine 30‑monatige Längsschnittstudie in China mit über 26.000 Schülern zeigte, dass Hausaufgaben schneller und besser erledigt wurden, die Klausurleistungen aber zurückgingen; bei lateren Aufnahmeprüfungen lagen die Ergebnisse 18–24 Prozent niedriger. Schüler, die trotz KI ähnlich viel Zeit für Hausaufgaben aufwandten wie Nicht‑Nutzer, zeigten keine Einbußen.

Was Forscher:innen daraus ableiten

Aus der Studie und dem weiteren Forschungsstand leiten die Autor:innen ab, dass es nicht allein auf den Einsatz von KI ankommt, sondern darauf, ob sie eigenes Denken unterstützt oder ersetzt. In der Publikation heißt es, Prüfungen und Bewertungskriterien müssten angepasst werden, wenn Originalität, eigenständiges Denken und das Abwägen verschiedener Ansätze stärker honoriert werden sollen — statt ausschließlich die am besten polierten, konventionellen Antworten zu belohnen.

Quellen

  • Quelle: Bocconi University / OpenAI
  • Der ursprüngliche Artikel wurde hier veröffentlicht
  • Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.

💡Über das Projekt KI News Daily

Dieser Artikel wurde vollständig mit KI generiert und ist Teil des Projektes KI News Daily der Pickert GmbH. Wir arbeiten an der ständigen Verbesserung der Mechanismen, können aber leider Fehler und Irrtümer nicht ausschließen. Sollte dir etwas auffallen, wende dich bitte umgehend an unseren Support und feedback[at]pickert.io

Vielen Dank! 🙏

Du möchtest deine Prozesse optimieren und automatisieren?

KI News Daily ist unser Showcase für Automatisierung. Wir nutzen unterschiedlichste Technologien, je nachdem, welches Prozessproblem du lösen möchtest. Ins Thema einsteigen kannst du beispielsweise mit unserer KI-Reifegradanalyse.

Aktuelle KI-News auf dem Blog