Feldstudie aus Shanghai: Agenten-KI hilft häufig, entscheidet aber selten die Richtung; steigende Delegation birgt Aufsichtsrisiken.
In Kürze
- KI in 96,5% der Aufgaben eingesetzt
- Menschen treffen 85–93% der Endentscheidungen
- Delegation steigt, Kontrolle kann schwinden
Wer entscheidet, wenn KI-Agenten mitarbeiten?
Eine neue Feldstudie aus Shanghai liefert konkrete Zahlen — und zeigt ein Bild, das viele vielleicht so nicht erwartet hätten.
Fudan-Forscher:innen protokollierten mehr als 700 Aufgabenprotokolle von 56 Teilnehmenden plus umfassende Agenten-Logs. Als Fallbeispiel nutzten sie „Atria Dawn Preview“, ein agentisches Sprachmodell auf Basis eines Mixture-of-Experts‑Systems mit 744 Milliarden Parametern. Kurz gesagt: statt eines Monolithen arbeiten mehrere spezialisierte Teilnetzwerke zusammen; die Zahl der Parameter gibt die Modellgröße an. Das Modell lief in einer Pipeline, die Ergebnisse mit echten Ausführungsumgebungen, Werkzeugaufrufen, Zwischenresultaten sowie Tests, Metriken und Quellenbelegen verknüpft. Auf 5 von 16 Benchmarks war Atria Dawn vorne (etwa Websuche und Cybersicherheit), insgesamt aber kein klarer Spitzenreiter gegenüber Konkurrenzsystemen.
Wie oft und wie intensiv wurde die KI genutzt?
- KI kam in 96,5 % der geprüften Aufgaben zum Einsatz.
- Die Delegation an Agenten nahm binnen vier Wochen deutlich zu: Das Verhältnis Agenten-Aktionen zu menschlichen Eingaben kletterte vom Median 11 auf 28,5. Die Forschenden betonen: Das bedeutet nicht automatisch mehr Autonomie — vielmehr verteilten sich menschliche Entscheidungen über mehr Agenten-Schritte hinweg.
- Von 455 abgeschlossenen, KI-gestützten Aufgaben wurden 151 (gut ein Drittel) als ohne KI nicht machbar eingeschätzt. Diese Fälle betrafen 27 der 56 Teilnehmenden — also nicht nur ein paar Power-User. KI ermöglichte hier also Arbeiten, die sonst nicht angegangen worden wären.
Wer schlägt vor, wer entscheidet?
- Häufigstes Muster: „KI macht Vorschläge, Mensch wählt“ (55,4 %).
- Bei Methoden und Parametern trafen Menschen 85,5 % der Endentscheidungen; die KI nur 9,2 %. Bei Zielen und Umfang lag der menschliche Anteil bei 93,4 %.
- Der Anteil der KI an Vorschlägen schwankte je nach Entscheidungsart zwischen 17 und 55 %, ihr Anteil an finalen Entscheidungen blieb jedoch durchweg einstellig. Selbst bei den 151 als unverzichtbar bewerteten Aufgaben wählten Menschen in 95,4 % der Fälle das Ziel. Fazit dieser Beobachtung: KI generiert Optionen, Menschen bestimmen die Richtung.
Wie reagierten Menschen bei Problemen und Überarbeitungen?
- Von 588 Aufgaben mit vermerkter Schwierigkeit wurden 76 % durch menschliches Eingreifen vorangebracht; in 23 % löste der Agent das Problem allein.
- Menschliche Hilfe bestand meist aus Kontext und geklärten Anforderungen (35,2 %) oder aus Diagnosen und Methodenwechseln (34,7 %). Direkte Handarbeit durch Menschen war selten (Teilbearbeitungen 3,2 %, komplette Übernahmen 0,7 %).
- Bei Überarbeitungen setzte die KI in 75,4 % der Fälle Änderungen selbst um, nachdem Menschen Feedback gegeben hatten — Menschen lieferten also überwiegend das Urteil, die KI die Umsetzung.
Einordnung der Forschenden und eine Warnung
Die Autor:innen skizzieren drei Entwicklungsphasen: KI zunächst als Forschungsobjekt, dann als Ausführende einzelner Aufgaben und aktuell als Projektpartnerin, die innerhalb menschlich gesetzter Ziele Pläne entwirft und anpasst. Eine mögliche vierte Phase wäre rekursive Selbstverbesserung — also KI, die stärkere Nachfolger entwirft. Unklar bleibt, ob Systeme zuverlässig vielfältige Forschungsrichtungen erzeugen und deren Wert einschätzen können, bevor Ergebnisse vorliegen.
Ein zentrales Risiko: Wenn Entscheidungen auf langen Ketten von Agenten-Arbeit beruhen, die Menschen nicht mehr vollständig prüfen können, wird Aufsicht schwierig. Im schlimmsten Fall bleiben Menschen nur noch als Abnickende übrig. Viele Teilnehmende ließen Agenten im autonomen Modus laufen, um lange Prozesse nicht ständig unterbrechen zu müssen — eine Grenze, die eher aus Bequemlichkeit als aus bewusster Abwägung der KI-Autorität gezogen wurde.
Einordnung in die laufende Debatte
Die Studie erscheint in eine Zeit intensiver Diskussionen über rekursive Selbstverbesserung. Anbieter und Forschungsteams gehen unterschiedlich vor: Anthropic schätzt die Möglichkeit schneller ein und sieht künftig nur noch einen einstelligen Anteil an menschlichen Richtungsentscheidungen, worauf Unternehmenschef Dario Amodei ein Tempolimit forderte. OpenAI setzt etwa GPT‑5.6 Sol breit im Entwicklungszyklus ein; Google und DeepMind lassen mit „Dream‑RSI“ Agenten alternative Strategien in aufgezeichneten Suchverläufen durchspielen — primär, um Suchstrategien zu verbessern, nicht um das Modell selbst zu verändern.
Kurzum
In der Praxis produziert die KI viele Optionen und übernimmt viel Ausführung — die endgültigen Richtungsentscheidungen und der Kontext kommen aber nach wie vor überwiegend von Menschen. Gleichzeitig warnen die Forschenden davor, dass Routine und Bequemlichkeit die Kontrolle schwächen können, wenn komplexe Agentenketten ohne ausreichende Prüfung laufen.
Quellen
- Quelle: Fudan University / Atria Team
- Der ursprüngliche Artikel wurde hier veröffentlicht
- Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.




