OpenAIs o3 übertrifft GPT-5 in Büro-Benchmark-Studie

17.08.2025 | Allgemein, KI

Eine neue Studie zeigt, dass OpenAIs älteres Modell o3 in Büro-Szenarien überraschend stark abschneidet.

In Kürze

  • o3 übertrifft GPT-5 bei komplexen Aufgaben
  • Stärken in der Planung und Kontextarbeit
  • Schwächen bei der Koordination mehrerer Anwendungen

Benchmark-Studie OdysseyBench

In einer aktuellen Benchmark-Studie namens OdysseyBench wurden KI-Modelle in realistischen Büro-Szenarien getestet – und das über mehrere Tage hinweg. Das Ergebnis? OpenAIs älteres Modell o3 hat sich als überraschend leistungsstark erwiesen und schlägt sogar das neuere GPT-5.

Leistungsfähigkeit von o3

Besonders bei komplexen Aufgaben, die ein harmonisches Zusammenspiel von Anwendungen wie Word, Excel und E-Mail erfordern, zeigt o3 seine Stärken. Hier müssen die Modelle über längere Zeiträume hinweg planen und kontextbezogen arbeiten, was o3 offenbar besser gelingt.

Aufgedeckte Schwächen der KI-Modelle

Die Studie hat jedoch auch einige Schwächen der KI-Modelle aufgedeckt. Insbesondere bei der Planung, der Nutzung von Tools und der Verknüpfung von Informationen aus verschiedenen Kontexten hapert es noch. Diese Mängel treten besonders bei Aufgaben auf, die mehrere Schritte und Anwendungen erfordern. Die Koordination zwischen diesen Elementen bleibt eine Herausforderung, die es zu meistern gilt.

Ausblick auf die Technologieentwicklung

Die Ergebnisse der Untersuchung verdeutlichen, dass selbst fortschrittliche KI-Modelle noch nicht optimal für komplexe Büroarbeiten gerüstet sind. Es bleibt spannend zu beobachten, wie sich die Technologie weiterentwickelt und ob zukünftige Modelle diese Herausforderungen besser bewältigen können.

Quellen

  • Quelle: OpenAI
  • Der ursprüngliche Artikel wurde hier veröffentlicht
  • Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.

💡Über das Projekt KI News Daily

Dieser Artikel wurde vollständig mit KI generiert und ist Teil des Projektes KI News Daily der Pickert GmbH. Wir arbeiten an der ständigen Verbesserung der Mechanismen, können aber leider Fehler und Irrtümer nicht ausschließen. Sollte dir etwas auffallen, wende dich bitte umgehend an unseren Support und feedback[at]pickert.io

Vielen Dank! 🙏

Du möchtest deine Prozesse optimieren und automatisieren?

KI News Daily ist unser Showcase für Automatisierung. Wir nutzen unterschiedlichste Technologien, je nachdem, welches Prozessproblem du lösen möchtest. Ins Thema einsteigen kannst du beispielsweise mit unserer KI-Reifegradanalyse.

Aktuelle KI-News auf dem Blog

Suno nach Urteil: Maßnahmen gegen KI-generierte Song-Kopien

Suno nach Urteil: Maßnahmen gegen KI-generierte Song-Kopien

Deutsches Gericht sieht Urheberrechtsverstöße beim Suno-Training. Suno kündigt Leitprinzipien, Prüfpartner und Kennzeichnungslösungen an.In KürzeGericht: geschützte Songs im Training; Fair Use greift nichtSuno: vier Leitprinzipien, keine Künstlernamen in...