Runway will Videos live aufbauen: Eingabe steuert Frames sofort statt warten. GWM‑1 und Solaris erzeugen Bild- und UI-Frames; Demo mit Nvidia zeigte ersten Frame unter 100 ms.
In Kürze
- Frame-für-Frame-Generierung erlaubt direkte Steuerung während der Wiedergabe
- GWM-1 und Solaris erzeugen Szenen- und Benutzeroberflächen-Frames
- Fehlerakkumulation und niedrige Latenz sind die größten technischen Hürden
Stell dir vor, du sprichst oder tippst einen Befehl — und das Video baut sich sofort live auf. Genau daran arbeitet Runway: statt Prompt eintippen, warten und Ergebnis anschauen, sollen Nutzer:innen Videos in Echtzeit streamen und während der Eingabe direkt steuern.
Wie es heute läuft
Der aktuelle Ablauf ist simpel, aber zeitraubend: Prompt eingeben, Sekunden bis Minuten warten, Ergebnis ansehen. Gefällt’s nicht, von vorn. Das kostet Zeit und viele Iterationen. Runways Ansatz will den Zeitraum bis zum ersten Frame drastisch verkürzen und das Video laufend ausliefern, sodass du sofort eingreifen kannst.
Die Technik dahinter
Runway baut auf dem sogenannten General World Model (GWM) auf. GWM-1 wurde im Dezember 2025 vorgestellt und baut auf dem Gen-4.5-Modell auf. Diese Modelle erzeugen Video Frame für Frame — jeweils ein Einzelbild der Wiedergabe — und reagieren auf Eingaben wie Kamerabewegungen, Roboterbefehle oder Audio. Zusätzlich präsentierte Runway Solaris, ein System, das Benutzeroberflächen ebenfalls Frame für Frame erzeugt und auf Klicks oder Sprache reagiert.
Zentrales Problem: Fehler akkumulieren
Bei Video hängt jeder Frame vom vorherigen ab. Kleine Bildfehler können sich über Zeit aufsummieren und zu größeren Verformungen führen — ein Unterschied zu Textmodellen, bei denen sich leicht mitten im Satz korrigieren lässt. Runways Trainingskniff: das Modell verarbeitet seine eigenen Ausgaben wieder, damit es lernt, eigene Abweichungen zu erkennen und zu korrigieren, statt sie zu verstärken.
Wie andere daran arbeiten
Ähnliche Ideen gibt es daneben: Das Start-up Decart trainierte MirageLSD, ein Echtzeit-Modell, das absichtlich mit fehlerhaften Bildern konfrontiert wurde. Google DeepMind meldet bei Genie 3, dass interaktive Welten mit 24 Bildern pro Sekunde in 720p über mehrere Minuten konsistent bleiben können.
Rechenaufwand verschiebt sich
Echtzeit-Generierung verlagert Rechenarbeit vom Training in die Nutzung: das Modell muss während der Wiedergabe schnell genug jedes Frame liefern — oft auf Hardware, die von mehreren Sitzungen geteilt wird. Das bedeutet kürzere Wartezeiten für Nutzer:innen, aber höhere Anforderungen an Latenz und Durchsatz bei der Inferenz.
Anwendungsfelder
Runway sieht vor allem interaktive Anwendungen als Ziel: Bildung, Gaming und Robotik — überall dort, wo Video in menschlichem Tempo reagieren muss. Für das Training von Robotern oder autonomen Fahrzeugen sind Echtzeit-Umgebungen wichtig, weil sie sofort auf seltene oder kritische Situationen reagieren können. Runway bietet dafür eine GWM-Robotics-Variante zur Erzeugung synthetischer Trainingsdaten. Auch Waymo arbeitet in diese Richtung mit seinem Waymo World Model (auf Basis von Genie 3), um seltene Verkehrssituationen — von Elefanten auf der Straße bis zu Überschwemmungen — in Simulation zu erzeugen und so Milliarden von virtuellen Trainingsmeilen zu generieren.
Demo mit Nvidia
Auf Nvidias GTC zeigte Runway zusammen mit Nvidia eine Forschungsvorschau eines Echtzeit-Modells auf der Vera-Rubin-Plattform, das den ersten Frame in unter 100 Millisekunden liefern soll. Einen Veröffentlichungstermin nannte Runway nicht.
Quellen
- Quelle: Runway
- Der ursprüngliche Artikel wurde hier veröffentlicht
- Dieser Artikel wurde im Podcast KI-Briefing-Daily behandelt. Die Folge kannst du hier anhören.




