Physical AI mit RynnBrain und Qwen-Robot Wie Weltmodelle Roboter handeln lassen

Ein Gastbeitrag von Xiong-Hui Chen 5 min Lesedauer

Anbieter zum Thema

Sprachmodelle können Handlungen erklären, aber keine Roboter steuern. Weltmodelle sollen Zustandsänderungen der physischen Umgebung berechnen und dadurch Wahrnehmung, Planung und Aktion verbinden. Entscheidend sind dabei nicht nur Modellarchitekturen, sondern kompatible Trainingsdaten aus unterschiedlichen Maschinen.

Ein Weltmodell soll dem Roboter nicht nur erklären, wie er einen Becher greift, sondern auch die Folgen seiner Bewegung berechnen.(Bild:  Midjourney / KI-generiert)
Ein Weltmodell soll dem Roboter nicht nur erklären, wie er einen Becher greift, sondern auch die Folgen seiner Bewegung berechnen.
(Bild: Midjourney / KI-generiert)

Künstliche Intelligenz (KI) ist mittlerweile in der Lage, Software zu schreiben, Verträge zu analysieren und komplexe Szenen mit bemerkenswerter Genauigkeit zu beschreiben. Fragt man sie, wie man einen roten Becher von der Küchentheke nimmt und ihn in ein Regal stellt, liefert sie eine absolut schlüssige Abfolge von Schritten.

Es gibt dabei aber einen Haken. Darin liegt eine der zentralen Herausforderungen für die nächste Entwicklungsphase der KI. Ein Modell, das diese Schritte beschreiben kann, ist noch nicht in der Lage, die motorischen Befehle zu erzeugen, um sie auszuführen. Die physische Welt zu verstehen ist nicht dasselbe wie in ihr zu handeln.

Aus diesem Grund rücken Weltmodelle zunehmend ins Zentrum der KI-Debatte. Weltmodelle sind Systeme, die Maschinen dabei helfen sollen, sich ein internes Bild davon zu machen, wie die physische Realität funktioniert – wie sich Objekte bewegen, wie sich der Raum verändert und wie Handlungen zu wahrscheinlichen Folgeereignissen führen. Deloittes Studie „Enterprise AI 2026“ deutet darauf hin, dass bereits ein operativer Wandel im Gange ist. Dabei entwickeln sich Weltmodelle zu einer praktischen Grundlage für Simulationen, physische KI und Entscheidungsfindung. Für die Weiterentwicklung hin zu allgemeineren KI-Systemen könnten sie daher eine wichtige Rolle spielen.

Sprache allein reicht nicht aus

In den letzten zehn Jahren wurde KI hauptsächlich anhand von Texten und Bildern trainiert. Das hat zu beachtlichen Ergebnissen geführt, doch Sprache ist nach wie vor nur ein schlechter Ersatz für gelebte Erfahrung. Worte können zwar Schwerkraft, Reibung und Gleichgewicht beschreiben, vermitteln jedoch kein direktes Gefühl für Gewicht, Kraft oder Timing.

Physische Intelligenz erfordert etwas anderes. Ein Roboter, der sich in einer Küche bewegt, ein Fahrzeug, das den Verkehr interpretiert, oder ein Arm, der ein Bauteil montiert, muss sein Verständnis der Welt als Reaktion auf Bewegung, Berührung und Unsicherheit ständig aktualisieren. Damit dies gelingt, sind schnelle Wahrnehmung und präzise Vorhersagen gleichermaßen erforderlich.

Weltmodelle setzen an dieser Herausforderung an. Sie ermöglichen es einem KI-System, vor dem Handeln abzuleiten, was als Nächstes geschehen könnte, anstatt erst im Nachhinein zu lernen. Damit können sie Wahrnehmung, Planung und Steuerung miteinander verbinden. Deshalb betrachten viele Forscher sie mittlerweile als wichtigen Baustein für die physische KI und als einen möglichen Weg hin zu einer allgemeineren Intelligenz.

Warum Roboter komplexer sind als Chatbots

Ein Teil der Schwierigkeit liegt in den Daten. Sprachmodelle wurden mit Daten aus dem Internet trainiert, das eine nahezu unbegrenzte Menge an Text bietet. Dieser liegt zudem mehr oder weniger im gleichen Format vor. Die Daten, die benötigt werden, um Maschinen körperliche Fähigkeiten beizubringen, sind ganz anders. Ihre Erfassung ist kostspielig, ihr Umfang begrenzt und sie sind äußerst uneinheitlich: Eine Navigationsroute, ein ferngesteuerter Greifvorgang und ein Dashcam-Clip erfassen die physische Welt in völlig unterschiedlichen, miteinander inkompatiblen Formaten – aufgenommen von Maschinen mit völlig unterschiedlichen Körpern.

Die Suche nach Wegen, diese unterschiedlichen Quellen so miteinander in Einklang zu bringen, dass Maschinen tatsächlich daraus lernen können, ist zu einem der relevanten Forschungsprobleme im Bereich der physischen KI geworden. Aktuelle Open-Source-Veröffentlichungen zeigen, wie mögliche Lösungen aussehen können.

Was aus physischer KI wird

Die jüngsten Forschungsergebnisse von Alibaba zeigen einen möglichen Ansatz. Im Februar stellte die DAMO Academy RynnBrain als Open-Source-Projekt zur Verfügung, ein auf Qwen3-VL basierendes Grundmodell für physische KI, das das Umgebungsverständnis, das räumliche Denkvermögen und die Aufgabenplanung verbessert. Durch die Veröffentlichung auf Hugging Face, GitHub und ModelScope machte Alibaba das Modell zudem Forschern und Entwicklern weltweit zugänglich.

Jetzt Newsletter abonnieren

Täglich die wichtigsten Infos zu Big Data, Analytics & AI

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Im Juni folgte ein weiterer Ansatz, um die Kluft zwischen Sehen und Handeln zu überbrücken: die Qwen-Robot Suite, drei Grundmodelle, die jeweils Sprache in unterschiedliche Formen physischen Handelns übersetzen.

Die Architektur gliedert sich dabei in drei Bereiche. Qwen-RobotNav übernimmt die Mobilität, von gesprochenen Navigationsanweisungen bis hin zum autonomen Fahren. Qwen-RobotManip befasst sich mit der physischen Interaktion anhand einer gemeinsamen Darstellung von Zuständen und Aktionen, die es ermöglicht, Daten von sehr unterschiedlichen Robotern für ein gemeinsames Training zu nutzen. Dadurch wurden mehr als 38.100 Stunden zuvor fragmentierter Open-Source-Trainingsdaten nutzbar gemacht.

Das dritte Modell, Qwen-RobotWorld, ist ein Weltmodell. Es sagt voraus, wie die physische Umgebung im nächsten Moment aussehen könnte. Dadurch kann ein Roboter die möglichen Folgen einer Handlung simulieren, bevor er sie ausführt, anstatt erst durch Versuch und Irrtum herauszufinden, was passiert.

Relevant ist dieser Ansatz auch deshalb, weil Erfahrungen aus einem Bereich dazu beitragen können, die Fähigkeiten in einem anderen zu verbessern. Durch Manipulation verbessert sich das Verständnis eines Modells für die Kontaktphysik, das Autofahren trägt zum Verständnis großräumiger Geometrie bei, während die Navigation ein umfassenderes räumliches Denkvermögen fördert. Anstatt für jede Aufgabe separate Systeme zu trainieren, lässt sich so schrittweise ein gemeinsames Verständnis davon entwickeln, wie die physikalische Welt funktioniert.

Von der Anleitung zur Umsetzung

Interessant wird das Zusammenspiel dieser Komponenten, wenn sie gemeinsam eingesetzt werden. Da jedes Modell Anweisungen in einfacher Sprache versteht, kann eine universell einsetzbare KI sie ähnlich wie jedes andere Werkzeug koordinieren. Ein Modell plant, ein anderes navigiert, ein weiteres führt Manipulationen durch, sodass übergeordnetes Denken in physische Handlungen umgesetzt werden kann.

In einer Demonstration nimmt ein übergeordnetes Modell die Anweisung „Räume den Tisch auf“ entgegen, zerlegt sie in einfache Schritte, übergibt jeden einzelnen Schritt an das Manipulationsmodell, überwacht den Fortschritt und plant neu, wenn etwas ins Stocken gerät.

In einem anderen Fall entdeckt ein Agent, der beauftragt wurde, in einem ihm unbekannten Gebäude eine freie Toilette zu finden, an der ersten Toilette, die er erreicht, ein Schild mit der Aufschrift „Reinigung im Gange“ und wechselt daraufhin die Richtung, um die andere Seite des Gebäudes zu durchsuchen. Solche Beispiele zeigen, wie abstrakte Planung mit konkretem Handeln in der physischen Welt verbunden werden kann.

Der größere Gewinn

Die nächste Entwicklungsphase der KI könnte daher stärker von Systemen geprägt sein, die die physische Welt nicht nur beschreiben, sondern auch modellieren, Vorhersagen treffen und auf dieser Grundlage handeln können.

Xiong-Hui Chen(Bild:  Alibaba Cloud)
Xiong-Hui Chen
(Bild: Alibaba Cloud)

So wie Sprachmodelle der KI das Sprechen beigebracht haben, könnten Weltmodelle ihr beibringen, die Realität zu verstehen. Und wenn sich dieses Verständnis auf verschiedene Roboter, Umgebungen und Aufgaben übertragen lässt, könnte sich die Branche auf etwas noch Größeres zubewegen: eine allgemeine Intelligenz, die nicht auf Text beschränkt ist, sondern in der physischen Welt verankert ist.

Über den Autor

Xiong-Hui Chen, Research Scientist bei Alibaba Cloud.

(ID:50960465)