Physical AI & Robotik-KI · Grundlagen
Physical AI — das „Gehirn“ der Roboter einfach erklärt
Kurz gesagt: Physical AI, auch Embodied AI oder verkörperte KI genannt, ist die künstliche Intelligenz, die einen Roboter steuert — sein „Gehirn“. Der eigentliche Umbruch steckt nicht in der Hardware, sondern in dieser Software: Foundation- und VLA-Modelle ersetzen handgeschriebene Programme. Noch ist das Forschung. Der Stanford AI Index 2026 misst bei echten Haushaltsaufgaben rund 88 % Fehlerquote. Beeindruckende Demos sind darum kein Alltagsbeweis.
Was Physical AI ist
Physical AI ist künstliche Intelligenz, die die physische Welt wahrnimmt, versteht und in ihr handelt. Sie sitzt im Roboter und macht aus einem Stück Hardware ein Gerät, das eine Aufgabe eigenständig erledigt. Der Begriff beschreibt also das „Gehirn“, nicht den Körper. Ein erheblicher Teil der Mittel für diese Entwicklung stammt aus Verteidigungshaushalten — welche Rolle Konflikte als Innovationstreiber spielen, ordnen wir dort ein.
Was das für die Sicherheit bedeutet, sobald ein Modell einen Körper steuert, vertieft unser Beitrag zur Sicherheit verkörperter KI.
Nvidia-Chef Jensen Huang prägte den Ausdruck 2025 auf der Technikmesse CES und rief die „physische KI“ zur nächsten Stufe nach der generativen und der agentischen KI aus. Gemeint ist ein Sprung: weg von KI, die nur Texte oder Bilder erzeugt, hin zu KI, die greift, läuft und Dinge bewegt.
Für Sie ist die Kernidee wichtig, nicht der Marketingbegriff. Ein Roboter ist nur so klug wie seine Software. Eben diese Software erlebt gerade einen Umbruch, und darum reden alle großen Tech-Konzerne plötzlich über Roboter.
Physical AI, Embodied AI und verkörperte KI
Die drei Begriffe meinen im Kern dasselbe. Embodied AI, auf Deutsch verkörperte KI, ist der ältere, akademische Ausdruck für Intelligenz in einem physischen Körper. Er wird in der Forschung seit Jahren benutzt.
Physical AI ist die neuere, von Nvidia geprägte Variante desselben Gedankens. Google DeepMind spricht wiederum lieber von „physischen Agenten“ und nennt sein System Gemini Robotics. Die Wortwahl verrät oft nur, wer gerade spricht.
Im Deutschen sucht kaum jemand nach „verkörperte KI“, während die englischen Begriffe klar führen. Für diesen Text gilt darum: Physical AI und Embodied AI werden synonym verwendet, gemeint ist immer das Roboter-Gehirn.
Warum das Gehirn wichtiger ist als die Hardware

Die spannendste These der Branche lautet: Der Wert wandert von der Hardware zur Software. Ein humanoider Körper wird zur Massenware, das Können steckt im Modell. Sie sollten das als Branchen-Sicht einordnen, nicht als gemessene Tatsache, aber die Belege sind stark. Welche wirtschaftlichen Folgen dieselbe Verschiebung außerhalb der Robotik hat, untersucht die Analyse zum KI-Einfluss auf das globale IT-Outsourcing.
Der chinesische Hersteller Unitree bietet seinen humanoiden Roboter G1 ab rund 16.000 $ an (Stand 2026, ohne Gewähr). Zum Vergleich kostete der Roboter Agility Digit lange etwa 250.000 $. Wenn ein Körper mit 23 DOF, also 23 Gelenken, für den Preis eines Kleinwagens zu haben ist, entscheidet nicht mehr die Mechanik über den Nutzen.
Google will seine Roboter-Software Intrinsic ausdrücklich zum „Android der Robotik“ machen, also zu einer Softwareschicht für viele verschiedene Roboter. Genau wie beim Smartphone könnte künftig dieselbe KI auf Geräten vieler Hersteller laufen. Der Vergleich stammt aus der Einordnung, nicht aus einer Messung, trifft die Stoßrichtung aber gut.
Wie die KI-Schicht funktioniert

Das Herzstück moderner Roboter-KI ist das VLA-Modell, kurz für Vision-Language-Action. Es nimmt ein Kamerabild und einen Sprachbefehl und erzeugt daraus direkt Bewegungsbefehle. Sehen, Verstehen und Handeln stecken in einem einzigen Modell, statt in getrennt programmierten Bausteinen.
Sie können sich das als Steigerung bekannter KI vorstellen. Ein Sprachmodell wie ein Chatbot versteht nur Text. Ein Vision-Language-Modell versteht zusätzlich Bilder, gibt aber weiter nur Text aus. Das VLA fügt die dritte Stufe hinzu: die Handlung. Wie diese Modelle im Detail arbeiten, erklärt der eigene Beitrag zu den VLA-Modellen.
Der Reiz dieser Modelle ist die Verallgemeinerung. Weil sie auch mit Wissen aus dem Internet trainiert werden, verstehen sie neue Objekte, die sie nie als Roboterdaten gesehen haben. Das ist der Grund, warum die Technik plötzlich so viel mehr kann als klassische Industrieroboter.
World Models und Simulation
Ein zweiter Baustein sind sogenannte World Models. Das sind KI-Systeme, die die physische Welt nachbilden und vorhersagen, was als Nächstes passiert, wenn ein Roboter etwas tut. Sie dienen als Trainingsumgebung, in der Roboter üben, ohne echte Gegenstände zu zerstören.
Nvidias Plattform Cosmos etwa erzeugt solche Weltmodelle und wurde nach Nvidia-Angaben auf 200 Mio. Videoclips trainiert. In der Simulation kann ein Roboter Millionen Versuche durchspielen, für die er in der Realität Jahre bräuchte. Anschließend überträgt man das Gelernte auf die echte Maschine.
Dieser Umweg über die Simulation ist kein Detail, sondern eine Notlösung für ein hartes Problem: Es gibt viel zu wenige echte Bewegungsdaten. Genau daran hängt, wie schnell die ganze Branche vorankommt.
Die wichtigsten Akteure

Um das Roboter-Gehirn ist ein Wettrennen mit Milliardenbewertungen entbrannt. Nvidia liefert mit Isaac GR00T ein offenes Grundmodell plus Simulation und Chips. Google DeepMind kontert mit Gemini Robotics, das auf dem Sprachmodell Gemini aufbaut.
Dazu kommen spezialisierte Start-ups. Physical Intelligence baut offene Generalist-Modelle und wurde im November 2025 mit 5,6 Mrd. $ bewertet (ohne Gewähr, Stand Bericht). Skild AI sammelte im Januar 2026 rund 1,4 Mrd. $ bei einer Bewertung über 14 Mrd. $ ein (ohne Gewähr, Stand Bericht). Figure und Tesla bauen dagegen geschlossene Systeme für ihre eigenen Roboter.
Wer welche Strategie fährt, wer offen und wer geschlossen arbeitet, ordnet der Überblick zu den KI-Gehirnen der Roboter ein.
Die Details zu Nvidia stehen im Beitrag zu Nvidia GR00T.
Den Google-Ansatz prüft der Gemini-Robotics-Faktencheck.
| Akteur | Ansatz | Modell offen? | Herkunft | Reifegrad |
|---|---|---|---|---|
| Nvidia (Isaac GR00T) | Plattform-Grundmodell | teils offen | USA | Forschung/verfügbar |
| Google (Gemini Robotics) | VLA + Reasoning | geschlossen | USA | Forschung |
| Physical Intelligence | Generalist-VLA | offen (π0) | USA | Forschung |
| Skild AI | omni-bodied Modell | geschlossen | USA | Prototyp |
| Figure (Helix) | Eigenstack | geschlossen | USA | Pilot |
| Tesla (Optimus) | Eigenstack (FSD-basiert) | geschlossen | USA | angekündigt |
| Neura Robotics | Humanoid + GR00T-Partner | teils offen | Deutschland | Prototyp |
Offen oder geschlossen: zwei Lager
Ein Muster zieht sich durch die Tabelle. Auf der einen Seite stehen offene Ansätze, bei denen Modelle wie Physical Intelligence π0 oder Teile von Nvidias GR00T frei nutzbar sind. Forscher und kleinere Firmen können darauf aufbauen, ohne bei null zu starten.
Auf der anderen Seite bauen Figure und Tesla geschlossene Eigenstacks, die nur im eigenen Roboter laufen. Der Vorteil ist volle Kontrolle über Hardware und Software, der Nachteil eine engere Zielgruppe. Beide Lager verfolgen dasselbe Ziel mit gegensätzlicher Philosophie.
Für den Markt ist die Frage entscheidend, welches Lager sich durchsetzt. Ein offenes „Android der Robotik“ würde viele Hersteller stärken, ein geschlossenes „Apple-Modell“ wenige dominante Anbieter. Heute ist beides offen, und genau das macht die nächsten Jahre spannend. Für die Industriearme versucht das markenübergreifende Roboter-OS von Wandelbots genau diese offene Rolle bereits heute.
Woher die Trainingsdaten kommen
Hier liegt der eigentliche Engpass. Ein Sprachmodell lernt aus dem halben Internet, doch für Roboter gibt es keine vergleichbaren Datenmengen. Bewegungsdaten müssen mühsam erzeugt werden, meist indem ein Mensch den Roboter per Teleoperation führt und das Modell diese Vorführungen nachahmt.
Das Missverhältnis ist groß. Zwar arbeiten weltweit über 3,9 Mio. Industrieroboter, doch verwertbare Bewegungsdaten bleiben rar und müssen einzeln von Hand erzeugt werden. Wie sehr dieser Datenmangel das Tempo bremst, beleuchtet der Beitrag zu den VLA-Modellen im Detail.
Deshalb setzen alle auf Simulation und geteilte Datensätze. Ob dieser Datenhunger schnell genug gestillt wird, ist die offene Kernfrage der Physical AI. Sie erklärt auch, warum viele „autonome“ Roboter in Wahrheit noch teilweise ferngesteuert werden.
Selbst ein Modell mit ausreichend Trainingsdaten löst damit noch nicht jeden Engpass: Recovery nach einem Fehler, Sicherheitsnachweis und die Integration in eine bestehende Fertigung können die eigentliche Grenze an einer ganz anderen Stelle der Kette verschieben — ein eigener Beitrag ordnet diese Gegenthese ein.
Der Realitäts-Check: 88 % Fehlerquote
An dieser Stelle lohnt der nüchterne Blick. Der Stanford AI Index 2026, eine unabhängige jährliche Bestandsaufnahme, hat gemessen, wie gut Roboter echte Haushaltsaufgaben schaffen. Das Ergebnis ist ernüchternd.
Auf dem realitätsnahen Testfeld BEHAVIOR-1K mit 1.000 Alltagsaufgaben lag die Erfolgsquote des besten Teams bei nur 12,4 %. Das sind rund 88 % Fehler. Im selben Zeitraum erreichten Roboter im reinen Simulations-Test RLBench dagegen 89,4 %. Diese Kluft zwischen Labor und Wohnzimmer ist das zentrale Problem.
Auch bei der Sicherheit ist die Lage klar: Auf einem Testfeld mit Strom-, Feuer- und Personengefahren schaffte selbst das beste Modell nur 64 % sichere Durchläufe. Wer ein Werbevideo sieht, in dem ein Roboter mühelos den Tisch abräumt, sollte diese Zahlen danebenlegen. Eine Demo unter kontrollierten Bedingungen ist kein Beweis für den Alltag.
Industrie zuerst, Haushalt zuletzt
Aus dem Realitäts-Check folgt die wahrscheinliche Reihenfolge der Einführung. Zuerst kommen Roboter dort zum Einsatz, wo die Umgebung kontrolliert ist: in Fabriken und Lagern. Dort laufen bereits echte Pilotprojekte, etwa Humanoide in Autowerken. Auch fernab der Automobilindustrie zeigt sich dieses Muster: In der Kanalrobotik laufen ferngesteuerte Systeme seit Jahren produktiv, weil Rohrleitungen eine ähnlich kontrollierte Umgebung bieten wie eine Fabrikhalle.
Danach folgen Gewerbe und Dienstleistung, später die Pflege, und der private Haushalt kommt zuletzt. Der Grund ist einfach: Ein Wohnzimmer ist unordentlich und unvorhersehbar, eine Fabrikstraße nicht. Die 12,4 % Erfolg im Haushalt gegenüber laufenden Fabrik-Piloten belegen dieses Gefälle.
Analysten erwarten die breite Skalierung außerhalb der Industrie erst in den 2030er-Jahren. Wer heute einen Alleskönner für zu Hause verspricht, verkauft eine Vision, keinen Ist-Zustand. Diese Ehrlichkeit trennt seriöse Einordnung von Marketing.
Deutschland und Europa
Auch aus Deutschland kommt ein ernstzunehmender Akteur. Neura Robotics aus Metzingen baut den humanoiden Roboter 4NE-1, rund 1,75 m groß und etwa 95 kg schwer, und ist offizieller Partner von Nvidias GR00T-Plattform. Eine Series-C-Runde brachte laut Berichten bis zu 1,4 Mrd. $ (ohne Gewähr, Stand Bericht). Ebenfalls aus Deutschland kommt der Münchner DLR-Spin-off Agile Robots, der Kraft-Momenten-Sensorik in Cobots bringt und einen eigenen Humanoiden angekündigt hat.
Neben der Technik zählt der Rechtsrahmen. Ab dem 20. Januar 2027 gilt die EU-Maschinenverordnung 2023/1230. Sie erfasst erstmals KI-Sicherheitskomponenten mit selbstlernendem Verhalten als Hochrisiko und verlangt eine Konformitätsbewertung. Was das konkret bedeutet, ordnet der Recht-Überblick zu Robotern in der EU ein.
Für den europäischen Markt heißt das: Die Technik reift global, die Spielregeln setzt aber die EU mit. Das ist eine Chance für Anbieter, die Sicherheit und Nachvollziehbarkeit ernst nehmen.
Was der Markt erwartet
Die Prognosen sind gewaltig, aber mit Vorsicht zu lesen. Goldman Sachs schätzt den Markt für humanoide Roboter auf 38 Mrd. $ bis 2035 (Prognose, ohne Gewähr). Morgan Stanley sieht bis 2050 sogar einen Gesamtmarkt von rund 5 Bio. $ und rund 1 Mrd. Roboter im Einsatz.
Solche Zahlen sind Prognosen mit großer Spannbreite, keine Fakten. Belastbarer ist der Ist-Zustand der Industrie: Laut IFR World Robotics 2025 wurden 2024 weltweit 542.000 Industrieroboter neu installiert, der Gesamtbestand liegt bei rund 4,66 Mio. Einheiten.
Der Kontrast ist lehrreich. Die Industrie-Robotik ist ein reifer Milliardenmarkt, die humanoide Physical AI dagegen steht am Anfang. Die Prognosen beschreiben Hoffnung, die IFR-Zahlen beschreiben Realität.
Auch die Geografie ist eindeutig. Laut IFR entfielen 2024 rund 74 % der neu installierten Industrieroboter auf Asien, allein 54 % auf China. Die industrielle Basis der Robotik liegt also längst im Osten, während bei der humanoiden Physical AI die USA und Europa lauter auftreten. Wer die Entwicklung verfolgt, sollte beide Schauplätze im Blick behalten.
Auffällig ist auch das Tempo der Finanzierung. Physical Intelligence stieg laut Berichten binnen eines Jahres von rund 2,4 Mrd. $ auf 5,6 Mrd. $ Bewertung, Skild AI verdreifachte seine Bewertung in etwa acht Monaten (jeweils ohne Gewähr, Stand Bericht). So viel Kapital fließt in ein Feld, das seine Alltagstauglichkeit erst noch beweisen muss. Diese Spannung zwischen viel Geld und noch fehlender Serienreife prägt die Physical AI im Jahr 2026.
Was das für Sie bedeutet
Als Beobachter oder möglicher Käufer ziehen Sie daraus drei Lehren. Zuerst zählt die Software, nicht das Aussehen des Roboters. Zwei Maschinen mit gleicher Hardware können je nach Modell völlig verschieden fähig sein.
Genauso wichtig ist der Blick auf unabhängige Zahlen. Eine Erfolgsquote ohne Testkontext ist wertlos, und „autonom“ bedeutet nicht immer, dass kein Mensch mitsteuert. Fragen Sie im Zweifel, ob eine Vorführung im Alltag oder im Labor entstand.
Und rechne mit Jahren, nicht Monaten. Die Industrie profitiert zuerst, der Haushalt zuletzt. Wer das versteht, fällt weder auf Hype herein noch verpasst er die echte Entwicklung.
Fazit
Physical AI ist der wichtigste Umbruch der Robotik, weil er das Gehirn betrifft und nicht den Körper. Foundation- und VLA-Modelle machen Roboter erstmals allgemein einsetzbar, und ein Wettrennen mit Milliardenbewertungen treibt das Feld an. Aus Deutschland mischt Neura Robotics mit.
Zugleich ist Demut angebracht. Rund 88 % Fehlerquote bei echten Haushaltsaufgaben zeigen, dass die Alltagsreife noch fehlt. Der ehrliche Rat lautet darum: die Technik ernst nehmen, den Zeithorizont realistisch halten und Demos von Alltag unterscheiden.
Was ist Physical AI einfach erklärt?
Physical AI ist die künstliche Intelligenz, die einen Roboter steuert — sein „Gehirn“. Sie nimmt Kamerabilder und Befehle auf und macht daraus Bewegungen. Der Begriff wurde 2025 von Nvidia geprägt und beschreibt KI, die in der physischen Welt handelt, statt nur Texte oder Bilder zu erzeugen.
Was ist der Unterschied zwischen Physical AI und Embodied AI?
Im Kern nichts. Embodied AI, also verkörperte KI, ist der ältere akademische Begriff für Intelligenz in einem physischen Körper. Physical AI ist die neuere, von Nvidia geprägte Variante desselben Gedankens. Beide meinen das Roboter-Gehirn und werden oft synonym benutzt.
Was ist ein VLA-Modell?
Ein Vision-Language-Action-Modell nimmt ein Kamerabild und einen Sprachbefehl und erzeugt daraus direkt Bewegungsbefehle für einen Roboter. Es vereint Sehen, Verstehen und Handeln in einem Modell. Details erklärt der eigene Beitrag zu den VLA-Modellen.
Warum ist das Gehirn wichtiger als die Roboter-Hardware?
Weil die Hardware zur Massenware wird. Ein humanoider Körper wie der Unitree G1 ist ab rund 16.000 $ zu haben (ohne Gewähr, Stand 2026), während früher 250.000 $ üblich waren. Das Können steckt zunehmend im KI-Modell. Dieselbe Hardware kann je nach Software völlig verschieden fähig sein.
Wann kommen Roboter in den Haushalt?
Voraussichtlich zuletzt. Der Stanford AI Index 2026 misst bei echten Haushaltsaufgaben nur 12,4 % Erfolg, also rund 88 % Fehler. Zuerst kommen Roboter in Fabriken und Lagern zum Einsatz, dann im Gewerbe, später in der Pflege. Breite Nutzung zu Hause erwarten Analysten eher in den 2030er-Jahren.
Welche Firmen bauen das Roboter-Gehirn?
Nvidia (Isaac GR00T), Google DeepMind (Gemini Robotics), Physical Intelligence, Skild AI, Figure und Tesla. Aus Deutschland kommt Neura Robotics. Manche legen ihre Modelle offen, andere halten sie geschlossen. Der Überblick zu den KI-Gehirnen der Roboter vergleicht die Ansätze.
Warum können Roboter im Video mehr als in echt?
Weil Demos unter kontrollierten Bedingungen entstehen. In der Simulation erreichen Roboter laut Stanford AI Index 2026 rund 89,4 % Erfolg, im echten Haushalt nur 12,4 %. Diese Sim-to-Real-Lücke ist das Kernproblem. Ein Werbevideo ist darum kein Beleg für Alltagstauglichkeit.
Woher kommen die Trainingsdaten?
Überwiegend aus Teleoperation: Ein Mensch führt den Roboter, das Modell ahmt die Vorführung nach. Dazu kommt Training in Simulation. Echte Bewegungsdaten sind knapp — der größte offene Datensatz umfasst nur rund 1 Mio. Abläufe. Dieser Datenmangel ist der zentrale Engpass der Physical AI.
Gibt es deutsche oder europäische Akteure?
Ja, allen voran Neura Robotics aus Metzingen mit dem Humanoiden 4NE-1, offizieller Nvidia-Partner. Details zum Unternehmen stehen im eigenen Profil, die Einordnung im Vergleich der KI-Gehirne. Zudem setzt die EU mit der Maschinenverordnung ab 2027 wichtige Spielregeln.
Wer reguliert KI-Roboter in der EU?
Ab dem 20. Januar 2027 gilt die EU-Maschinenverordnung 2023/1230. Sie stuft KI-Sicherheitskomponenten mit selbstlernendem Verhalten als Hochrisiko ein und verlangt eine Konformitätsbewertung. Der Recht-Überblick zu Robotern in der EU erklärt die Pflichten im Detail.
Ist Physical AI dasselbe wie ein Chatbot?
Nein. Ein Chatbot verarbeitet nur Text, Physical AI steuert einen physischen Körper. Sie baut zwar auf ähnlicher KI-Technik auf, muss aber zusätzlich sehen, greifen und sich sicher bewegen. Genau das ist ungleich schwerer, wie die hohe Fehlerquote bei Alltagsaufgaben zeigt.
Wie sich dieselbe Reihenfolge auf einer Verbrauchermesse liest, haben wir 2026 in Berlin an vier Ebenen und fünf Prüfungen durchgespielt.
Was klassische Industrieroboter angeht, lässt sich der deutsche Stand beziffern: wie die IFR die Roboterdichte misst und was die Zahl trägt.
Quellen & Stand: Nvidia Newsroom (Physical AI, GR00T, Cosmos), Google DeepMind / CNBC (Intrinsic, Gemini Robotics), Bloomberg / TechCrunch (Physical Intelligence, Skild AI), The Robot Report / Interesting Engineering (Unitree G1, Datenengpass), Stanford HAI AI Index 2026 (AI Index 2026, Kapitel Technical Performance; BEHAVIOR-1K, RLBench), Goldman Sachs und Morgan Stanley (Marktprognosen), IFR World Robotics 2025 (Industrie-Zahlen), Manufacturing Dive / Neura Robotics (4NE-1), EU-OSHA / TÜV (Maschinenverordnung 2023/1230). Alle Bewertungen und Preise sind Melde- bzw. Anbieterangaben, ohne Gewähr; Marktprognosen sind als Prognose gekennzeichnet. Herstellerangaben sind keine unabhängigen Messungen. Stand: 31. Juli 2026.