Generischer Humanoid dreht vorsichtig ein kleines Objekt und zeigt die Fingerfertigkeit hinter Gemini Robotics

Physical AI & Robotik-KI · Faktencheck

Google Gemini Robotics im Faktencheck — was das Roboter-Gehirn von DeepMind wirklich kann

Stand 31. Juli 2026 · Lesezeit 9 Minuten · Faktencheck

Kurz gesagt: Gemini Robotics ist Google DeepMinds KI für Roboter, vorgestellt im März 2025. Es gibt zwei Teile: das VLA-Modell, das Roboter direkt steuert, und Robotics-ER fürs räumliche Denken. Seit Juni 2025 läuft eine Variante komplett lokal auf dem Roboter, ohne Cloud. Wichtig: Das Ganze ist ein Forschungs- und Frühzugangs-Programm, kein Roboter zum Kaufen. Und trotz starker Demos misst der Stanford AI Index 2026 rund 88 % Fehlerquote bei echten Haushaltsaufgaben.

Was Gemini Robotics ist

Gemini Robotics ist der Versuch von Google DeepMind, das eigene Sprachmodell Gemini in die physische Welt zu bringen. Ob Sie die Robotik nur verfolgen oder selbst entwickeln und wissen wollen, ob Sie das Modell schon nutzen können — der Reihe nach. Vorgestellt wurde es im März 2025. Statt nur Texte zu schreiben, soll dieselbe Art von KI hier einen echten Roboter steuern.

Der Ansatz baut direkt auf Gemini 2.0 auf. Das Modell erbt also das breite Weltwissen des Sprachmodells und lernt zusätzlich, physisch zu handeln. Damit reiht sich Gemini Robotics in die Familie der VLA-Modelle ein.

Für Google ist das ein logischer Schritt. Der Konzern hat mit Gemini eines der führenden KI-Modelle und will dessen Fähigkeiten auf Roboter übertragen. Wie das ins größere Bild der Physical AI passt, zeigt der Grundlagen-Beitrag. Der Wettlauf um das beste Roboter-Gehirn ist damit voll entbrannt, und Google will dabei ganz vorne mitspielen.

VLA-Modell und Robotics-ER

Abstrakt geteiltes Bild aus warmem Licht-Kern und bewegter Hand für Denken und Handeln im selben System
Denken und Handeln vereint

Gemini Robotics kommt in zwei Ausführungen, die man nicht verwechseln sollte. Das eigentliche VLA-Modell gibt physische Aktionen aus und steuert den Roboter direkt. Es ist genau der Teil, der die Hände des Roboters bewegt.

Der zweite Teil heißt Gemini Robotics-ER, wobei ER für Embodied Reasoning steht, also verkörpertes Schlussfolgern. Dieses Modell versteht Räume, erkennt die Lage von Objekten im Dreidimensionalen und plant Aufgaben. Es kann an bestehende Steuerungen anderer Roboter angedockt werden, ohne dass deren Bewegungssystem ersetzt werden muss.

Die Trennung ist praktisch. Wer einen eigenen Roboter mit eigener Bewegungssteuerung hat, kann allein das Denkmodell ER nutzen. Wer alles aus einer Hand will, nimmt das komplette VLA-Modell. Google bedient so zwei sehr verschiedene Zielgruppen.

Sie können sich das wie ein Team aus Planer und Handwerker vorstellen. Das ER-Modell denkt nach, zerlegt eine Aufgabe in Schritte und versteht den Raum. Das VLA-Modell setzt diese Schritte in konkrete Bewegungen um. Erst zusammen ergeben sie einen Roboter, der eine gesprochene Anweisung tatsächlich ausführt.

Gemini Robotics On-Device

Generischer Roboter arbeitet allein in einem Wohnraum ganz ohne Bildschirme als Bild für den lokalen Betrieb
Betrieb ohne Cloud

Ein wichtiger Schritt kam im Juni 2025. Google stellte Gemini Robotics On-Device vor, eine Variante, die vollständig lokal auf dem Roboter läuft. Sie braucht keine Verbindung zur Cloud.

Das ist mehr als ein technisches Detail. Ein Roboter, der ohne Internet denkt, reagiert schneller und funktioniert auch dort, wo die Verbindung schlecht ist. Gerade im Haushalt, in der Klinik oder in der Fabrik ist das ein echter Vorteil.

Laut Google lässt sich die lokale Variante mit nur 50 bis 100 Vorführungen auf neue Aufgaben anpassen; getestet wurde sie nach diesen Angaben unter anderem auf dem Humanoiden Apollo des Partners Apptronik.

Der lokale Betrieb hat allerdings einen Preis. Ein Modell, das auf dem Roboter läuft, muss kleiner sein als eines in der Cloud, denn die Rechenleistung an Bord ist begrenzt. Google versucht darum, möglichst viel Fähigkeit in ein schlankes Modell zu packen. Dass die lokale Variante trotzdem stark abschneidet, ist der eigentliche technische Fortschritt.

Was es laut Google kann

Nahaufnahme einer geschickten Roboterhand mit fünf Fingern, die ein kleines Objekt präzise hält
Geschickte Roboterhand

DeepMind bewirbt die Verallgemeinerung des Modells: Es soll mit neuen Objekten und Aufgaben zurechtkommen, die es nicht geübt hat. Dazu kommt Geschicklichkeit, etwa Origami falten oder einen Snack in eine Tüte packen.

Interaktiv ist es nach dieser Darstellung auch. Das Modell versteht Alltagssprache, arbeitet mehrsprachig und plant neu, wenn sich die Umgebung ändert. In Zahlen nennt Google für die lokale Variante Erfolgsraten von rund 52 bis 74 % über verschiedene Aufgabenarten, gegenüber rund 11 bis 36 % beim vorherigen besten Modell.

Diese Werte klingen stark, sind aber Googles eigene Messungen unter kontrollierten Bedingungen. Sie zeigen den Fortschritt gegenüber dem Vorgänger, nicht die Leistung im ungeskripteten Alltag.

Besonders die Verallgemeinerung verdient einen zweiten Blick. Dass ein Roboter ein nie geübtes Objekt greift, ist beeindruckend, wenn es unter Laborbedingungen gelingt. Ob es auch bei schlechtem Licht, in Unordnung und unter Zeitdruck klappt, steht auf einem anderen Blatt.

Version 1.5 und der Thinking-Schritt

Im September 2025 folgte Gemini Robotics 1.5, zusammen mit einer neuen Version des Denkmodells ER. Die wichtigste Neuerung ist ein sichtbarer Denkschritt vor der Handlung. Das Modell überlegt erst, dann handelt es.

Dazu kam die Fähigkeit, Gelerntes zwischen verschiedenen Roboterkörpern zu übertragen. Ein auf einem Roboter geübter Handgriff lässt sich so leichter auf einen anderen anwenden. Das mildert eines der größten Probleme der Robotik, die Bindung an eine feste Hardware.

Außerdem kann die Version Werkzeuge nutzen, etwa die Google-Suche, um an Informationen zu kommen. Damit nähert sich das Roboter-Gehirn den agentischen KI-Systemen an, die selbstständig mehrere Schritte planen. Nach Googles Darstellung wird der Roboter zum Problemlöser, der sich fehlende Informationen selbst beschafft.

Gemini Robotics 2

Der jüngste Sprung datiert auf den 30. Juli 2026. Mit Gemini Robotics 2 steuert das Modell erstmals einen ganzen humanoiden Körper unter einer einzigen Steuerung — Beine, Rumpf, Arme und Mehrfingerhände zusammen. Der Stack vereint das VLA-, das ER- und das On-Device-Modell zu einem gemeinsamen System, das Denken und Bewegen enger verzahnt als zuvor.

Als Demo nennt Google unter anderem eine Erfolgsquote von 92 % beim Herausdrehen einer Glühbirne, einer Aufgabe, die feine Ganzkörper-Kontrolle verlangt. Zugleich betonen Beobachter wie Bloomberg, dass feine Manipulation weiterhin eine Schwäche bleibt.

Auch Gemini Robotics 2 bleibt frühen Partnern und Entwicklern vorbehalten. Es ist ein Forschungssprung, kein Produkt für den Handel. Weil sich die Versionen im Monatsrhythmus ablösen, lohnt bei jeder Meldung der Blick aufs Datum.

Version Datum Wichtigste Neuerung
Gemini Robotics + ER März 2025 erstes VLA + Reasoning-Modell
On-Device Juni 2025 läuft vollständig lokal, ohne Cloud
Version 1.5 September 2025 Denkschritt, Übertrag zwischen Robotern
Version 2 Juli 2026 Ganzkörper-Steuerung eines Humanoiden

Innerhalb von rund anderthalb Jahren wuchs Gemini Robotics vom ersten Steuermodell zur vollständigen Ganzkörper-Kontrolle. Kaum ein Feld der KI bewegt sich derzeit so schnell wie die Robotik-Modelle.

Die Partner

Gemini Robotics lebt von seinen Hardware-Partnern, denn Google baut selbst keine Roboter. Die engste Zusammenarbeit besteht mit Apptronik und dessen Humanoiden Apollo. Google ist an diesem Unternehmen auch beteiligt.

Darüber hinaus nannte DeepMind mehrere sogenannte Trusted Tester, also ausgewählte Prüfpartner. Dazu zählen Agile Robots, Agility Robotics, Boston Dynamics und Enchanted Tools. Diese Firmen erhalten früh Zugang und geben Rückmeldung.

Die Auswahl zeigt Googles Strategie. Statt eigener Hardware setzt der Konzern auf die besten Roboterbauer und liefert das Gehirn. Das ähnelt dem Plattform-Gedanken, den auch Nvidia mit GR00T verfolgt, bleibt bei Google aber deutlich geschlossener.

Wo Gemini Robotics im Wettbewerb steht, ordnet der Vergleich der KI-Gehirne ein.

Wie sicher ist es?

Sicherheit ist bei handelnden Robotern kein Randthema. DeepMind veröffentlichte darum zusammen mit den Modellen einen eigenen Sicherheits-Testrahmen namens ASIMOV, benannt nach dem Science-Fiction-Autor. Er prüft, ob ein Roboter gefährliche Anweisungen erkennt und ablehnt.

Das erklärt auch, warum Asimovs Robotergesetze real nicht greifen.

Dazu kommt die Idee automatisch erzeugter „Roboter-Verfassungen“, also Regeln, an die sich das System halten soll. Der Ansatz lehnt sich an Asimovs berühmte Robotergesetze an. Das ist ein durchdachter Rahmen, aber eben ein Rahmen, keine Garantie.

In einem Test mit echten Strom-, Feuer- und Personengefahren schaffte selbst das beste Modell nur rund 64 % sichere Durchläufe. Das gilt fürs ganze Feld, nicht nur für Gemini, mahnt aber zur Vorsicht.

Ein Sprachmodell, das sich irrt, schreibt einen falschen Satz. Ein Roboter, der sich irrt, kann etwas umstoßen oder einen Menschen gefährden. Deshalb ist es richtig, dass DeepMind die Sicherheit von Anfang an mitdenkt.

Kann man es kaufen oder testen?

Nein — Gemini Robotics ist kein Kaufprodukt. Es gibt keinen Roboter im Handel, den man mit dieser KI mitkaufen kann.

Für Entwickler ist nur ein Teil zugänglich. Das Denkmodell Gemini Robotics-ER 1.5 lässt sich über Googles Schnittstelle in der Entwicklungsumgebung AI Studio ausprobieren. Die eigentlichen VLA-Modelle, die Roboter steuern, bleiben ausgewählten Partnern vorbehalten.

Aussagen wie „Google verkauft jetzt Haushaltsroboter“ sind also schlicht falsch. Das gesamte Programm ist Forschung und Frühzugang. Wer die Technik in Aktion sehen will, sieht bislang Demos und Pilotversuche, kein Ladengerät. Bis ein käuflicher Roboter mit Gemini-Gehirn im Regal steht, dürften noch etliche Jahre vergehen.

Der On-Device-Vorteil beim Datenschutz

Der lokale Betrieb hat eine Seite, die gerade in Europa zählt. Läuft die KI auf dem Roboter, müssen Kamera- und Sensordaten nicht zwingend in die Cloud. Sie können das Gerät erst gar nicht verlassen.

Das kann datenschutzseitig günstiger sein als eine reine Cloud-Verarbeitung. Ein Freibrief ist es aber nicht, denn es kommt auf die konkrete Umsetzung an. Eine pauschale Zusage zur Einhaltung der Datenschutzregeln lässt sich daraus nicht ableiten.

Wie heikel Sensordaten aus dem Wohnraum sind, zeigt der Beitrag zum Datenschutz bei Saugrobotern. Eine offizielle Marktverfügbarkeit in Europa gibt es ohnehin noch nicht.

Der Realitäts-Check

Googles Zahlen sind stark, stammen aber aus kontrollierten Vorführungen. Das Gegengewicht liefert der unabhängige Stanford AI Index 2026.

Bei echten Haushaltsaufgaben gelingen selbst den besten Systemen nur rund 12 % der Aufgaben, also etwa 88 % Fehler. Mehr zu diesen Werten steht im Überblick zu Physical AI. Eine Glühbirne in einer Demo herauszudrehen, ist eben etwas anderes als ein unaufgeräumtes Wohnzimmer.

Das schmälert Gemini Robotics nicht. Google liefert eines der stärksten Roboter-Gehirne der Forschung, doch der Weg zum verlässlichen Alltagseinsatz ist damit noch nicht zu Ende gegangen.

Wie in der ganzen Branche kommen Roboter zuerst in Fabriken und Lagern zum Einsatz, wo die Umgebung kontrolliert ist, und erst viel später im privaten Haushalt. Gemini Robotics dürfte diesen Weg mitgehen. Die spektakulären Ganzkörper-Demos zeigen das Potenzial, nicht den Stand im Wohnzimmer.

Fazit

Gemini Robotics zeigt, wie ernst Google die Robotik nimmt. Aus dem starken Sprachmodell Gemini wird ein Roboter-Gehirn, das lokal läuft, sicherheitsbewusst gebaut ist und sich rasant weiterentwickelt, zuletzt bis zur Ganzkörper-Steuerung in Version 2. Das ist Spitzenforschung.

Es bleibt aber ein Forschungsprogramm, kein Kaufprodukt, und die Alltagsreife fehlt mit rund 88 % Fehlerquote noch. Beides gehört in den Blick, wenn die nächste Google-Ankündigung kommt.

fl

fluxlane Redaktion

Neutrale Einordnung zu Service- und Haushaltsrobotern und Physical AI — mit Fokus auf den deutschen Markt, klaren Status-Angaben und quellenbelegten Zahlen. Wie wir arbeiten und Quellen prüfen.

Was ist Gemini Robotics und was Robotics-ER?

Gemini Robotics ist Google DeepMinds Roboter-KI auf Basis von Gemini 2.0. Das VLA-Modell steuert Roboter direkt über physische Aktionen. Gemini Robotics-ER ist ein Modell fürs räumliche Denken und Planen, das an bestehende Steuerungen angedockt werden kann. Beide wurden im März 2025 vorgestellt.

Läuft Gemini Robotics ohne Internet?

Ja, seit der On-Device-Variante vom Juni 2025 läuft ein Modell vollständig lokal auf dem Roboter, ohne Cloud. Das macht die Steuerung schneller und unabhängig von der Verbindung. Laut Google lässt es sich mit rund 50 bis 100 Vorführungen auf neue Aufgaben anpassen.

Kann ich Gemini Robotics kaufen oder ausprobieren?

Kaufen nein, es ist kein Produkt im Handel. Ausprobieren nur teilweise: Das Denkmodell Gemini Robotics-ER 1.5 ist über Googles Schnittstelle in AI Studio zugänglich. Die eigentlichen VLA-Steuermodelle bleiben ausgewählten Partnern vorbehalten. Das ganze Programm ist Forschung und Frühzugang.

Welche Roboter und Hersteller arbeiten damit?

Am engsten arbeitet Google mit Apptronik und dessen Humanoiden Apollo zusammen. Als Trusted Tester nennt DeepMind zudem Agile Robots, Agility Robotics, Boston Dynamics und Enchanted Tools. Google baut selbst keine Roboter, sondern liefert das Gehirn für die Hardware anderer.

Wie sicher sind die Roboter?

DeepMind nutzt den Sicherheits-Testrahmen ASIMOV und automatisch erzeugte „Roboter-Verfassungen“ für sicheres Verhalten. Das ist ein durchdachter Ansatz, aber keine Garantie. Ein Test mit echten Gefahren zeigt, dass selbst führende Modelle nur rund 64 % sichere Durchläufe schaffen.

Können die Roboter schon im Haushalt helfen?

Verlässlich noch nicht. Der Stanford AI Index 2026 misst bei echten Haushaltsaufgaben rund 88 % Fehlerquote. Beeindruckende Demos wie das Herausdrehen einer Glühbirne entstehen unter kontrollierten Bedingungen und entsprechen nicht dem unaufgeräumten Alltag zu Hause.

Was ist neu an Gemini Robotics 2?

Gemini Robotics 2 vom 30. Juli 2026 steuert erstmals einen ganzen humanoiden Körper unter einer Steuerung: Beine, Rumpf, Arme und Hände zusammen. Als Demo nennt Google 92 % Erfolg beim Herausdrehen einer Glühbirne. Es bleibt aber frühen Partnern vorbehalten und ist kein Kaufprodukt.

Ist der On-Device-Betrieb datenschutzfreundlicher?

Er kann es sein. Läuft die KI lokal auf dem Roboter, müssen Kamera- und Sensordaten nicht in die Cloud und können das Gerät erst gar nicht verlassen. Ein pauschaler Freibrief ist das nicht, es kommt auf die Umsetzung an. Eine offizielle EU-Marktverfügbarkeit gibt es zudem noch nicht.

Wer sind die größten Konkurrenten?

Vor allem Nvidia mit Isaac GR00T und Physical Intelligence mit dem Modell π0. Beide setzen ebenfalls auf VLA-Technik. Nvidia verfolgt einen offeneren Plattform-Ansatz, Google bleibt geschlossener. Der Vergleich der KI-Gehirne der Roboter ordnet die Ansätze im Detail ein.

Quellen & Stand: Google DeepMind Blogs (12.03.2025, 24.06.2025, 25.09.2025, 30.07.2026), arXiv (ASIMOV-Benchmark), TechCrunch / MarkTechPost (On-Device), Bloomberg / Engadget (Gemini Robotics 2), Stanford HAI AI Index 2026 (AI Index 2026, Kapitel Technical Performance). Alle Leistungszahlen von Google sind Hersteller- bzw. Demo-Werte aus kontrollierten Bedingungen, keine unabhängigen Messungen. Gemini Robotics ist Stand Juli 2026 ein Forschungs- und Frühzugangs-Programm, kein Consumer-Produkt. Der Forschungsstand ändert sich schnell; Datumsstand beachten. Stand: 31. Juli 2026.

Ähnliche Beiträge