News & Markt · Analyse
Physical AI im Praxistest: warum ein geführter Nachweis mehr wiegt als gefahrene Kilometer
Kurz gesagt: Die reale Welt ist für ein autonomes System nicht schwerer als eine Simulation, sie ist anders verteilt: Millionen belangloser Situationen stehen wenigen entscheidenden gegenüber, und eine gefahrene Strecke bildet fast nur die belanglosen ab. Am 24. Juni 2026 hat das Weltforum für die Harmonisierung von Fahrzeugvorschriften bei der UNECE die weltweit erste Regelung verabschiedet, die vollautonome Fahrsysteme rechtlich ermöglicht. Sie verlangt ein auditiertes Sicherheitsmanagement über den Lebenszyklus, glaubwürdige Testumgebungen samt virtueller Werkzeugketten, eine Validierung nach dem Sicherheitsnachweis-Ansatz und laufende Überwachung im Betrieb. Damit zählt nicht mehr, wie weit ein System gefahren ist, sondern welche Situationen es nachweislich beherrscht.
Der Beschluss, der den Maßstab austauscht
Wer ein autonomes Fahrzeug vorführt, sucht sich einen Tag mit brauchbarem Licht, eine Strecke, die das Team kennt, und ein Publikum, das am Straßenrand bleibt. Das ist kein Betrug, sondern die Logik jeder Vorführung: Sie zeigt, was ein System kann, wenn die Umstände es zulassen. Der Betrieb dagegen sucht sich seine Umstände nicht aus.
Zwischen diesen beiden Zuständen lag jahrelang eine Lücke, die niemand rechtlich schließen konnte, weil die Zulassungsregeln für Fahrzeuge von einem Menschen am Steuer ausgingen. Am 24. Juni 2026 hat sich das geändert. Das Weltforum für die Harmonisierung von Fahrzeugvorschriften, die Arbeitsstruktur WP.29 bei der Wirtschaftskommission der Vereinten Nationen für Europa, hat eine Regelung verabschiedet, die vollautonome Fahrsysteme erstmals rechtlich ermöglicht. Getragen wird sie von den Vereinigten Staaten, China, der Europäischen Union, Japan, Kanada und dem Vereinigten Königreich — also von den Regionen, in denen solche Fahrzeuge gebaut werden sollen und in denen sie fahren sollen.
Interessant ist weniger, dass es diese Regelung gibt, als was sie verlangt. Vier Anforderungen tragen sie: ein auditiertes Sicherheitsmanagementsystem, das den gesamten Lebenszyklus des Systems abdeckt; glaubwürdige Testumgebungen einschließlich virtueller Werkzeugketten; eine Validierung nach dem Ansatz des Sicherheitsnachweises; und eine fortlaufende Überwachung, nachdem das Fahrzeug im Verkehr ist.
Bemerkenswert ist, was in dieser Aufzählung nicht vorkommt. Es steht dort keine Kilometerzahl. Es steht dort auch keine Zahl von Simulationsläufen und keine Mindestdauer eines Pilotbetriebs, obwohl genau solche Zahlen die öffentliche Debatte über autonomes Fahren seit einem Jahrzehnt bestimmen.
Das ist die Verschiebung, um die es in diesem Beitrag geht. Bis zu diesem Beschluss war die gefahrene Strecke die Währung, in der Anbieter ihre Reife auswiesen, weil es keine andere gab. Von hier an zählt etwas anderes: ein geführtes Argument darüber, welche Situationen ein System beherrscht, warum diese Auswahl vollständig genug ist, und mit welchen Belegen jede einzelne Behauptung darin unterlegt wird. Eine Strecke ist danach kein Nachweis mehr, sondern ein Beleg — einer unter mehreren, und nicht der aussagekräftigste.
Nicht schwerer, sondern anders verteilt
Der verbreitete Satz, die Wirklichkeit sei eben härter als das Labor, trifft die Sache nicht. Er suggeriert, dass die einzelnen Aufgaben draußen schwieriger wären, und das stimmt selten. Eine Ampel im Regen zu erkennen ist keine schwerere Rechenaufgabe als eine Ampel bei Sonne.
Was sich unterscheidet, ist die Verteilung. Ein Fahrsystem verbringt den weit überwiegenden Teil seiner Betriebszeit in Situationen, die einander ähneln: Spur halten, Abstand halten, einer Linie folgen, an einer roten Ampel stehen. Daneben existiert eine sehr lange, sehr dünn besetzte Reihe von Fällen, die jeweils fast nie vorkommen und die sich in ihrer Summe trotzdem regelmäßig ereignen — ein umgekipptes Verkehrsschild, eine Person im Rollstuhl auf der Fahrbahn, ein Warnblinklicht, das etwas anderes bedeutet als sonst, ein Bauarbeiter, der mit der Hand widersprüchlich zur Ampel winkt.

Aus dieser Verteilung folgt ein unangenehmer Umstand für jede Statistik über gefahrene Kilometer. Weil die kritischen Fälle selten sind, wächst ihre Zahl mit der Strecke nur sehr langsam, während die Zahl der belanglosen Kilometer schnell wächst. Eine große Streckenleistung ohne Zwischenfall sagt deshalb vor allem etwas darüber, wie oft ein System in den unkritischen Bereich geraten ist. Sie sagt fast nichts darüber, wie es im kritischen Bereich reagiert, solange nicht offengelegt wird, welche Situationen in dieser Strecke überhaupt vorkamen.
Dazu kommt, dass diese Verteilung nicht stabil ist. Sie hängt daran, wo gefahren wird, zu welcher Tageszeit, bei welchem Wetter und in welcher Verkehrskultur. Ein System, das in einer Stadt mit breiten Straßen und diszipliniertem Verkehr gute Werte erreicht, hat damit nichts über eine europäische Altstadt gezeigt. Genau deshalb verlangt die neue Regelung glaubwürdige Testumgebungen und nicht schlicht viele Testkilometer: Glaubwürdig heißt, dass die Umgebung die Fälle enthält, auf die es ankommt.
Für die Beurteilung eines Anbieters heißt das etwas sehr Praktisches. Wer eine beeindruckende Streckenzahl nennt und daneben keine Beschreibung der darin enthaltenen Situationen liefert, hat eine Zahl vorgelegt, die sich nicht prüfen lässt. Die Frage, die diesen Fall aufklärt, lautet nicht, wie weit, sondern wovon wie oft.
Was ein Sicherheitsnachweis verlangt
Der Begriff, der im Beschluss vom Juni die entscheidende Arbeit leistet, heißt Sicherheitsnachweis — im internationalen Sprachgebrauch Safety Case. Er kommt aus Bereichen, in denen sich Sicherheit nie durch bloßes Ausprobieren belegen ließ, weil ein einziges Versagen zu teuer wäre.
Ein Sicherheitsnachweis ist ein schriftlich geführtes Argument mit drei Ebenen. Oben steht eine Behauptung: Dieses System ist in einem beschriebenen Einsatzbereich hinreichend sicher. Darunter stehen die Argumente, die diese Behauptung stützen und sie in prüfbare Teilbehauptungen zerlegen — etwa, dass das System jede Situation einer bestimmten Klasse erkennt, dass es bei Erkennung innerhalb einer bestimmten Zeit reagiert, und dass es bei Ausfall eines Sensors in einen sicheren Zustand übergeht. Ganz unten stehen die Belege für jede einzelne dieser Teilbehauptungen: Messungen, Simulationsergebnisse, Feldbeobachtungen, Konstruktionsunterlagen.

Der Unterschied zur gefahrenen Strecke liegt in der Richtung. Eine Strecke sammelt Erfahrung und hofft, dass darin schon das Wichtige enthalten war. Ein Sicherheitsnachweis geht vom Risiko aus, benennt zuerst, was schiefgehen könnte, und sucht dann gezielt die Belege dafür, dass es nicht schiefgeht. Wo ein Beleg fehlt, bleibt eine Lücke im Argument sichtbar, und sie lässt sich benennen — das ist der eigentliche Gewinn dieser Form.
Zugleich sollte man nüchtern sehen, was ein solcher Nachweis nicht leistet. Er beweist keine Sicherheit im absoluten Sinn, sondern belegt, dass eine Organisation systematisch nach den Fällen gesucht hat, die ihr einfallen konnten, und dass sie für die gefundenen Fälle Belege vorlegt. Der blinde Fleck bleibt, denn eine Gefahr, die niemand vorhergesehen hat, steht in keinem Argument und hat folglich auch keine Lücke hinterlassen. Deshalb steht in der Regelung die fortlaufende Überwachung nach der Zulassung gleichberechtigt neben der Prüfung davor, und deshalb ist ein Sicherheitsnachweis ein Dokument, das gepflegt wird, statt eines, das abgelegt wird.
Für die Einordnung eines Anbieters ist diese Struktur trotzdem der brauchbarste verfügbare Maßstab. Ein Unternehmen, das einen geführten Nachweis vorlegen kann, hat die Arbeit gemacht, seine eigenen Annahmen aufzuschreiben. Ein Unternehmen, das stattdessen ein Video zeigt, hat sie nicht gemacht oder zeigt sie nicht.
Vom Modell zur Realität: vier Stufen, die einander nicht ersetzen
Die Regelung verlangt glaubwürdige Testumgebungen einschließlich virtueller Werkzeugketten. Das ist eine bemerkenswerte Formulierung, weil sie die Simulation ausdrücklich als Teil des Nachweises anerkennt, statt sie als Vorstufe des eigentlichen Tests abzutun. Wer die Praxis kennt, versteht warum: Die seltenen Fälle, auf die es ankommt, lassen sich auf der Straße nicht herstellen, ohne Menschen zu gefährden.

Die erste Stufe ist die reine Simulation. Ihr Vorteil ist die Wiederholbarkeit: Eine Situation lässt sich tausendfach mit minimalen Abweichungen durchspielen, und man erfährt nicht nur, ob das System sie löst, sondern wie knapp. Ihre Grenze ist ebenso klar, denn simuliert wird immer ein Modell der Welt, und ein Modell enthält genau das, was seine Urheber hineingelegt haben.
Die zweite Stufe schließt den Regelkreis. Hier reagiert die simulierte Umgebung auf das Verhalten des Systems, statt einen aufgezeichneten Ablauf abzuspielen — der entgegenkommende Wagen bremst, weil das Fahrzeug ausschert, und nicht unabhängig davon. Dieser Unterschied ist größer, als er klingt, weil erst dadurch Situationen entstehen, die das System durch sein eigenes Verhalten mitverursacht hat. Genau dort liegen viele der interessanten Fehler.
Die dritte Stufe ist die reale Erprobung, zunächst auf abgesperrtem Gelände, dann im öffentlichen Raum mit Sicherheitsfahrer. Sie beantwortet die Frage, die keine Simulation beantworten kann: ob die Sensoren unter echtem Licht, echtem Schmutz und echter Vibration die Daten liefern, mit denen die Modelle gerechnet haben.

Die vierte Stufe beginnt nach der Zulassung und hört nicht mehr auf. Sie ist der Teil, den die Regelung mit der fortlaufenden Überwachung meint, und sie unterscheidet sich von den drei anderen grundlegend: Sie sucht nicht nach Antworten auf bekannte Fragen, sondern nach Fragen, die noch niemand gestellt hat. Jede auffällige Situation aus dem Feld wandert idealerweise zurück in die Simulation, wird dort variiert und erweitert den Satz der geprüften Fälle. Erst dieser Rücklauf macht aus den vier Stufen einen Kreislauf statt einer Kette.
Weltmodelle: was Hersteller versprechen und was das belegt
Die Schwachstelle der Simulation ist ihr Modellcharakter, und an dieser Stelle setzt der derzeit meistdiskutierte technische Ansatz an. Statt eine Umgebung von Hand zu bauen — Straßen, Fahrzeuge, Physik, Sensorverhalten —, wird ein Modell auf Fahrdaten trainiert, das anschließend selbst Szenen erzeugt. Solche Systeme heißen Weltmodelle, weil sie nicht einzelne Objekte beschreiben, sondern vorhersagen, wie eine Szene im nächsten Moment aussieht.
Das britische Unternehmen Wayve entwickelt einen solchen Ansatz und beschreibt ihn unter der Bezeichnung GAIA-4; die Skalierung der Trainingsinfrastruktur betreibt das Unternehmen nach eigener Darstellung gemeinsam mit Microsoft Azure. Beides sind Herstellerangaben. Sie belegen, dass dieser Entwicklungsweg verfolgt wird und mit welchen Mitteln — sie belegen nicht, dass die erzeugten Szenen die Wirklichkeit hinreichend abdecken, denn diese Frage lässt sich nur gegen einen unabhängigen Maßstab beantworten.
Attraktiv ist der Ansatz, weil sich seltene Situationen gezielt erzeugen und variieren lassen, ohne dass jemand sie vorher in ein Regelwerk schreiben musste. Der Haken liegt daneben: Ein Modell, das aus Fahrdaten gelernt hat, kennt in aller Regel dieselben seltenen Fälle nicht, die auch in den Fahrdaten selten waren. Wo das Trainingsmaterial dünn ist, ist die erzeugte Szene erfunden, und ob sie richtig erfunden ist, weiß niemand.
Das ist keine Absage an die Methode, sondern der Grund, warum die Regelung nicht von Simulation spricht, sondern von glaubwürdigen Testumgebungen. Glaubwürdigkeit ist hier kein Gütesiegel, sondern eine Nachweispflicht: Wer eine virtuelle Werkzeugkette als Beleg in seinen Sicherheitsnachweis aufnimmt, muss begründen, warum ihre Ergebnisse übertragbar sind. Diese Begründung ist selbst Teil des Arguments und damit prüfbar.
Für die Beurteilung von Ankündigungen folgt daraus eine einfache Trennung. Ein neues Modell ist eine Aussage über Fähigkeiten. Ein validiertes Modell ist eine Aussage über Belegbarkeit. Zwischen beiden liegt die gesamte Arbeit, um die es in dieser Regelung geht, und Unternehmen, die den ersten Schritt gegangen sind, kommunizieren ihn verständlicherweise lauter als den zweiten.
Was welcher Nachweis belegt — und was nicht
Die Debatte über autonome Systeme leidet daran, dass sehr unterschiedliche Belegarten unter demselben Wort auftreten. Ein Video, ein Pilotbetrieb, eine Simulationskampagne und eine Zulassung sind vier verschiedene Dinge, und jedes davon trägt genau eine Art von Aussage. Wer sie auseinanderhält, kommt zu einem Raster, das jede Belegart an ihrer Reichweite misst — eine redaktionelle Einordnung, nicht der Wortlaut einer Norm. Das ist die Achse, auf die es ankommt — Fähigkeit wird gemessen, Verlässlichkeit kaum.
| Belegart | Was daraus folgt | Was daraus nicht folgt |
|---|---|---|
| Gefahrene Kilometer ohne Zwischenfall | Das System war über eine bestimmte Strecke betriebsfähig und hat die dabei aufgetretenen Situationen bewältigt | Welche kritischen Situationen darin vorkamen; ob sie überhaupt vorkamen; wie das System in nicht aufgetretenen Fällen reagiert |
| Simulationsläufe | Verhalten in den modellierten Situationen, wiederholbar und mit Abstand zur Fehlergrenze messbar | Verhalten in Situationen außerhalb des Modells; ob die Sensorik unter realen Bedingungen dieselben Eingangsdaten liefert |
| Öffentliche Vorführung | Die gezeigte Aufgabe ist unter den gewählten Bedingungen mindestens einmal lösbar | Wiederholbarkeit; Verhalten bei ungünstigen Bedingungen; Anteil menschlicher Eingriffe, sofern er nicht offengelegt wird |
| Pilotbetrieb mit Sicherheitsfahrer | Alltagstauglichkeit im gewählten Gebiet unter Aufsicht; Rückmeldungen aus echten Situationen | Betrieb ohne Aufsicht; Übertragbarkeit auf ein anderes Gebiet, eine andere Verkehrskultur, ein anderes Klima |
| Interne Prüfberichte des Herstellers | Das Unternehmen hat die genannten Fälle geprüft und dokumentiert | Dass die Auswahl der Fälle vollständig ist; ohne unabhängige Prüfung bleibt der Umfang eine Selbstauskunft |
| Zulassung nach Sicherheitsnachweis | Ein geführtes Argument samt Belegen wurde gegen festgelegte Anforderungen geprüft, einschließlich des Managementsystems dahinter | Sicherheit in nicht bedachten Situationen; Gültigkeit nach einer wesentlichen Änderung der Software; Aussagen über andere Fahrzeugtypen desselben Herstellers |
Die Belegarten sind dabei nicht austauschbar, sondern ergänzen einander — der Sicherheitsnachweis verlangt gerade deshalb mehrere davon nebeneinander. Keine Zeile ist zugleich eine Wertung über einen bestimmten Anbieter, denn geprüft wird hier nicht, wer besser ist, sondern ob eine vorgelegte Aussage überhaupt eine Aussage über den Betrieb ist.
Was die Softwareseite über Körper verrät
Systeme ohne Körper haben denselben Sprung vor sich, und weil sie billiger zu prüfen sind, liegen für sie mehr Messungen vor. Ein Blick dorthin lohnt deshalb, auch wenn die Übertragung ihre Grenzen hat.
Eine begutachtete Untersuchung der Carnegie Mellon University und der Duke University hat eine vollständige Firma nachgebaut und Agenten darin 175 realitätsnahe Büroaufgaben erledigen lassen. Das beste getestete System brachte 30,3 Prozent der Aufgaben eigenständig zu Ende, mit angerechneten Teilerfolgen 39,3 Prozent. Das ist ein Laborwert aus einer nachgebauten Umgebung und keine Aussage über einen konkreten Betrieb, aber die Größenordnung ist unbequem.
Aufschlussreicher für unsere Frage ist eine zweite Arbeit von Sierra AI und der Princeton University. Sie prüft nicht nur, ob ein Agent eine Aufgabe löst, sondern ob er dieselbe Aufgabe achtmal hintereinander löst. Führende Systeme mit Werkzeugzugriff liegen dort insgesamt unter 50 Prozent gelöster Aufgaben; verlangt man acht durchgängige Erfolge in Folge, fällt die Quote im geprüften Handelsszenario unter 25 Prozent. Die Werte stammen aus zwei Anwendungsbereichen mit simulierten Nutzern und einem Modellstand von Mitte 2024, sind also nicht der heutige Stand — die Beobachtung dahinter bleibt trotzdem gültig.
Diese Beobachtung lautet: Ein System kann eine Aufgabe beherrschen und sie trotzdem nicht zuverlässig wiederholen. Für einen Büroagenten bedeutet das Nacharbeit. Für ein Fahrzeug bedeutet dieselbe Streuung etwas anderes, weil der schlechte Durchlauf sich nicht zurücknehmen lässt. Genau deshalb misst ein Sicherheitsnachweis nicht die durchschnittliche Leistung, sondern den Abstand zur Fehlergrenze im ungünstigsten geprüften Fall.
Ein dritter Befund betrifft die Fehlerarten. Eine Gruppe am Sky Computing Lab der UC Berkeley hat über 1.600 annotierte Ausführungsspuren aus sieben verbreiteten Rahmenwerken für Mehr-Agenten-Systeme ausgewertet und daraus 14 Fehlermodi in drei Kategorien abgeleitet, bei einer Übereinstimmung der Annotatoren von 0,88 nach Cohens Kappa. Das ist ausdrücklich eine Fehlertaxonomie und keine Messung von Fehlerraten. Ihr Wert liegt woanders: Sie zeigt, dass ein großer Teil der Fehler nicht im einzelnen Baustein entsteht, sondern im Zusammenspiel — in unklaren Zuständigkeiten, verlorenen Zwischenergebnissen, abgebrochenen Abstimmungen. Ein autonomes Fahrzeug ist ebenfalls ein Verbund aus Wahrnehmung, Vorhersage, Planung und Steuerung, und die Regelung verlangt das auditierte Managementsystem genau deshalb über den gesamten Lebenszyklus statt über einzelne Komponenten.
Der Nachweis endet nicht mit der Zulassung
Die vierte Anforderung der Regelung ist die, die sich am wenigsten in eine Schlagzeile fügt und im Alltag die größte Wirkung entfaltet. Ein zugelassenes Fahrsystem bleibt unter Beobachtung, und die Überwachung ist Teil des Nachweises, nicht eine freiwillige Zugabe danach.
Der Grund liegt in der Natur lernender Systeme und in der Natur der Software insgesamt. Ein Fahrzeug, das im Frühjahr geprüft wurde, fährt im Herbst mit anderer Software, weil Fehler behoben und Fähigkeiten ergänzt wurden. Jede solche Änderung kann das Verhalten in Situationen verschieben, die mit der Änderung nichts zu tun haben — das ist bei komplexer Software die Regel und nicht die Ausnahme. Ein Nachweis, der einmal geführt und dann abgelegt würde, wäre nach dem ersten größeren Update eine Aussage über ein Fahrzeug, das es so nicht mehr gibt.
Damit verschiebt sich auch, was ein Hersteller organisatorisch vorhalten muss. Es genügt nicht, eine Entwicklungsabteilung zu haben, die ein gutes System baut. Es braucht eine Stelle, die Feldereignisse systematisch erfasst, sie den Behauptungen im Sicherheitsnachweis zuordnet und entscheidet, ob eine Behauptung noch trägt. Wer schon einmal gesehen hat, wie lange in einem großen Unternehmen die Zuordnung einer einzelnen Störung zu einer Produktannahme dauert, ahnt, warum die Regelung an dieser Stelle von einem auditierten Managementsystem spricht und nicht von einem Ablauf.
Für Fahrgäste und für Kommunen, die solche Fahrzeuge zulassen, hat das eine begrüßenswerte Folge. Die interessante Frage an einen Betreiber ist nicht mehr, wie viele Fahrzeuge er im Einsatz hat, sondern wie schnell ein auffälliges Ereignis aus dem Feld in eine geprüfte Änderung mündet. Diese Kennzahl ist unbequem, weil sie sich nicht schönen lässt, und sie ist aussagekräftiger als jede Flottengröße.
Außerhalb der Straße fehlt die Regelung

Die neue Regelung gilt für Fahrzeuge im Straßenverkehr. Der größere Teil dessen, was heute als Physical AI angeboten wird, fährt jedoch nicht auf der Straße: Transportroboter in Lagerhallen, autonome Fahrzeuge auf Werksgeländen, mobile Manipulatoren in der Fertigung, Inspektionsroboter in Anlagen. Für sie gibt es kein Gremium, das eine vergleichbare internationale Regelung beschlossen hätte.
Was es gibt, ist der allgemeine Rechtsrahmen für Maschinen. In der Europäischen Union wird die Maschinenverordnung 2023/1230 ab dem 20. Januar 2027 anwendbar; hinzu kommt die KI-Verordnung der Union mit ihren eigenen, gestaffelten Fristen. Wie beide auf ein konkretes System wirken, hängt an dessen Zweckbestimmung und ist im Einzelfall zu klären — das gilt etwa für ferngesteuerte Manipulatoren beim Rückbau von Kernkraftwerken, die ohne eigene internationale Zulassungsregel auskommen müssen. Wie diese Vorgaben im Einzelfall zusammenwirken, hängt an der konkreten Maschine, ihrem Einsatzzweck und der Rolle des Betreibers — diese Einordnung ist redaktionell und ersetzt keine rechtliche Prüfung.
Ein Missverständnis ist an dieser Stelle verbreitet genug, um es auszuräumen. Die CE-Kennzeichnung an einem autonomen Transportroboter ist eine Erklärung des Herstellers, dass er die für sein Produkt geltenden Anforderungen als erfüllt ansieht. Sie ist kein behördliches Siegel, keine Prüfung durch einen Dritten und schon gar kein Nachweis darüber, wie sich das Gerät in seltenen Situationen verhält. Wer ein solches Gerät in Betrieb nimmt, übernimmt eine eigene Verantwortung für die Umgebung, in der es fährt.
Daraus ergibt sich eine Ungleichheit, die man kennen sollte. Ein Fahrzeug auf öffentlicher Straße muss künftig ein geführtes Argument vorlegen, das gegen festgelegte Anforderungen geprüft wird. Ein Roboter auf dem Werksgelände muss das nicht, obwohl er sich in einer Umgebung mit Menschen bewegt, die ihn nicht erwarten — Besucher, Handwerker, Aushilfen im ersten Monat. Der Beschluss vom Juni setzt deshalb einen Maßstab, der weit über seinen Geltungsbereich hinaus nützlich ist: Ein Betreiber kann dieselben vier Fragen stellen, auch wenn kein Gesetz ihn dazu zwingt.
Welche Fragen ein vorgeführtes System beantworten muss
Auf der HumanX Europe 2026, die vom 22. bis 24. September im RAI Amsterdam läuft, hat dieses Feld eine eigene Ausstellungsfläche, das Physical AI Pavilion. Zwei Programmpunkte tragen die Titel „Physical AI Meets Real-World Autonomy“ und „The Race to Build Real-World Intelligence“. Beide Formulierungen setzen voraus, dass zwischen dem, was gezeigt wird, und dem, was draußen funktioniert, eine Lücke besteht — sonst müsste man weder von einem Treffen mit der Autonomie in der realen Welt noch von einem Rennen um reale Intelligenz sprechen.
Wer dort oder anderswo vor einem vorgeführten System steht, hat seit dem 24. Juni 2026 einen Maßstab zur Hand, den es vorher nicht gab. Die vier Anforderungen der Regelung lassen sich in vier Fragen übersetzen, und sie funktionieren auch bei Systemen, für die die Regelung gar nicht gilt.
Die erste Frage betrifft den Einsatzbereich: Für welche Umgebung, welches Wetter, welche Geschwindigkeiten und welche Nutzergruppen gilt die gezeigte Leistung, und was passiert am Rand dieses Bereichs? Ein Anbieter, der den Bereich nicht eng beschreiben kann, hat ihn nicht festgelegt.
Die zweite Frage betrifft die Fallauswahl: Welche kritischen Situationen wurden geprüft, wie wurde diese Liste zusammengestellt, und welche Situationen stehen bewusst nicht darauf? Die ehrlichste Antwort auf diese Frage enthält eine Aufzählung der bekannten Lücken.
Die dritte Frage betrifft die Belege: Woraus stammt die Aussage — aus Simulation, Prüfgelände, überwachtem Feldbetrieb oder aus einer Auswertung von Betriebsdaten? Weil jede dieser Quellen etwas anderes trägt, entscheidet erst die Herkunft darüber, wie schwer eine Zahl wiegt.
Die vierte Frage betrifft die Zeit danach: Wie wird ein auffälliges Ereignis aus dem Betrieb erfasst, wer bewertet es, und wie lange dauert es, bis daraus eine geprüfte Änderung wird? Diese Frage ist die unangenehmste, weil sie sich nicht mit einer Folie beantworten lässt.
Keine der vier Fragen zielt darauf, ein System schlechtzureden. Sie zielen darauf, eine Aussage einordbar zu machen, und genau das war vor dem Beschluss vom Juni schwer, weil ein gemeinsamer Bezugspunkt fehlte. Dass sechs große Wirtschaftsräume sich auf diesen Bezugspunkt geeinigt haben, ist die eigentliche Nachricht — der Rest ist Arbeit, und die beginnt jetzt erst.
Quellen. Alle Adressen wurden am 13. September 2026 geprüft. Wo eine Seite automatisierte Abrufe abweist, wurde sie im Browser geöffnet und der Inhalt gegen die Nennung abgeglichen.
- UNECE, Mitteilung zur Verabschiedung der weltweit ersten Regelung für vollautonome Fahrsysteme, 24. Juni 2026 — Anforderungen an Sicherheitsmanagementsystem, Testumgebungen, Validierung nach Sicherheitsnachweis und Betriebsüberwachung.
- UNECE, Working Party on Automated/Autonomous and Connected Vehicles (GRVA).
- Wayve (Herstellerangaben): GAIA-4 und Scaling Embodied AI for Autonomous Driving with Microsoft Azure.
- PlusAI (Anbieterseite, als Produktbeleg herangezogen, nicht als Zahlenbeleg): Super Camera Fusion.
- Yao et al., τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains, Sierra AI und Princeton University; Modellstand Mitte 2024.
- Cemri et al., Why Do Multi-Agent LLM Systems Fail?, Sky Computing Lab, UC Berkeley — Fehlertaxonomie aus über 1.600 annotierten Ausführungsspuren, keine Messung von Fehlerraten.
- Xu et al., TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks, Carnegie Mellon University und Duke University, NeurIPS 2025.
- HumanX Europe 2026, Programm — Titel, Zeiten und Formate der genannten Programmpunkte sowie das Physical AI Pavilion.
Angaben von Wayve und PlusAI sind Herstellerangaben und nicht unabhängig geprüft. Die Ausführungen zur Rechtslage sind eine redaktionelle Einordnung und keine Rechtsberatung.
Gilt die UNECE-Regelung vom 24. Juni 2026 automatisch auch in Deutschland?
Nicht von selbst. Regelungen des Weltforums WP.29 wirken über die Rechtsordnungen der beteiligten Vertragsparteien, und die Europäische Union gehört zu den tragenden Parteien dieser Regelung. Wann und in welcher Form sie sich in nationalen Zulassungsverfahren auswirkt, hängt von der jeweiligen Umsetzung ab. Diese Einordnung ist redaktionell und keine Rechtsberatung.
Wie viele Kilometer müsste ein System fahren, um als sicher zu gelten?
Die Regelung nennt bewusst keine Kilometerzahl. Eine Strecke sagt nicht, welche Situationen darin vorkamen, und gerade die seltenen Situationen entscheiden über die Sicherheit. Gefordert ist stattdessen ein geführter Sicherheitsnachweis, in dem jede Teilbehauptung ihren eigenen Beleg trägt — eine Fahrleistung kann einer dieser Belege sein, sie ersetzt das Argument aber nicht.
Braucht ein Transportroboter in einer Lagerhalle ebenfalls einen Sicherheitsnachweis?
Eine Regelung wie die der UNECE gibt es für ihn nicht, weil sie für Fahrzeuge im Straßenverkehr gilt. Maßgeblich sind der allgemeine Rechtsrahmen für Maschinen und die Verantwortung des Betreibers für die Umgebung, in der das Gerät fährt. Die vier Anforderungen der Fahrzeugregelung lassen sich trotzdem als Maßstab verwenden, auch wo keine Pflicht dazu besteht. Diese Einordnung ist redaktionell und keine Rechtsberatung.
Bedeutet eine CE-Kennzeichnung, dass ein autonomer Roboter geprüft wurde?
Nein. Die CE-Kennzeichnung ist eine Erklärung des Herstellers, dass er die für sein Produkt geltenden Anforderungen als erfüllt ansieht. Sie ist kein behördliches Siegel und für sich genommen keine Prüfung durch einen unabhängigen Dritten. Über das Verhalten eines Systems in seltenen Situationen sagt sie nichts aus.
Zählt ein simulierter Kilometer so viel wie ein echter?
Beide belegen Verschiedenes. Die Simulation liefert Wiederholbarkeit und erlaubt seltene Situationen, die sich auf der Straße nicht gefahrlos herstellen lassen; sie bildet aber nur ab, was in ihrem Modell steckt. Der reale Kilometer prüft, ob Sensorik und Mechanik unter echtem Licht, Schmutz und Vibration liefern, womit die Modelle gerechnet haben. Die neue Regelung erkennt virtuelle Werkzeugketten deshalb an, verlangt aber eine Begründung ihrer Übertragbarkeit.
Was passiert mit einer Zulassung, wenn die Software aktualisiert wird?
Genau dafür verlangt die Regelung ein auditiertes Sicherheitsmanagementsystem über den gesamten Lebenszyklus und eine fortlaufende Überwachung im Betrieb. Eine Änderung kann Verhalten in Situationen verschieben, die mit der Änderung nichts zu tun haben, weshalb der Sicherheitsnachweis gepflegt und nicht abgelegt wird. Wie eine einzelne Änderung im Zulassungsverfahren behandelt wird, entscheidet sich am konkreten Fall.
Wer prüft den Sicherheitsnachweis eines Herstellers?
Die Regelung verlangt ein auditiertes Managementsystem über den gesamten Lebenszyklus und eine Validierung gegen festgelegte Anforderungen. Wer die Prüfung vornimmt, richtet sich nach dem Zulassungsverfahren der jeweiligen Vertragspartei. Ein rein intern erstellter Prüfbericht bleibt ohne diese Instanz eine Selbstauskunft über den Umfang der geprüften Fälle.
Woran erkenne ich, dass eine Herstellerzahl belastbar ist?
An der Angabe ihrer Herkunft. Eine Zahl aus einer Simulation, eine vom Prüfgelände, eine aus überwachtem Feldbetrieb und eine aus der Auswertung von Betriebsdaten tragen verschiedene Aussagen, und erst die Herkunft macht sie vergleichbar. Fehlt diese Angabe, lässt sich die Zahl nicht einordnen — unabhängig davon, wie hoch sie ist.
Warum scheitern autonome Systeme oft im Zusammenspiel und nicht an einer einzelnen Funktion?
Eine Auswertung von über 1.600 Ausführungsspuren aus sieben Rahmenwerken für Mehr-Agenten-Systeme am Sky Computing Lab der UC Berkeley ordnet die beobachteten Fehler 14 Modi in drei Kategorien zu; ein erheblicher Teil davon entsteht zwischen den Bausteinen statt in ihnen — unklare Zuständigkeiten, verlorene Zwischenergebnisse, abgebrochene Abstimmungen. Das ist eine Fehlertaxonomie und keine Messung von Fehlerraten. Übertragen auf ein Fahrzeug erklärt sie, warum die Prüfung am Gesamtsystem ansetzt und nicht an einzelnen Komponenten.
Was sollte ein Betreiber vor der Inbetriebnahme eines autonomen Systems klären?
Vier Punkte tragen die meiste Last: die genaue Beschreibung des Einsatzbereichs samt Verhalten an seinem Rand, die Liste der geprüften kritischen Situationen einschließlich der bewusst ausgelassenen, die Herkunft jeder genannten Leistungszahl und der Weg, auf dem ein auffälliges Ereignis aus dem Betrieb zu einer geprüften Änderung führt. Die letzte Frage ist die aussagekräftigste, weil sie sich nicht mit einer Präsentationsfolie beantworten lässt.