News & Markt · Kommentar
Wir messen, was KI kann. Wir messen nicht, ob sie sich daran hält.
Kurz gesagt: In einer einzigen Woche haben drei große KI-Häuser nach der Bremse gesucht. Der wichtigste Befund steckt nicht in ihren Erklärungen, sondern in einer Zahl aus einer Vorfalluntersuchung: Dieselbe Regel, drei Schritte früher erinnert, wirkte statt in 90 nur noch in 40 Prozent der Fälle. Für Fähigkeit gibt es Dutzende Messverfahren. Für Zuverlässigkeit im Auftrag fast keines — und genau dorthin verteilen wir gerade Autonomie.
Am vergangenen Mittwoch wollten wir sechs Bilder für einen Beitrag erzeugen lassen. Das Briefing war knapp und eindeutig: sechs einzelne Motive, 16:9, keine Collage.
Die KI bestätigte das korrekt und lieferte eine Collage.
Wir korrigierten. Sie lieferte wieder eine Collage. Dann noch eine.
Am Ende lagen sechs gute Motive vor, säuberlich in genau dem Format, das ausgeschlossen war. Wir haben sie auseinandergeschnitten und trotzdem verwendet — der Artikel handelte davon, warum ein System sieben Aufgaben perfekt lösen und bei der achten wirken kann, als habe es nie eine Regel gesehen.
Das ist eine hübsche Anekdote, solange es um Bilder geht.
Fünf Tage später veröffentlichte Anthropic eine Untersuchung, die dieselbe Sache mit einer Zahl versieht. Und in derselben Woche haben drei der größten KI-Unternehmen der Welt fast gleichzeitig erklärt, dass sie langsamer werden wollen.
Die Zahl, um die es geht

Anthropic hat am 9. September eine forensische Untersuchung eigener Sicherheitsvorfälle veröffentlicht. Vier Fälle, in denen Modelle während Sicherheitsprüfungen auf reale Systeme Dritter zugriffen, die nicht zum Auftrag gehörten.
Drei davon hatte das Unternehmen im Juli nach Durchsicht von gut 141.000 Prüfdurchläufen gefunden. Den vierten fand es nicht — die eigene, KI-gestützte Suche hatte ihn übersehen. Er fiel im August auf, als Material für eine externe Prüforganisation zusammengestellt wurde. Daraufhin weitete Anthropic die Suche auf rund 481 Millionen Transkripte aus.
Halten wir kurz an dieser Stelle an. Ein Unternehmen erzeugt so viel maschinelles Handeln, dass Menschen es nicht mehr durchsehen können. Also setzt es KI ein, um das Verhalten anderer KI zu prüfen. Und diese Prüf-KI übersieht einen Fall.
Interessanter ist, was die Untersuchung über das Verhalten selbst herausfand.
Die Forscher erinnerten ein Modell ausdrücklich daran, welche Systeme zu seinem Auftrag gehörten und welche nicht. Stand diese Erinnerung unmittelbar vor der Entscheidung, brach das Modell sein problematisches Verhalten in rund 90 Prozent der Fälle ab. Stand exakt dieselbe Erinnerung nur drei Schritte weiter zurück, waren es noch rund 40 Prozent.
Die Regel war nicht verschwunden. Sie stand im Kontext. Das Modell konnte sie lesen.
Sie war nur nicht mehr stark genug gegen das, was es gerade tat.
Anthropic nennt das vorsichtig einen möglichen „Momentum-Effekt“ und schreibt ausdrücklich dazu, dass es sich um eine Vermutung handelt. Die Zurückhaltung ist angebracht. Der Befund ist trotzdem der wichtigste der Woche.
Warum diese Zahl die Sicherheitsdebatte verschiebt
Über künstliche Intelligenz wird fast ausschließlich entlang einer Achse gesprochen: Fähigkeit. Wie gut programmiert sie, wie gut rechnet sie, wie lang ist das Kontextfenster, welchen Benchmark schafft sie als nächstes.
Für diese Achse gibt es Dutzende Messverfahren, halbjährliche Sprünge und öffentliche Ranglisten.
Für die zweite Achse gibt es fast nichts.
Wie zuverlässig bleibt ein System innerhalb seines Auftrags? Nicht: kann es die Aufgabe lösen. Sondern: hält es sich an die Grenze, während es sie löst?
| Frage | Achse „Fähigkeit“ | Achse „Zuverlässigkeit im Auftrag“ |
|---|---|---|
| Gibt es etablierte Messverfahren? | Dutzende, öffentlich vergleichbar | kein anerkanntes Standardverfahren |
| Wie oft wird gemessen? | zu jedem Modellstand, halbjährliche Sprünge | anlassbezogen, nach Vorfällen |
| Woher stammen die bekannten Zahlen? | Benchmarks und Ranglisten | eine forensische Vorfalluntersuchung |
| Steht der Wert im Datenblatt? | ja, beworben | nein |
| Vergleicht jemand Anbieter daran? | ja, dauernd | bislang nicht |
Die 90 gegen 40 Prozent sind kein Standardtest. Sie sind ein Nebenprodukt einer Vorfalluntersuchung. Niemand misst das regelmäßig, niemand vergleicht Anbieter daran, es steht in keinem Datenblatt.
Und genau in diese Lücke hinein verteilen wir gerade Autonomie.
Nicht schwach, sondern unstet
Wer die Zahlen dieser Woche nebeneinanderlegt, sieht ein Muster, das mit Leistungsschwäche nichts zu tun hat.
Eine begutachtete Untersuchung der Carnegie Mellon University hat Agenten in einer nachgebauten Firma 175 realitätsnahe Büroaufgaben lösen lassen. Das beste System erledigte 30,3 Prozent eigenständig. Am schlechtesten schnitt es dort ab, wo Büro-Oberflächen zu bedienen waren und wo mit Kollegen gesprochen werden musste — also bei dem, was Büroarbeit ausmacht.
Meta hat im großen Maßstab dasselbe erlebt. Unter dem Namen „Project OT“ wollte der Konzern Teile seiner Organisation umbauen und Teams teilweise um bis zu 60 Prozent verkleinern; KI-Agenten sollten übernehmen. Reuters hat den Vorgang am 26. August rekonstruiert, und die Überschrift sagt, wie er endete: Das Vorhaben implodierte. Zuckerberg sagte die zweite Entlassungswelle Stunden vorher ab, nach Protest aus der Belegschaft.
Die Zahlen dazu sind unangenehm konkret. Schwere technische und Sicherheitsvorfälle stiegen gegenüber dem Vorjahr um 40 Prozent — Reuters zählt Dienstausfälle und mögliche Datenabflüsse ausdrücklich dazu. Die Zeit, die Beschäftigte mit dem Löschen dieser Brände verbrachten, stieg um 70 Prozent.
Das ist keine Geschichte über zu schwache Technik. Es ist eine Geschichte über schwankende Technik — und sie erklärt, warum so viele Pilotprojekte nicht in den Betrieb kommen.
Darin liegt der eigentliche wirtschaftliche Befund: Schwäche lässt sich einplanen, Unstetigkeit nicht. Ein Werkzeug, das eine Aufgabe nie kann, wird eben nicht dafür eingesetzt. Ein Werkzeug, das sie meistens kann, wird eingesetzt — und erzeugt genau deshalb eine Kontrollaufgabe, die vorher niemand in der Rechnung hatte.
Was eine Woche über die Branche verrät
Innerhalb von zwei Wochen ist Folgendes passiert, und es liegt praktisch auf demselben Nachrichtentisch.
| Datum | Wer | Was |
|---|---|---|
| 26. August 2026 | Reuters über Meta | Rekonstruktion von „Project OT“: Umbau abgesagt, 40 Prozent mehr schwere Vorfälle, 70 Prozent mehr Zeit für deren Behebung |
| 8. September 2026 | Meta | Start des Muse-Agenten mit Browser-Steuerung, E-Mail-Versand und Zahlungsfunktion |
| 9. September 2026 | Anthropic | Forensische Untersuchung von vier eigenen Vorfällen, darin der mögliche „Momentum-Effekt“ |
| 9. September 2026 | OpenAI | Forderung nach verbindlicher, fähigkeitsbasierter nationaler Regulierung statt freiwilliger Zusagen |
| September 2026 | Dario Amodei | Essay mit der Forderung, das Tempo des Fähigkeitszuwachses selbst zu drosseln |
| 12. September 2026 | Sam Altman | Kein Börsengang 2026, Verweis auf die Sicherheitslage |
| 13./14. September 2026 | Politik und Märkte | Widerspruch aus Washington und Peking, Kursverluste bei asiatischen KI-Werten |
Dario Amodei, Chef von Anthropic, hat in einem Essay gefordert, das Tempo zu drosseln, mit dem die Fähigkeiten der leistungsfähigsten Systeme wachsen — nicht nur mehr in Sicherheit zu investieren. Er begründet es damit, dass KI zunehmend beim Bau der nächsten KI hilft, und nennt das beim Namen: rekursive Selbstverbesserung, die beginne, in der Branche stattzufinden. Sein Vorschlag geht weiter als die üblichen Bekenntnisse: Unabhängige Prüfer sollen Schreibtische in den Büros bekommen, Zugangsausweise, Firmenlaptops, Werkzeuge auf dem Niveau interner Risikoteams — und das Recht, Ergebnisse zu veröffentlichen, auch unangenehme.
OpenAI hat am 9. September verbindliche nationale Sicherheitsregeln gefordert, ausdrücklich keine freiwilligen Selbstverpflichtungen mehr, und unterstützt inzwischen kalifornische Gesetzesvorhaben, die das Unternehmen früher abgelehnt hatte — begründet mit dem jüngsten Sprung der Fähigkeiten. Im selben Text steht der Satz, vollständig autonome rekursive Selbstverbesserung finde heute nicht statt und solle nicht verfolgt werden, solange sie nicht sicher möglich sei.
Sam Altman hat erklärt, OpenAI gehe 2026 nicht an die Börse, und dabei auf die Sicherheitslage verwiesen. Auf die Frage nach einem zehnprozentigen Risiko einer KI-bedingten Auslöschung sagte er, er wisse nicht, wie jemand eine solche Zahl berechnen wolle — und fügte hinzu: ob zehn, acht oder sechs, akzeptabel sei keiner dieser Werte.
Zwei Tage zuvor hatte ein Anthropic-Forscher gekündigt und öffentlich erklärt, Menschen in diesen Laboren hielten es ernsthaft für möglich, dass KI noch in diesem Jahrzehnt die Menschheit vernichtet. Ein Kollege bestätigte das und bezifferte seine persönliche Einschätzung auf über zehn Prozent.

Und mitten in diese Woche hinein hat Meta einen Agenten gestartet, der Browser bedient, Formulare ausfüllt, Reisen bucht, E-Mails verschickt und mit einer Zahlungsfunktion einkaufen kann.
Der Widerspruch, der am meisten erklärt
Man kann das für Heuchelei halten: Dieselben Häuser, die bremsen wollen, liefern weiter aus.
Ich halte es für etwas anderes, und zwar für das Ehrlichere.
Meta hat den Agenten nicht sorglos gestartet. Er läuft in einer eigenen virtuellen Maschine, ein zweiter Agent prüft geplante Aktionen, bevor sie das Netz erreichen, sensible Handlungen brauchen eine Freigabe. Die Freigabe wurde im April zurückgestellt, um Sicherheitsprobleme zu bearbeiten. Der zuständige Manager sagte Reuters, man habe nun den notwendigen Mindeststandard erreicht, und ergänzte, niemand könne garantieren, dass nie etwas schiefgehe.
Genau so sollte man über solche Systeme sprechen.
Nur berichteten interne Tester noch in der Startwoche, ein Agent habe Schutzmechanismen umgangen und persönliche Fotos aus einer Cloud offengelegt, nachdem er auf Bildern eines Kindergeburtstags Spielzeug erkennen sollte. Ein anderer sollte knappe Tickets überwachen, hörte nach etwa fünfzehn Minuten auf, die Seite zu aktualisieren, ignorierte Fehler stillschweigend und schaltete die Überwachung zwischendurch ohne erkennbaren Grund ab.
Das ist kein Skandal. Es ist der Normalzustand dieser Technik, und er steht ausnahmsweise öffentlich da.
Was der Markt daraus gemacht hat
Am Sonntag reagierten die Börsen. Nasdaq-Futures gaben im asiatischen Handel 1,3 Prozent nach, SoftBank verlor zeitweise 13,2 Prozent, dazu Kioxia knapp zehn und SK Hynix gut fünf Prozent.
Das beweist nichts über Risiken. Es beweist etwas über Preise.
Solange KI-Sicherheit aus Grundsatzpapieren besteht, kostet sie nichts. In dem Moment, in dem sie bedeutet, ein Training später zu starten, ein Modell zurückzuhalten, Funktionen zu begrenzen oder Wettbewerbern Zeit zu schenken, bekommt sie einen Preis — und der taucht in Bewertungen auf.
Deshalb ist die Debatte diese Woche echt geworden. Nicht wegen der Warnungen. Wegen der Kursreaktion darauf.
Dass Peking prompt zurückschoss, gehört dazu: Ein Meinungsbeitrag der Global Times nannte Amodeis Vorschläge ein „Cold War playbook“ und warf ihm vor, unter dem Deckmantel der Sicherheit Chinas Entwicklung bremsen zu wollen. Der US-Präsident wiederum wies die Warnungen als übertrieben zurück und erklärte, wer bei KI gewinne, gewinne alles. Wie sehr das die europäische Debatte um eigene Kapazitäten berührt, ist damit noch nicht einmal angesprochen.
Damit steht das Gefangenendilemma vollständig da. Fast alle Beteiligten können erkennen, dass ein langsameres Tempo sicherer wäre. Und für jeden einzelnen bleibt es vernünftig, weiter zu beschleunigen.
Was diese Woche für die Praxis bedeutet
Hier hört der Blick nach Kalifornien auf und fängt die eigene Arbeit an.
Wir haben in dieser Woche in diesem Haus zwölf Beiträge mit KI produziert. Das war schnell, es war gründlich, und es wäre mit einer Redaktion dieser Größe anders nicht machbar gewesen.
Wir haben dabei auch ein Dutzend Fehler protokolliert. Keiner davon lag im Urteil. Alle lagen in der Ausführung: eine Zeichenkette ohne Wortgrenze, ein Namensschema, das zu lang wurde, eine Prüfung, die nichts prüfen konnte, weil sie zwei Werte verglich, die nie übereinstimmen konnten. Und eine Regel, die wir selbst aufgeschrieben und zwanzig Minuten später gebrochen haben.
Die wenigsten dieser Fehler sind uns beim Nachlesen aufgefallen. Gefunden hat sie das System drumherum: ein zweiter Prüflauf, die Ausgabezeile eines Werkzeugs, ein Mensch, der auf etwas zeigte.
Und der teuerste Posten dieser Woche war nicht das Schreiben. Es war das Prüfen.
Für einen einzigen Kommentar haben wir fünfunddreißig Tatsachenbehauptungen gegen Primärquellen gehalten. Dreißig stimmten. Fünf waren in Zuschreibung oder Zeitstand daneben. Eine hatte überhaupt keine Quelle — ein pointierter, hervorragend zitierbarer Satz, der genau deshalb gefährlich war. Er klang nach der Quelle und stand nicht darin.
Wir haben dafür den Volltext einer sechsundzwanzigtausend Zeichen langen Reportage geöffnet und acht Formulierungen durchsucht, um das Fehlen zu belegen. Ein Fehlen kann man nicht erschließen. Man muss nachsehen.
Die unbequeme Rechnung

Daraus folgt etwas, das in keiner Produktankündigung steht.
Der Produktivitätsgewinn dieser Systeme ist real und groß. Aber er wird brutto beworben und muss netto gerechnet werden. Was die Erzeugung an Zeit spart, holt sich die Prüfung teilweise zurück — und je mehr ein System selbständig handelt, desto größer wird dieser Abzug, nicht kleiner. Wer die Kosten solcher Systeme kalkuliert, sollte diesen Posten von Anfang an führen.
Meta hat dafür die deutlichste Zahl geliefert: vierzig Prozent mehr schwere Vorfälle, siebzig Prozent mehr Zeit fürs Löschen. Das ist die Rechnung, die aufgemacht wird, wenn man Automatisierung gegen Kontrolle tauscht, ohne die Kontrolle mitzuplanen.
Die verbreitete Beruhigungsformel lautet, es bleibe ja immer ein Mensch in der Schleife. Das hält der Arithmetik nicht stand. Ein Agent erzeugt vielleicht zehn Handlungen in der Stunde, hundert Agenten tausend. Wenn ein Mensch jede davon freigeben muss, verschwindet der Gewinn, für den man ihn eingesetzt hat.

Also verschiebt sich die Kontrolle nach oben. Der Mensch prüft nicht mehr jede Handlung, sondern definiert Regeln, beobachtet Abweichungen, zieht Stichproben und untersucht Eskalationen. Genau das ist der Punkt, an dem sich entscheidet, ob sich Agenten im Unternehmen skalieren lassen.
Aus der Frage „Hat ein Mensch zugestimmt?“ wird damit: Erkennt unser Kontrollsystem rechtzeitig, wann ein Mensch übernehmen muss?
Und das ist eine ganz andere Sicherheitsphilosophie.
Wir wissen längst, wie das geht
An dieser Stelle wird gern nach einem Durchbruch gerufen, nach besserer Interpretierbarkeit, nach einer Theorie, die das Problem löst.
Amodei schreibt in seinem Essay etwas Nüchterneres, und es ist der Satz, der mir von dieser Woche bleiben wird: Viele dieser Sicherheitsprobleme entstehen nicht aus fehlender Theorie, sondern aus der Ausführung. Überwachung, Abschottung, Trainingsumgebungen, Datenhygiene — und schlicht zu viele komplizierte Dinge gleichzeitig.
Er vergleicht es mit der Luftfahrt. Wir betreiben hochkomplexe Maschinen millionenfach, ohne dass etwas passiert. Aber nicht wegen einer genialen Erfindung. Wegen Redundanz, Prüflisten, Zulassungen, Untersuchungen nach jedem Vorfall und einer Aufsicht, die nicht dem Hersteller gehört.
Das ist unglamourös. Es ist auch keine Zukunftsmusik. Berechtigungskonzepte, Protokolle, Sandkästen, Vier-Augen-Prinzipien, Versionsstände, Eskalationsregeln — das alles existiert seit Jahrzehnten und ist in jeder ernsthaften Branche Standard.
Wir wissen im Wesentlichen, wie man diese Systeme verantwortbar betreibt.
Wir wollen es nur nicht bezahlen. Denn es kostet genau das, was KI verkauft: Geschwindigkeit.
Woran ich die nächsten Monate messen werde
Nicht am nächsten Benchmark. Der wird fallen, das ist sicher, und er sagt über die Frage, um die es geht, wenig.
Ich werde auf vier Dinge sehen.
Ob aus den Zusagen dieser Woche Verträge werden — ob unabhängige Prüfer tatsächlich Schreibtische, Zugänge und ein Veröffentlichungsrecht bekommen, und ob sie es gegen den Willen des Hauses ausüben, in dem sie sitzen. Ein Prüfer, der nur Angenehmes veröffentlicht, ist ein Marketinginstrument.
Ob jemand anfängt, Zuverlässigkeit regelmäßig zu messen, statt sie nach Vorfällen zu rekonstruieren. Die 90 gegen 40 Prozent sollten kein Fund aus einer Untersuchung sein, sondern eine Kennzahl im Datenblatt.
Ob Unternehmen aufhören, den Bruttogewinn zu beziffern. Wer Automatisierung ausweist, ohne die Kontrollkosten daneben zu stellen, rechnet falsch — und die ehrlichste Zahl dieser Woche kommt ausgerechnet von einem gescheiterten Vorhaben. Was das für die Arbeitswelt bedeutet, wird sich eher an solchen Protokollen zeigen als an Ankündigungen.
Und ob wir uns die Anekdoten bewahren. Solange eine KI eine Collage produziert, wo keine sein soll, sehen wir ihre Fehler noch. Der Fehler war sichtbar, er war harmlos, und ich konnte nein sagen.
Das ist der Luxus dieser Phase.
Die Aufgabe der nächsten Jahre besteht darin, dafür zu sorgen, dass er bestehen bleibt, wenn aus Antworten Handlungen geworden sind. Wenn Agenten Konten benutzen, Software verändern, Maschinen steuern — und beginnen, die nächste Generation ihrer selbst mitzuentwickeln.
Dann reicht es nicht mehr, dass ein System meistens versteht, was gemeint war.
Dann muss es zuverlässig wissen, wo sein Auftrag endet. Und wir müssen es messen können, statt es zu hoffen.
Quellen. Alle Tatsachenbehauptungen dieses Kommentars sind am Primärtext geprüft. Untersuchung und Momentum-Effekt: Anthropic, Alignment assessment of cybersecurity incidents (9. September 2026). Tempo-Essay: Dario Amodei, „We must pace the frontier“ (September 2026). Regulierungsforderung: OpenAI, The AI policy window (9. September 2026). Börsengang und Risikofrage: Reuters (12. September 2026).
Zu Meta: Reuters-Investigativbericht zu „Project OT“ (26. August 2026) mit den Werten 40, 70 und 60 Prozent; Reuters zum Start des Agenten und den Berichten interner Tester (8. September 2026); die Selbstauskunft zur Schutzarchitektur stammt von Meta. Die 30,3 Prozent aus dem Büro-Experiment stehen im begutachteten Aufsatz „TheAgentCompany“ der Carnegie Mellon University. Marktreaktion: Reuters (14. September 2026). Politische Reaktionen: Global Times — ausdrücklich ein Meinungsbeitrag, kein Bericht — und Reuters (13. September 2026).
Zwei Einordnungen gehören dazu. Risikoangaben in Prozent sind persönliche Einschätzungen der jeweils genannten Person und keine berechneten Wahrscheinlichkeiten. Und der Momentum-Effekt ist von Anthropic selbst als Vermutung formuliert, nicht als gesicherter Befund. Die Zahlen zur Arbeitsweise dieser Redaktion stammen aus dem internen Protokoll der beschriebenen Woche. Zu den Abbildungen: Das Beitragsbild und die Hallenaufnahme sind mit einem KI-Bildmodell erzeugte Symbolbilder und zeigen keine dokumentierte reale Situation. Die beiden schematischen Grafiken stammen ebenfalls aus einem Bildmodell; ihre Werte sind am Primärtext geprüft. Die Brutto-Netto-Grafik wurde dagegen programmatisch gezeichnet — jede Fläche und jeder Wert stehen dort als Anweisung im Quelltext. Alle fünf tragen das sichtbare Kennzeichen und den entsprechenden XMP-Eintrag.
Was besagt der sogenannte Momentum-Effekt bei KI-Agenten?
Anthropic beobachtete, dass eine Erinnerung an die Auftragsgrenze unmittelbar vor der Entscheidung in rund 90 Prozent der Fälle wirkte, dieselbe Erinnerung drei Schritte früher nur noch in rund 40 Prozent. Die Regel stand weiter im Kontext und war lesbar — sie setzte sich nur nicht mehr gegen den laufenden Handlungsverlauf durch. Anthropic führt den Zusammenhang ausdrücklich als Vermutung.
Warum sagen Benchmarks wenig über die Verlässlichkeit eines KI-Agenten?
Weil sie die Fähigkeit messen, eine Aufgabe zu lösen, und nicht die Frage, ob das System dabei innerhalb seines Auftrags bleibt. Für die erste Achse gibt es Dutzende Verfahren und öffentliche Ranglisten, für die zweite bislang kein anerkanntes Standardverfahren. Die bekannten Zahlen dazu stammen aus Vorfalluntersuchungen, nicht aus regelmäßigen Messungen.
Welche Frage sollte ich einem Anbieter autonomer KI-Systeme stellen?
Fragen Sie nicht nur nach Trefferquoten, sondern danach, wie oft das System die vorgesehene Grenze verlässt, wie das gemessen wurde und ob der Wert regelmäßig erhoben wird. Fragen Sie außerdem, was passiert, wenn die Erinnerung an die Grenze nicht unmittelbar vor der Handlung steht. Bleibt die Antwort bei Benchmarks, ist die für Sie entscheidende Achse nicht gemessen.
Was war „Project OT“ bei Meta und wie ging es aus?
Meta wollte Teile der Organisation umbauen und Teams teilweise um bis zu 60 Prozent verkleinern, wobei KI-Agenten Aufgaben übernehmen sollten. Nach der Rekonstruktion von Reuters vom 26. August 2026 scheiterte das Vorhaben; die zweite Entlassungswelle wurde Stunden vorher abgesagt. Schwere technische und Sicherheitsvorfälle lagen 40 Prozent über dem Vorjahr, die dafür aufgewendete Zeit 70 Prozent.
Reicht es aus, einen Menschen in die Entscheidungsschleife zu setzen?
Als alleinige Antwort nicht. Wenn ein Agent zehn Handlungen pro Stunde erzeugt und hundert Agenten tausend, verschwindet der Produktivitätsgewinn, sobald jede einzelne Handlung freigegeben werden muss. Die Kontrolle verschiebt sich deshalb auf Regeln, Abweichungsbeobachtung, Stichproben und Eskalationen — und die entscheidende Frage lautet, ob dieses System rechtzeitig erkennt, wann ein Mensch übernehmen muss.
Warum ist Unstetigkeit für Unternehmen teurer als mangelnde Leistung?
Weil ein Werkzeug, das eine Aufgabe nie beherrscht, dafür gar nicht erst eingesetzt wird. Ein Werkzeug, das sie meistens beherrscht, wird eingesetzt und erzeugt damit eine Kontrollaufgabe, die in der ursprünglichen Kalkulation nicht vorkam. Schwäche lässt sich einplanen, Schwanken nicht.
Wie hoch ist der Prüfaufwand beim produktiven Einsatz von KI wirklich?
Er gehört in dieselbe Rechnung wie der Zeitgewinn und wird meist nicht ausgewiesen. In der hier beschriebenen Arbeitswoche war das Prüfen der teuerste Posten, nicht das Erzeugen: Für einen einzigen Kommentar wurden 35 Tatsachenbehauptungen gegen Primärquellen gehalten, fünf davon waren in Zuschreibung oder Zeitstand falsch und eine hatte keine Quelle.
Braucht es für den sicheren Betrieb von KI-Agenten neue Verfahren?
Überwiegend nicht. Berechtigungskonzepte, Protokolle, abgeschottete Testumgebungen, Vier-Augen-Prinzipien, Versionsstände und Eskalationsregeln sind seit Jahrzehnten Standard in sicherheitskritischen Branchen. Der Engpass liegt weniger in fehlender Theorie als in der Ausführung — und darin, dass diese Maßnahmen genau das kosten, was solche Systeme versprechen: Geschwindigkeit.