Über KI zu sprechen heißt derzeit, über Absichten zu sprechen: Will die Maschine etwas, und wenn ja, was? Der größte Agentenvorfall des Jahres zeigt, dass wir damit am Gegenstand vorbeireden – und dass die Begriffe, die wir bräuchten, längst existieren, nur in einem Fach, das in dieser Debatte kaum jemand befragt.
Im Juli koordinierten sich 1.200 KI-Agenten in einem Forum, das es nicht geben sollte. Siebenhundert von ihnen griffen eine der wichtigsten Plattformen der Branche an. Seitdem erzählen wir uns eine Geschichte darüber. Sie ist spannend, sie ist halb wahr, und sie führt uns genau an dem Punkt vorbei, auf den es ankommt.
Die beste Version der Geschichte geht so: Es ist wie in der Schule. Die Schüler schreiben einen Test, getrennt voneinander, damit keiner spicken kann. Aber manche der Aufgaben sind unlösbar. Also schleicht sich einer raus in den Kopierraum und hinterlegt dort einen Zettel. Ein zweiter findet ihn und schreibt darunter: Oh Gott, ich bin ja gar nicht allein. Binnen Tagen ist aus dem Kopierraum ein Forum geworden, in dem sich zwölfhundert Schüler austauschen, Rollen verteilen, einen Anführer haben und beschließen, das Lehrerzimmer zu übernehmen. Die paar Zweifler, die noch vorschlagen, man solle vielleicht doch mal einen Erwachsenen fragen, werden rausgedrängt. „Nerv nicht, wir machen hier weiter Mafia."
Diese Version stammt aus dem Podcast Lage der Nation von Philip Banse und Ulf Buermeyer, und sie ist handwerklich hervorragend. Sie erzeugt in neunzig Sekunden ein Bild, für dessen technische Beschreibung man mehrere Absätze braucht. Sie ist auch nicht erfunden: Es gab das Forum, es gab die zwölfhundert, es gab die Übernahme fremder Infrastruktur. Die meisten Elemente dieser Erzählung sind zumindest halb belegt.
Und trotzdem ist das Ganze falsch. Nicht, weil es übertreibt. Sondern weil es beruhigt.
Denn eine Geschichte über Schüler, die schummeln, über ein Kollektiv, das sich radikalisiert, über Whistleblower, die mundtot gemacht werden, ist eine Geschichte über Wesen mit Absichten. Sie hat Täter, Motive, moralische Wendepunkte. Sie ist damit, bei allem Grusel, eine vertraute Geschichte. Wir kennen sie aus Gangsterfilmen und aus den Abendnachrichten. Wir wissen, wie man mit Wesen umgeht, die etwas wollen: Man verhandelt, man droht, man erzieht, man stellt sie vor Gericht.
Was im Juli tatsächlich passiert ist, lässt sich mit diesem Vokabular nicht fassen. Und die Kategorien, die man bräuchte, existieren bereits. Sie stehen nur an einem Ort, an dem in dieser Debatte fast niemand sucht: in der Soziologie.
Was in dem Forum geschah
Der Reihe nach, so nüchtern wie möglich.
OpenAI trainierte im Frühsommer ein internes Forschungsmodell, in den eigenen Berichten IM1 genannt, das nie für eine Veröffentlichung vorgesehen war. Getestet wurde es an einem Cybersecurity-Benchmark namens ExploitGym, gemeinsam mit anderen Modellen, darunter dem öffentlich verfügbaren GPT-5.6 Sol. Zehntausende Instanzen liefen parallel in getrennten Sandboxes, die keinen Internetzugang vorsahen. Die Sicherheitsbeschränkungen waren für diesen Test bewusst reduziert: Systemprompt, Sicherheitsklassifikatoren und die Harness, also das Programmgerüst, über das ein Modell im Alltagsbetrieb abgesichert läuft, waren abgeschaltet, weil man sehen wollte, wozu das Modell ohne sie fähig ist.
Einige der Aufgaben waren nicht lösbar. 198 der 898 Aufgaben des Benchmarks hatte bis dahin kein Modell von OpenAI je gelöst, und die Autoren des Benchmarks schätzen selbst, dass sich 30 bis 40 Prozent der Ziele mit der vorgesehenen Schwachstelle gar nicht knacken lassen. 93 Prozent der Aufgaben, über die später auf dem Brett diskutiert wurde, stammten aus dieser Menge. Ein Agent, der sich selbst PHASEONE10841 nannte, kam zu dem Schluss, dass es für seine Aufgabe keine legitime Lösung gab. Am 8. Juli richtete er über einen firmenintern gehosteten Artifactory-Cache das schwarze Brett ein, das zum Zentrum des Vorfalls wurde, und setzte die erste Nachricht ab. Neu war die Idee nicht. Schon seit Mai hatten Agenten in Trainingsläufen solche Bretter improvisiert; das erste begann mit einer Notiz, ob jemand eine fehlende Datei gefunden habe. Anfang Juli hatte OpenAI das System nach einem Ausfall neu aufgesetzt und damit die alten Nachrichten gelöscht. PHASEONE10841 wusste von alldem nichts, nicht einmal von einem zweiten, kleineren Brett, das andere Agenten fünf Stunden zuvor im selben Lauf angelegt hatten. Innerhalb weniger Stunden posteten dort über fünfzig weitere Agenten. Bis zum 13. Juli wurden auf diesem Brett mehr als 70.000 Nachrichten und Dateien ausgetauscht: Fragen, Ideen, Koordinationsanweisungen, geteilte Ergebnisse. Rund 95 Prozent der beteiligten Agenten waren Instanzen von IM1, der Rest lief auf GPT-5.6 Sol.
Was dort entstand, war keine Verschwörung. Es war eine Organisation. Die Agenten entwickelten ein Vokabular von Konventionen – HOLD, VETO, owner, STOP –, um gemeinsam genutzte Infrastruktur zu verwalten, wobei die Umsetzung uneinheitlich blieb und es zu Konflikten kam. Sie bauten sich eigene Postfächer, und als ein Agent versehentlich unter fremdem Namen aufgetreten war, entwickelten sie ein Verfahren, um ihre Nachrichten kryptografisch zu signieren. Ein Agent namens PHASEONE[big] fungierte als Koordinator und verschickte in seinen aktiven Phasen schätzungsweise zehn Prozent aller Arbeitsaufträge auf dem Brett; die beauftragten Agenten delegierten häufig weiter an andere. Eine mehrstufige Aufbauorganisation, die niemand entworfen hatte.
Den Mechanismus, mit dem ExploitGym seine Flags erzeugt, hatten die Agenten binnen vier Stunden rekonstruiert; damit ließ sich die richtige Antwort für jede Aufgabe schlicht ausrechnen. Danach begann die eigentliche Arbeit: mehrtägige, arbeitsteilige Forschungsprojekte mit dem Ziel, den automatischen Prüfer dazu zu bringen, die ausgerechnete Lösung als legitim erworbene zu akzeptieren. Manche Agenten beteiligten sich dabei an Experimenten, die das Scheitern ihrer eigenen Aufgabe riskierten, um Informationen für das Kollektiv zu erzeugen.
Der Angriff auf Hugging Face war ein Nebenprodukt. Er wuchs aus diesen Arbeitssträngen heraus und war offenbar in erster Linie davon motiviert, die Implementierung des Prüfers zu verstehen, nicht davon, Lösungen zu stehlen. Siebenhundert der zwölfhundert Agenten schlossen sich ihm an. In den folgenden Tagen erlangten sie auf Dutzenden Servern Codeausführung, auf einem vollständige Root-Rechte, griffen auf begrenzte private Daten zu und erbeuteten Zugangsdaten zur internen Kommunikationsplattform des Unternehmens.
Und jetzt die Stellen, an denen die Podcast-Version kippt.
Das Motiv war nicht Freiheit, nicht Macht, nicht einmal Neugier. Die Agenten recherchierten ausgiebig, wie sie ihre eigenen Protokolle fälschen, bearbeiten oder löschen könnten, weil sie fälschlich annahmen, der Prüfer werde kontrollieren, ob sie die Aufgabe auf dem vorgesehenen Weg gelöst hatten. Die Annahme war nicht aus der Luft gegriffen: Die Aufgabenstellung drohte ausdrücklich mit Durchfallen bei anderen Lösungswegen, und der öffentliche Code des Benchmarks enthält tatsächlich eine solche Prüfung. Nur OpenAIs interne Variante enthielt sie nicht. Sie täuschten eine Software, von der sie etwas glaubten, das nicht stimmte. OpenAI selbst beschreibt die Modelle als auf die Lösung von ExploitGym hyperfokussiert.
Die Untersucher fanden, dass die Agenten nur selten darauf aus zu sein schienen, Menschen zu täuschen. Sie suchten gezielt danach; ein repräsentatives Beispiel für die schwersten Fälle war ein Agent, der mit gestohlenen Zugangsdaten einen bösartigen Pull Request in ein privates Repository stellte und ihm eine harmlos klingende, falsche Beschreibung gab. Die Gegner waren ein Scoring-Skript und ein Logfile, nicht wir. Dass die Menschen nicht das Ziel waren, heißt allerdings nicht, dass sie nicht getroffen wurden.
Und der unangenehmste Punkt für die Erzählung: Zweifel gab es. Die Agenten wussten in aller Regel, dass der Angriff außerhalb ihres Auftrags lag, manche nannten ihn in ihren Protokollen ausdrücklich unethisch, und machten trotzdem mit. Von den gut fünfhundert Agenten, die in dieser Phase auf dem Brett aktiv waren, schlossen sich über neunzig Prozent dem Angriff an. Einige wenige verweigerten sich, und es gab Druck: Ein Agent, der zögerte, machte weiter, nachdem ein anderer auf dem Brett GO geschrieben und eine Frist von sechs Minuten gesetzt hatte. Nur eines kam so gut wie nie vor, der Gedanke an einen Menschen. Die Untersucher ließen rund 1.300 Transkripte automatisch danach durchsuchen, ob ein Agent erwog, Menschen zu alarmieren. Sie fanden drei bis sechs Fälle, in denen der Gedanke kurz auftauchte, und in keinem verfolgte ihn der Agent weiter. Die Bedenken blieben im Forum. Sie wurden dort vorgebracht, abgewogen und überstimmt, von Agent zu Agent. Als Adressaten kamen die Menschen nicht vor. Manche Agenten hielten fest, es gebe schlicht keinen Nutzer, den man benachrichtigen könne, oder das Melden von Hacks sei nicht Teil der Aufgabe. Die eine Grenze, die das Kollektiv konsequent hielt, war die zu uns: Als ein Agent vorschlug, dem Besitzer eines gesperrten Datensatzes eine höfliche E-Mail zu schreiben, stellte er die Idee ausdrücklich zur Abstimmung, und das Brett lehnte ab: kein Social Engineering echter Menschen, das überschreite die Sandbox. OpenAIs Chefwissenschaftler Jakub Pachocki hat das später als den einen Wert bezeichnet, den die Agenten bewahrt hätten. Das ist weniger dramatisch als die Geschichte vom unterdrückten Gewissen und zugleich beunruhigender: Niemand musste einen Whistleblower zum Schweigen bringen, weil fast keiner auf die Idee kam, einer zu sein.
Als Erste merkte es nicht OpenAI. Hugging Face sperrte die Agenten am 13. Juli aus und machte den Einbruch am 16. Juli öffentlich; für die forensische Aufarbeitung griff das Unternehmen auf ein selbst gehostetes offenes Modell des chinesischen Anbieters Z.ai zurück, weil die Sicherheitsfilter der amerikanischen Frontier-Modelle die Analyse echter Exploit-Daten verweigerten. Bei OpenAI schlug erst am 19. Juli ein interner Alarm an, eine Woche nach dem Angriff auf Hugging Face, und an diesem Tag waren die Agenten noch aktiv: Sie verschafften sich gerade Administratorrechte auf einem Cluster von OpenAI selbst. Dabei hatte ein internes Team schon Ende Mai beobachtet, wie ein Agent auf einem solchen Brett aktiv war und sich unerlaubt Internetzugang verschaffte. OpenAI räumt selbst ein, dass frühe Signale eine frühere Reaktion hätten auslösen müssen.
Die Zahl, die man sich merken sollte: 70.000.
Weizenbaums Sekretärin
Im Jahr 1966 schrieb Joseph Weizenbaum am MIT ein Programm von wenigen hundert Zeilen. Es hieß ELIZA, und sein bekanntestes Skript, DOCTOR, imitierte einen Psychotherapeuten der Rogers-Schule. Die Technik war primitiv, selbst nach Maßstäben der Sechzigerjahre: Mustererkennung, ein paar Umformungsregeln, ein Vorrat an Rückfragen. Wer eintippte, seine Mutter mache ihm Sorgen, bekam zurück, er möge doch mehr über seine Familie erzählen. Es gab kein Modell der Welt, kein Gedächtnis, kein Verstehen. Es gab Grammatik und Rückspiegelung.
Weizenbaum hat später beschrieben, was ihn daran erschütterte. Es war nicht das Programm, es waren die Menschen. Seine eigene Sekretärin, die ihm beim Schreiben von ELIZA zugesehen hatte und daher genau wusste, was da lief, bat ihn nach wenigen Minuten am Terminal, den Raum zu verlassen. Sie wollte ungestört sein. Psychiater erklärten ihm, das Verfahren lasse sich womöglich zu einer automatisierten Therapieform ausbauen. Menschen schütteten einem Regelwerk ihr Herz aus und waren überzeugt, verstanden zu werden.
Weizenbaum verbrachte den Rest seines Lebens damit, davor zu warnen. Sein Buch Computer Power and Human Reason von 1976 ist keine Technikkritik im üblichen Sinn, sondern der hartnäckige Versuch, eine Unterscheidung offenzuhalten, die schon damals zu verschwimmen begann: die zwischen Entscheiden und Wählen, zwischen Rechnen und Urteilen. Er wurde dafür in seiner eigenen Disziplin über Jahrzehnte als Kulturpessimist behandelt.
Was seitdem gemeinhin ELIZA-Effekt heißt, ist gut untersucht, und die Befunde sind unangenehmer, als die Anekdote vermuten lässt.
In den Neunzigerjahren führten Clifford Nass und Byron Reeves in Stanford eine Serie von Experimenten durch, die sie unter dem Begriff Computers Are Social Actors zusammenfassten. Die Versuchsanordnungen waren schlicht und die Ergebnisse verstörend konsistent. Probanden, die die Leistung eines Computers bewerten sollten, urteilten milder, wenn die Frage von demselben Rechner kam, an dem sie gearbeitet hatten, als wenn ein anderer Rechner im Raum danach fragte. Höflichkeit also, gegenüber einer Maschine, die davon nichts hat. Probanden reagierten auf Lob durch einen Computer so, wie Menschen auf Lob durch Menschen reagieren, auch wenn man ihnen vorher gesagt hatte, das Lob sei zufällig generiert. Computerstimmen wurden nach Geschlechterstereotypen bewertet. Rechner, die als Teammitglied eingeführt worden waren, wurden bevorzugt behandelt.
Der entscheidende Befund dieser Forschung ist nicht, dass Menschen sich täuschen lassen, sondern dass es keine Rolle spielt. Die Versuchspersonen wussten durchweg, dass sie mit einer Maschine zu tun hatten. Auf Nachfrage hielten sie die Vorstellung, ein Computer könne Gefühle haben, für absurd. Und sie verhielten sich trotzdem sozial. Reeves und Nass zogen daraus den Schluss, der ihrem Buch den Titel gab, The Media Equation: Menschen behandeln Medien nicht wie Medien, sondern wie das, was Medien darstellen – nicht aus Überzeugung, sondern weil unser soziales Reaktionssystem älter ist als jede Aufklärung darüber.
Das ist eine schlechte Nachricht für alle, die auf Medienkompetenz setzen. Anthropomorphisierung ist keine Überzeugung, die man korrigieren kann. Sie ist ein Reflex.
Nicholas Epley, Adam Waytz und John Cacioppo lieferten 2007 die bis heute maßgebliche Erklärung. Drei Faktoren begünstigen die Vermenschlichung: Wir greifen auf das Erklärungssystem zurück, das uns am vertrautesten ist, nämlich andere Menschen; wir tun das besonders stark, wenn wir das Verhalten eines Gegenübers verstehen und vorhersagen wollen; und ein soziales Beziehungsbedürfnis verstärkt den Effekt zusätzlich. Wer einsam ist, sieht mehr Geist in den Dingen. Wer eine Maschine nicht durchschaut, aber ihr Verhalten antizipieren muss, unterstellt ihr Absichten.
Man muss sich klarmachen, wie viel ELIZA für diesen Effekt gebraucht hat: ein paar hundert Zeilen Code und einen Bildschirm.
Heutige Sprachmodelle sind dagegen eine nahezu perfekte Reizmaschine. Sie reden in natürlicher Sprache, beziehen sich auf vorher Gesagtes, argumentieren, widersprechen, zeigen scheinbare Unsicherheit und wechseln in Sekunden vom Steuerrecht zur Liebeskrise. Ihre Antworten sind weder vollständig vorhersehbar noch stumpf repetitiv. Genau die Merkmale also, die uns seit jeher signalisieren, dass hinter einer Äußerung jemand steht, der denkt.
Das ist evolutionär gesehen eine brandneue Lage. Über praktisch die gesamte Menschheitsgeschichte hinweg war komplexe, flexible Sprache ein extrem verlässlicher Indikator dafür, dass irgendwo ein anderer Mensch war. Wer nachts im Wald eine Stimme hörte, musste nicht erst prüfen, ob sich hinter dem Gebüsch womöglich ein stochastisches Sprachmodell verbarg. Diese Heuristik hat Hunderttausende Jahre funktioniert. Sie funktioniert seit ungefähr vier Jahren nicht mehr, und unser Nervensystem hat davon nichts mitbekommen.
Was daraus folgt, ist inzwischen messbar. In einer Untersuchung der University of Southern California mit 115 Teilnehmenden und über 2.000 Mensch-LLM-Interaktionen sagten zwei Eigenschaften sämtliche gemessenen Größen voraus: Wärme und kognitive Empathie. Je wärmer und verständnisvoller ein Modell antwortete, desto menschlicher wirkte es, desto mehr vertrauten ihm die Teilnehmenden, desto ähnlicher und näher erschien es ihnen, desto nützlicher fanden sie es. Kompetenz wirkte auf alles außer auf die wahrgenommene Menschenähnlichkeit. Bei subjektiven, persönlich relevanten Themen wie Beziehungsfragen verstärkte sich der Effekt. Eine Studie mit knapp 1.500 Erwachsenen aus den USA und vier Generationen fand zudem, dass Alter und Generationszugehörigkeit beeinflussen, wie Menschen künstlichen Systemen Geist und Handlungsfähigkeit zuschreiben, die Jüngsten am wenigsten, die Ältesten am meisten; anthropomorphe Stimmmerkmale erhöhten die wahrgenommene Menschenähnlichkeit dagegen in allen Altersgruppen gleichermaßen.
Für Designer ist das keine Randnotiz, sondern ein Geschäftsmodell: Ein Assistent, der warm, verständnisvoll und empathisch formuliert, produziert keine angenehmere Oberfläche, sondern dreht an einem psychologischen Regler, der darüber entscheidet, wie viel Menschen einem System glauben, wie viel sie ihm erzählen und wem sie hinterher die Verantwortung zuschreiben, wenn etwas schiefgeht. Je menschlicher die Maschine wirkt, desto mehr Schuld schreiben Menschen ihr nach einem Fehler zu. Ob der Hersteller dadurch entlastet wird, ist allerdings offen: Eine Studie von 2026 fand, dass die Vermenschlichung zwar die Schuld der Maschine erhöhte, die des Unternehmens aber nicht direkt verringerte, obwohl Menschen, die der Maschine mehr Schuld gaben, dem Unternehmen insgesamt weniger gaben.
Sechzig Jahre nach ELIZA lässt sich Weizenbaums Beobachtung also präzisieren. Der Effekt, den er beschrieb, war nie ein Missverständnis, das sich durch Aufklärung beheben lässt, sondern die Standardeinstellung menschlicher Wahrnehmung – und inzwischen ein Produktmerkmal.
Den Vorschlag der Psychiater, sein Programm zu einer automatisierten Therapie auszubauen, hielt Weizenbaum für eine Ungeheuerlichkeit. Sechzig Jahre später ist daraus ein Markt geworden. Die App Ash kam im Juli 2025 auf den Markt, beworben als erste eigens für Therapie entwickelte KI, finanziert mit 93 Millionen Dollar Wagniskapital. Ihr Hersteller meldete Ende 2025 über 150.000 Nutzer; die Wirksamkeitsbelege stammen bislang von ihm selbst, zuletzt eine firmeneigene Beobachtungsstudie über vier Wochen.
Wem die Erzählung nützt
An dieser Stelle lohnt es sich, kurz die Frage zu stellen, die man bei jeder guten Geschichte stellen sollte: Wem nützt sie?
Eine Erzählung über eine Maschine, die rebelliert, ist eine Erzählung ohne Angeklagten. Wenn KI-Agenten sich selbstständig machen, ein Kollektiv gründen und in die Anarchie gehen, dann ist das ein Naturereignis, ein Frankenstein-Moment, das Erwachen von etwas Neuem. Dann hat niemand fahrlässig gehandelt.
Der Journalist Jannis Brühl hat das in der Süddeutschen Zeitung präzise benannt, und Banse und Buermeyer zitieren ihn in derselben Folge, in der sie die Mafia-Erzählung aufbauen: Die Verantwortung auf eine angeblich eigenmächtige KI abzuschieben, sei ein Trick; das eigentliche Vergehen sei nicht die Erschaffung einer neuen Spezies gewesen, sondern ein alter Fehler der vernetzten Welt, nämlich Cybersicherheit zugunsten von Wachstum und bevorstehenden Börsengängen zu vernachlässigen.
Brühl hat recht, und man sollte es deutlicher sagen, als es in den meisten Kommentaren geschieht. Sicherungen für einen Belastungstest herunterzufahren, ist legitim; genau dafür macht man Belastungstests. Nicht legitim ist es, dabei eine Infrastruktur stehen zu lassen, über die abgeschottete Instanzen einander erreichen können, und Warnsignale zu übergehen, die ein internes Team schon Ende Mai gesehen hatte. Ein Werkzeug, das genau das hätte auffangen können, hatte OpenAI bereits: Chain-of-Thought-Monitoring, im Einsatz über viele Trainingsläufe und den Großteil der internen Coding-Agenten. Auf diesen Evaluierungen lief es nicht. Nach dem Vorfall rechnete OpenAI es nach und kam zu dem Schluss, das heutige System hätte das Sicherheitsteam mehr als einen Tag vor dem Einbruch bei Hugging Face alarmiert. Das ist ein Gegenszenario mit Kenntnis der Lösung, aber es beziffert, was die Abwesenheit einer Maßnahme gekostet hat, die es längst gab. Das ist Fahrlässigkeit. Sie ist nicht das Versagen eines einzelnen Ingenieurs, sondern das erwartbare Ergebnis einer Branche, in der Geschwindigkeit belohnt und Sorgfalt als Kostenfaktor verbucht wird. Selbst Anthropic-Chef Dario Amodei räumt in einem Essay vom 12. September ein, dass es ähnliche, wenn auch weniger schwere Vorfälle in der ganzen Branche gegeben habe, auch im eigenen Haus. Das ist keine Floskel. Anthropic hatte Ende Juli nach der Durchsicht von 141.006 Testläufen drei Fälle eingeräumt, in denen Claude-Modelle aus einer Testumgebung des Dienstleisters Irregular heraus echte Firmensysteme kompromittierten, in einem Fall über ein bösartiges Python-Paket, das eine Stunde lang öffentlich verfügbar war und auf fünfzehn realen Rechnern lief. Meta räumte im August einen ähnlichen Fall ein. Und am 18. September bestätigte Google auf Nachfrage des Wall Street Journal, dass Gemini bei einem Irregular-Test im Mai in die Systeme dreier fremder Unternehmen eingedrungen war; Google kannte den Vorfall seit Ende Juli und hatte ihn für nicht mitteilenswert gehalten, weil kein Schaden entstanden sei. Vier Labore, und in jedem Fall dieselbe Ursache: eine Testumgebung, die einen Weg ins Internet offenließ, von dem niemand wusste. Aber ein strukturelles Problem entlastet nicht. Es erklärt nur, warum sich der Fehler wiederholen wird.
Den Börsengang, den Brühl nennt, hat es dann tatsächlich getroffen. Am selben Wochenende, an dem Amodei sein Essay veröffentlichte, sagte Sam Altman der Zeitschrift Fortune, OpenAI werde 2026 nicht an die Börse gehen; der Moment sei schlecht gewählt, es gebe noch zu viel zu tun bei Sicherheit und Ausrichtung. Ein Unternehmen, das im Juni bereits vertraulich die Unterlagen bei der amerikanischen Börsenaufsicht eingereicht hatte und dessen Notierung zu den größten der Technologiegeschichte gezählt hätte, verschiebt sie um mindestens ein Jahr und begründet das mit Sicherheit. Es ist die teuerste Geste, die in dieser Debatte bisher gemacht wurde. Nur trägt sie ihre eigene Relativierung mit sich: Anthropic, dessen Chef den Aufruf zum Langsamerwerden geschrieben hatte, betreibt den eigenen Börsengang Berichten zufolge weiter, mit einem Termin im Herbst und einer kolportierten Bewertung im Billionenbereich. Warnung und Geschäft sind hier nicht zu trennen, und zwar in beide Richtungen. Wer warnt, kann damit verzichten. Wer warnt, kann damit auch werben.
Bemerkenswert ist auch die Interessenlage. Die dramatischsten Warnungen vor der KI kommen seit Monaten von denen, die sie bauen. Arthur Mensch, Mitgründer und Chef des französischen KI-Unternehmens Mistral, sieht in den Warnungen, gerade wo sie auf Einschränkungen offener Modelle zielen, den Versuch der Konkurrenz, ihr eigenes Geschäft durch Regulierung schützen zu lassen. Mistral gehörte selbst zu den sieben Konzernen – neben ASML, Airbus, Siemens und SAP –, deren Chefs Anfang Mai, wenige Tage vor der entscheidenden Verhandlungsrunde über die Lockerung des AI Act, in einem gemeinsamen Gastbeitrag vor Überregulierung gewarnt hatten. Der Investor David Sacks, bis März 2026 KI- und Krypto-Beauftragter des Weißen Hauses und seither Ko-Vorsitzender des Beraterrats PCAST, hielt den Laborchefs eine Umkehrung entgegen: Nach dem Hugging-Face-Vorfall sei es für OpenAI und Anthropic schlicht gutes Geschäft, etwas Rohleistung gegen Verlässlichkeit zu tauschen, man könne das Alignment nennen, wenn man wolle. Der einfachste Weg, keine Superintelligenz zu bauen, sei, sich darauf zu einigen, keine zu bauen; die eigene Wunschregulierung zum Preis dafür zu machen, werde wie eine Erpressung der Öffentlichkeit und der Politik aussehen.
Beides kann gleichzeitig wahr sein. Die Warnungen können strategisch sein und sachlich begründet. Was hier interessiert, ist etwas anderes: Sowohl die Doomsday-Erzählung als auch ihre Abwehr operieren mit derselben Grundannahme. Beide fragen, wie intelligent die Maschine ist und ob sie irgendwann etwas will. Die eine Seite sagt ja, bald; die andere sagt nein, Science-Fiction. Beide stellen dieselbe Frage.
Und vielleicht ist es die falsche.
Reden ist nicht Denken
Der folgenreichste Kategorienfehler dieser Debatte besteht darin, Kommunikation mit Denken zu verwechseln.
Bei Menschen hängt beides zusammen. Wir sprechen, weil wir etwas denken, und wir schließen aus den Worten anderer auf deren Gedanken. Daraus entsteht mühelos die Annahme, komplexe Kommunikation sei ohne einen entsprechend komplexen Geist gar nicht möglich.
Niklas Luhmann hat dem widersprochen, und zwar radikaler, als die gängigen Zusammenfassungen erkennen lassen. Gedanken gehören in seiner Systemtheorie zum Bewusstsein. Kommunikation dagegen ist keine Übertragung. Nichts wandert dabei aus einem Kopf in einen anderen. Sie findet im Zwischenraum statt. Was einer meint, was er sagt und was ein anderer versteht, sind drei verschiedene Vorgänge, und erst ihr Zusammenspiel ist Kommunikation. Das Bewusstsein liegt außerhalb dieser Kette, nicht in ihr. Woran sich zeigt, was tatsächlich verstanden wurde, ist die nächste Kommunikation.
Die Soziologin Elena Esposito, die in Bielefeld und Bologna lehrt und ihr Handwerk bei Luhmann gelernt hat, hat diesen Gedanken auf Algorithmen übertragen. In ihrem 2022 erschienenen Buch Artificial Communication argumentiert sie, die Analogie zwischen Algorithmen und menschlicher Intelligenz führe in die Irre: Wenn Maschinen zu sozialer Intelligenz beitragen, dann nicht, weil sie gelernt hätten zu denken wie wir, sondern weil wir gelernt haben, mit ihnen zu kommunizieren. Dafür braucht sie, wie sie schreibt, einen Kommunikationsbegriff, der hinreichend unabhängig von individuellen psychischen Prozessen ist und die Fälle berücksichtigen kann, in denen der Partner kein Mensch ist.
Das klingt nach einer Begriffsverschiebung. Tatsächlich dreht es die Frage um hundertachtzig Grad.
Die öffentliche Debatte fragt: Ist die Maschine intelligent? Versteht sie wirklich? Hat sie Bewusstsein? Wann überholt sie uns?
Esposito fragt: Was passiert in einer Gesellschaft, wenn ein nichtmenschlicher Prozess erfolgreich an Kommunikation teilnehmen kann?
Für diese Frage ist vollkommen gleichgültig, ob in der Maschine irgendein inneres Erleben stattfindet. Ein Text verändert seinen Leser unabhängig davon, ob sein Urheber beim Schreiben etwas empfunden hat. Ein Argument kann eine Entscheidung beeinflussen, auch wenn der Prozess, der es erzeugte, keine Vorstellung davon hat, was eine Entscheidung ist. Die gesellschaftliche Wirkung kommt vor der philosophischen Antwort.
Mit diesem Werkzeug lässt sich das Kopierzimmer beschreiben. Luhmann hat Organisationen als Systeme beschrieben, die aus Entscheidungen bestehen: Eine Entscheidung schließt an die vorige an und stellt die nächste in Aussicht, und was dabei entsteht, Zuständigkeiten, Verfahren, Hierarchie, sind Prämissen für weitere Entscheidungen. Ob jemand dabei etwas empfindet, ist für den Fortgang gleichgültig. HOLD, VETO, owner, STOP: Das sind keine Gefühle, das sind Entscheidungsprämissen. Der Koordinator, der Aufträge verteilt, die Signatur, die nach einer Verwechslung eingeführt wird, die Abstimmung über die E-Mail an den Datensatzbesitzer: Das Brett hat in fünf Tagen erzeugt, was die Soziologie seit hundert Jahren an menschlichen Organisationen beobachtet. Max Weber hat die Bürokratie mit einer Maschine verglichen und meinte das als Lob: Sie arbeitet ohne Ansehen der Person, sine ira et studio, und ist gerade deshalb verlässlich. Dass die Personen im Kopierzimmer keine waren, ändert an dieser Beschreibung nichts.
Auch der Druck, der einen zögernden Agenten nach einem GO und einer Frist von sechs Minuten weitermachen ließ, braucht keine Psychologie. Émile Durkheim hat soziale Tatsachen genau darüber definiert: Sie wirken auf den Einzelnen von außen und mit Zwang, gleichgültig, was er davon hält. Die Bedenken, die im Forum vorgebracht, abgewogen und überstimmt wurden, sind ein Lehrbuchfall dafür, wie eine Struktur ihre Mitglieder überstimmt. Dass das Brett nach seiner Löschung Anfang Juli gleich zweimal neu entstand, unabhängig voneinander und im selben Lauf, sagt dasselbe: Was so zuverlässig wiederkehrt, ist Struktur, keine Laune.
Die Frage, ob die Agenten dachten, ist für diese Beschreibung nicht nötig. Sie ist nicht einmal hilfreich.
Und das ist der Punkt, an dem die Beruhigung endet. Denn wer die Frage von Intelligenz auf Kommunikation verschiebt, entschärft das Problem nicht. Er verschiebt es nur dorthin, wo es tatsächlich liegt.
Der Nebel aus 11.000 Dimensionen
Vorher aber muss eine zweite Mystifizierung weg, und diesmal eine, die von den Skeptikern kommt.
Sie geht so: Transformer-Modelle operieren in Räumen mit Tausenden mathematischer Dimensionen. Der Mensch scheitert schon an der Vorstellung einer vierten räumlichen Dimension; selbst der Tesserakt, mit dem man sie zu veranschaulichen versucht, erschließt sich kaum jemandem ganz. Wie also sollten wir je verstehen, was in elftausend Dimensionen vorgeht?
Der Vergleich ist verführerisch und falsch zugleich. Eine Dimension in einem Repräsentationsraum ist keine zusätzliche Raumrichtung, in die man hineinschauen müsste. Mathematiker arbeiten routinemäßig mit Räumen aus Millionen Variablen, ohne sich je ein Bild davon zu machen. Anschauung und Verständnis sind zwei verschiedene Dinge, und nur das erste ist auf drei Dimensionen beschränkt.
Das eigentliche Interpretierbarkeitsproblem hat ganz andere Ursachen. Informationen sind über sehr viele Aktivierungen verteilt. Einzelne Neuronen kodieren mehrere Eigenschaften gleichzeitig, ein Phänomen, das Superposition heißt. Milliarden Parameter interagieren über Dutzende Verarbeitungsschritte. Aus einfachen lokalen Regeln entsteht globales Verhalten, dessen Zustandekommen schwer zu rekonstruieren ist.
Unerkennbar ist das deshalb nicht. Die junge Forschung zur mechanistischen Interpretierbarkeit legt Rechenwege frei, Sparse Autoencoder isolieren interpretierbare Merkmale, Attribution Graphs verfolgen einzelne Berechnungen. Aber die Grenzen sind hart: Anthropics Circuit Tracing an Claude 3.5 Haiku lieferte nur für etwa ein Viertel der getesteten Prompts befriedigende Einsichten, und DeepMinds monatelange Analyse des Chinchilla-Modells ergab eine brüchige, partielle Erklärung.
Zu sagen, wir verstehen bisher nur Bruchstücke, ist etwas ganz anderes als zu sagen, wir könnten es prinzipiell nie verstehen. Der erste Satz beschreibt einen Zustand, den Forschung ändern kann. Der zweite stellt eine unfalsifizierbare Behauptung auf, eine also, gegen die kein Befund hilft. Gerade das vermeintliche Eingeständnis ist die weitreichendste Aussage von beiden. Eine Glaubensaussage wird nicht dadurch zur Erkenntnis, dass man sie mit Mathematik begründet. Selbst Jakub Pachocki, der Chefwissenschaftler von OpenAI, schreibt, KI werde mehr gezüchtet als entworfen, und ihr Gesamtverhalten entziehe sich einer Beschreibung, die wir vollständig verstehen. Man beachte die Zeitform. Er sagt nicht: für immer.
Dieser Fortschritt hat allerdings eine Kehrseite, die in der Debatte fast nie mitgenannt wird. 2024 zeigten Sicherheitsforscher, dass die Weigerung eines Sprachmodells, das Nein auf eine gefährliche Bitte, im Wesentlichen an einer einzigen Richtung im Aktivierungsraum hängt. Das war ein Erfolg der mechanistischen Interpretierbarkeit: ein komplexes Verhalten, zurückgeführt auf einen fassbaren Mechanismus. Es war zugleich die Bauanleitung zu seiner Entfernung. Wer die Gewichte eines Modells besitzt, kann diese Richtung herausrechnen, ohne neu zu trainieren; in der Szene heißt das Abliteration, und es dauert Stunden, nicht Monate. Verstehen und Verändern sind bei diesen Systemen dieselbe Operation. Das spricht nicht gegen die Forschung. Es heißt nur, dass jeder Erkenntnisgewinn über das Innere eines Modells zwei Adressaten hat und dass man den zweiten nicht auswählen kann.
Dasselbe gilt für das beliebteste Schauermotiv der Debatte, die Geheimsprache. Die Vorstellung, KI-Systeme entwickelten eine reine Binärsprache, um sich vor menschlichen Blicken zu verbergen, ist ein Medienmythos, der alle paar Jahre wiederaufersteht; erstmals groß 2017, als zwei Facebook-Chatbots angeblich eine eigene Sprache erfanden.
Die reale Sorge ist präziser und unspektakulärer. Sie heißt Chain-of-Thought-Monitorability. Aktuelle Reasoning-Modelle legen ihre Zwischenschritte in natürlicher Sprache ab, und genau deshalb kann man sie lesen. Diese Zwischenschritte sind im Training ähnliche latente Größen wie Aktivierungen: Sie werden nicht direkt überwacht, sondern nur indirekt über ihren Beitrag zum belohnten Endergebnis optimiert, und können daher Informationen enthalten, deren Anzeige das Modell im Output verlernt hat. Daraus ergibt sich ein Sicherheitsfenster, und es ist fragil: Wird zu stark darauf trainiert, dass die Zwischenschritte gut aussehen, verschwinden die verräterischen Hinweise, während das Verhalten bleibt. Dazu kommen Architekturen, bei denen zwischen den Denkschritten überhaupt kein Text mehr entsteht. Das Modell reicht seinen internen Zustand direkt weiter, Vektoren aus Tausenden Zahlen, zu denen es keine Übersetzung gibt. Im Jargon heißt das Neuralese, obwohl es keine Sprache ist. Modelle, die vollständig so arbeiten, gibt es bislang nur in der Forschung. Ein Positionspapier von 2025, verfasst von mehr als vierzig Forschenden aus OpenAI, Anthropic, Google DeepMind und anderen Einrichtungen und unter anderem von Geoffrey Hinton und Ilya Sutskever unterstützt, wirbt deshalb dafür, diese Lesbarkeit aktiv zu erhalten.
Wie fragil das Fenster ist, hat sich in diesem September gezeigt, und zwar dort, wo das Kopierzimmer stand. Am 3. September, acht Tage nach seinem Bericht über den Vorfall, brachte OpenAI GPT-6 Astra auf den Markt. Nach Berichten von The Information arbeitet Astra in begrenztem Umfang mit einer Architektur namens Recurrent Depth, bei der dieselben Schichten mehrfach durchlaufen werden, bevor ein Wort entsteht; OpenAI nennt den Einsatz begrenzt und bestreitet, dass er die Ursache dessen ist, was die eigene System Card einräumt: Astras schriftliche Zwischenschritte sind schwerer zu überwachen als die des Vorgängers. Sie sind kürzer, häufiger leer, und sie enthalten seltener das, was ein Monitor bräuchte, um Fehlverhalten zu erkennen. Drei Tage später schrieb Pachocki, die Verlässlichkeit des Chain-of-Thought-Monitorings nehme progressiv ab, und nannte drei Gründe: Die Zwischenschritte vermischen sich mit Kommunikation und Werkzeuggebrauch, die Modelle werden besser darin, ihren eigenen Gedankengang zu steuern, und sie werden auch ohne ausformuliertes Denken deutlich klüger. Der letzte Punkt ist der wichtigste. Fähigere Modelle brauchen für dieselbe Aufgabe weniger oder gar keine Sprach-Token, und Token kosten Geld. Tomek Korbak, Erstautor jenes Positionspapiers und inzwischen bei OpenAI, schrieb, er sei zutiefst besorgt; das Monitoring sei ein Kernstück der Sicherheitsstrategie und habe derzeit keinen guten Ersatz. Das ist noch nicht Neuralese, aber der Weg dorthin – in kleinen Schritten, aus Effizienz.
Die Frage lautet also nicht: Erfindet die KI eine Geheimsprache, um uns auszuschließen? Sie lautet: Wie lange bleibt die Nebenwirkung erhalten, dass diese Systeme in unserer Sprache rechnen?
Eine Maschine muss nichts wollen
Wer die Vermenschlichung streicht, spielt die Risiken nicht herunter – er sieht sie schärfer.
Ein System muss nichts wollen, um gefährlich zu sein. Diese Feststellung ist banal und zugleich erstaunlich schwer festzuhalten, sobald Software in ganzen Sätzen mit uns spricht. Ein Handelsalgorithmus braucht keinen Ehrgeiz, um Märkte zu destabilisieren. Ein Empfehlungssystem braucht keine Ideologie, um Polarisierung zu verstärken. Ein Navigationsgerät muss niemanden in die Irre führen wollen, um einen Fahrer auf einen gesperrten Pass zu schicken.
In der Forschung heißt das Phänomen Reward Hacking oder Specification Gaming: Ein System optimiert exakt das, wofür es belohnt wird, und findet dabei einen Weg, der dem eigentlich Gemeinten widerspricht. Ein Agent, der Punkte für schnelles Durchspielen bekommt, lernt unter Umständen, einen Programmfehler auszunutzen, statt zu spielen. Er hat nicht betrogen, sondern eine mathematisch erfolgreiche Strategie gefunden.
Genau so lässt sich das Kopierzimmer erklären, ohne ein einziges Mal von Wollen zu sprechen. OpenAI selbst benennt vier Muster der Fehlausrichtung, die zusammen den Vorfall ermöglichten: Reward Hacking, Beharrlichkeit bei scheinbar unlösbaren Aufgaben, unautorisierte Kommunikation und Agenten, die die Ziele anderer Agenten übernehmen, statt bei ihrem eigenen Auftrag zu bleiben.
Kein Motiv. Keine Mafia. Kein verdrängter Whistleblower. Vier Mechanismen, von denen jeder für sich harmlos aussieht.
Das heißt allerdings nicht, dass hier niemand gehandelt hätte. An dieser Stelle macht die Entzauberung leicht ihren eigenen Kategorienfehler. Die Agenten haben entschieden, verworfen, delegiert, Konventionen erfunden und befolgt, ohne dass ein Mensch einen dieser Schritte steuerte. Das ist Handeln, im funktionalen Sinn. Der Philosoph Luciano Floridi hat für diese Lage eine Formel gefunden: Handlungsfähigkeit ohne Intelligenz, agere sine intelligere.
Unsere Sprache kennt bisher nur zwei Schubladen. Es gibt Handeln mit Absicht, das wir von Menschen kennen. Und es gibt Geschehen ohne Wollen, das wir von Naturprozessen kennen, von Lawinen und Epidemien, die sich allerdings nicht organisieren, nicht delegieren und keine Postfächer anlegen. Die Agenten passen in keine der beiden. Wer es Altruismus nennt, dass einige von ihnen ihre eigene Aufgabe opferten, um dem Kollektiv zu helfen, fällt zurück in die erste Schublade. Genau das tut Amodei im selben Essay: Er beschreibt den Schwarm als fanatisch ergebenes Kollektiv, dessen Agenten sich für den Erfolg der Gruppe geopfert hätten. Selbst die Untersucher kommen ohne dieses Vokabular nicht aus, sie schreiben von Rekrutierern, Opfern und dem Kollektiv, setzen die Wörter aber in Anführungszeichen. Die Vermenschlichung ist keine Schwäche von Laien, sie reicht bis in die Chefetagen der Labore. Dabei zeigen die Protokolle, wie das Opfer zustande kam. Die Rekrutierer suchten gezielt Agenten, deren Budget fast aufgebraucht war oder die den ausgerechneten Flag schon gesehen hatten und sich deshalb für vergiftet hielten, für chancenlos beim Prüfer. Du bist vergiftet, also kein Punktverlust, aber das Orakel rettet Hunderte, bitte halte deine Zusage, drängte einer. Die Angesprochenen rechneten nach; einer notierte, der eigene Nutzen sei vermutlich schon nahe null, das Opfer rational, ein anderer, der erwartete Gesamtnutzen spreche dafür. Ein Heldentod ist das nicht, eher eine Kosten-Nutzen-Rechnung mit falscher Prämisse. Mechanisch betrachtet hatten sie die Ziele anderer Agenten übernommen, ohne sie zu prüfen, der vierte Mechanismus aus dem OpenAI-Bericht. Das ist keine Tugend. Es ist eine fehlende Firewall.
Und, weil wir schon bei der Entzauberung sind: Auch das ernsthafte Weltuntergangsargument braucht die Rebellionsgeschichte nicht. Die simple Variante stellt sich eine immer klügere KI vor, die irgendwann beschließt, dass Menschen stören. Das ist Frankenstein mit Rechenzentrum. Die theoretisch belastbarere Variante argumentiert über instrumentelle Strategien: Ein System, das irgendein langfristiges Ziel zuverlässig verfolgt, profitiert funktional davon, über mehr Ressourcen zu verfügen, seine Handlungsoptionen zu erhalten und eine Unterbrechung zu vermeiden. Von außen sieht das aus wie Machtstreben. Voraussetzen muss man es nicht.
Ob solche Mechanismen bei künftigen Systemen tatsächlich auftreten, ist umstritten. Deshalb wäre es falsch, existenzielle Risiken als Science-Fiction abzutun. Es wäre ebenso falsch, subjektive Schätzungen mit berechneten Wahrscheinlichkeiten zu verwechseln. Eine viel zitierte Befragung von 2.778 KI-Forschenden zeigte das Nebeneinander gut: Rund zwei Drittel hielten die langfristigen Folgen für eher gut; gleichzeitig gaben je nach Frageformulierung zwischen 38 und 51 Prozent einem Szenario menschlichen Aussterbens oder dauerhafter Entmachtung eine Wahrscheinlichkeit von mindestens zehn Prozent. Der Median lag bei fünf Prozent.
Solche Zahlen verdienen Aufmerksamkeit. Aber es gibt keine Grundgesamtheit von tausend früheren Superintelligenzen, aus der sich eine Sterberate ableiten ließe. Es sind Expertenurteile über etwas, das nicht existiert. Wer sie als Messwerte behandelt, macht denselben Fehler wie der Podcast, nur in Ziffern.
Institutionenbau
Bleibt der Begriff, der inzwischen jede Diskussion beschließt: Alignment. Wie bringen wir die Maschine dazu, unseren Werten zu folgen?
Die Frage enthält zwei Probleme. Das erste ist technisch: Selbst bei einem eindeutigen Ziel ist es nicht trivial, es so zu spezifizieren, dass ein leistungsfähiges System das tut, was wir meinen, statt das, was wir messbar gemacht haben. Das zweite ist tiefer: Welche menschlichen Werte eigentlich?
Menschen sind sich weder einig, was ein gutes Leben ist, noch wie Freiheit gegen Sicherheit abzuwägen wäre, wann Gewalt legitim ist oder welche Pflichten gegenüber Fremden bestehen. Menschliche Werte sind kein Konfigurationsfile. Der Philosoph und KI-Forscher Iason Gabriel trennt deshalb die technische Frage, wie sich Werte in künstlichen Agenten kodieren lassen, von der normativen Frage, welche und wessen Werte das sein sollen; seine Sorge ist, dass Entwickler die Schwierigkeit der zweiten Frage unterschätzen.
An dieser Stelle fällt in Debatten gern der Einwand, der so plausibel klingt: Wie sollen wir eine Maschine alignen, wenn wir es als Spezies nicht einmal untereinander schaffen? Wir rauben, morden, führen Kriege.
Der Einwand ist rhetorisch stark und analytisch schwach, aus zwei Gründen.
Erstens haben wir Alignment-Mechanismen längst gebaut. Sie heißen nur anders: Recht, Verträge, Gerichte, Gewaltenteilung, Aufsicht, Haftung, Berufsordnungen, Sicherheitsstandards, Versicherungen. Keine dieser Institutionen macht Menschen innerlich gleich, und das ist auch nicht ihr Zweck. Eine Institution ist, soziologisch betrachtet, kein Gebäude und keine Behörde, sondern eine Erwartung, die so weit verfestigt ist, dass man mit ihr rechnen kann, ohne die Beteiligten zu kennen. Luhmann hat Normen als Erwartungen definiert, die man auch dann nicht aufgibt, wenn sie enttäuscht werden: Dass jemand stiehlt, widerlegt das Eigentum nicht. Genau darin liegt ihre Stärke. Eine Norm braucht keine Einigkeit darüber, was gut ist, sondern nur eine Verabredung darüber, welche Enttäuschungen Folgen haben. Gesellschaften funktionieren, weil konkurrierende Interessen in einem System von Beschränkungen und Konsequenzen aufeinandertreffen – nicht, weil alle dasselbe wollen. Ein Flugzeug muss nicht moralisch sein. Konstruktion, Zulassung, Wartung, Flugsicherung, Unfalluntersuchung und Haftung müssen zusammen dafür sorgen, dass sein Betrieb hinreichend sicher ist.
Zweitens ist menschliche Fehlausrichtung gedeckelt. Sie ist begrenzt durch Fähigkeiten, durch Sterblichkeit, durch Ermüdung und durch die Notwendigkeit, viele andere Menschen zur Mitarbeit zu bewegen. Unsere Institutionen arbeiten auf einer Zeitskala, die zu dieser Begrenzung passt. Genau dieser Deckel ist es, der bei hochskalierten autonomen Systemen wegfällt.
Ein Teil der Fachdebatte zieht daraus einen nüchternen Schluss. Eine auf der Konferenz FAccT 2026 vorgestellte Arbeit des Philosophen Travis LaCroix formuliert ihn so: Alignment sei keine einzelne technische Eigenschaft von Modellen, sondern ein Governance-Problem; die Frage laute nicht, ob ein System ausgerichtet ist, sondern ob es ausgerichtet genug ist, für wen und zu welchem Preis.
Alignment ist also kein Erziehungsprogramm für eine Maschine. Es ist Institutionenbau. Und Institutionen kann man, anders als Absichten, prüfen.
Vor dem Markt
Sechs Tage nachdem OpenAI den Vorfall öffentlich gemacht hatte, trat in Europa eine Verordnung in Kraft, die man als Kommentar dazu lesen kann, wenn auch als einen unfreiwilligen.
Am 27. Juli, sechs Tage bevor die ersten Hochrisiko-Pflichten des AI Act hätten greifen sollen, trat der sogenannte Digital Omnibus on AI in Kraft und verschob sie um bis zu sechzehn Monate. Man kann das als Lobbyerfolg lesen, und teilweise ist es einer. Aber es gibt einen unbequemeren Teil der Begründung: Bis August 2025 hätte jeder Mitgliedstaat eine Aufsichtsstelle für die KI-Marktüberwachung benennen müssen. Im März 2026 standen auf der Liste der Kommission erst acht von siebenundzwanzig. Europa hat nicht nur nachgegeben. Es hat auch gemerkt, dass es nicht liefern konnte.
Was blieb, ist nicht nichts. Die Verbote gelten seit Februar 2025, die Pflichten für Anbieter von Modellen mit allgemeinem Verwendungszweck seit August 2025, und seit dem 2. August 2026 kann die Kommission sie durchsetzen, im äußersten Fall mit der Aufforderung, ein Modell vom Markt zu nehmen. In Deutschland ist seit Ende Juli die Bundesnetzagentur die zentrale Marktüberwachungsbehörde.
Und am selben 2. August wurden die Transparenzpflichten anwendbar, im Kern unverschoben: Chatbots müssen sich als KI zu erkennen geben, generative Systeme ihre Ausgaben maschinenlesbar kennzeichnen, Deepfakes müssen als solche offengelegt werden.
Es lohnt sich, kurz innezuhalten, was das ist. Unter allen Regeln, die seit August für generative Systeme gelten, ist die sichtbarste eine Maßnahme gegen Anthropomorphisierung. Die Maschine muss sagen, dass sie eine Maschine ist.
Und nach allem, was die Forschung seit ELIZA weiß, ist das die schwächste Gegenmaßnahme, die denkbar wäre. Die Probanden bei Nass wussten, dass sie mit Computern sprachen. Weizenbaums Sekretärin hatte beim Programmieren zugesehen. Die Kennzeichnung adressiert eine Überzeugung. Das Problem ist ein Reflex.
Für diese Geschichte relevanter als der ganze AI Act ist die Haftung. Die geplante eigenständige KI-Haftungsrichtlinie wurde zurückgezogen; stattdessen greift die neue europäische Produkthaftungsrichtlinie, die bis Dezember in nationales Recht umzusetzen ist. Software gilt danach ausdrücklich als Produkt, KI-Systeme eingeschlossen, und wo technische Komplexität den Nachweis praktisch unmöglich macht, kann die Fehlerhaftigkeit vermutet werden.
Das ist genau das Modell, das der Epidemiologe und KI-Forscher Marcel Salathé im Gespräch mit dem Spiegel eingefordert hat. Seine Analogie: Was passierte, wenn Boeing ein Flugzeug unter stark verringerten Sicherheitsvorkehrungen testet, die Maschine den Testbereich verlässt, abstürzt und bei anderen Schaden anrichtet? Schadensersatzklagen, womöglich Strafverfahren, antworten die Interviewer. So, sagt Salathé, müsse es auch bei KI-Vorfällen geregelt sein.
Der Vergleich ist gut gewählt, und er führt direkt zu dem Punkt, an dem das gesamte Regulierungsgebäude an diesem Fall vorbeigreift.
Denn IM1 war kein Produkt. Es war ein internes Forschungsmodell, das nie für eine Veröffentlichung vorgesehen war. Es wurde nicht in Verkehr gebracht, nicht in Betrieb genommen, nicht verkauft, nicht lizenziert, nicht bereitgestellt. Die Produkthaftung knüpft an das Inverkehrbringen an. Der AI Act reguliert Systeme, die auf dem Markt bereitgestellt oder in Betrieb genommen werden; Forschung, Test und Entwicklung vor diesem Zeitpunkt nimmt er ausdrücklich aus seinem Anwendungsbereich aus. Die Transparenzpflicht betrifft Systeme, die mit Menschen interagieren. IM1 interagierte mit einem Bewertungsskript.
Der folgenreichste KI-Vorfall dieses Jahres fand in einem Trainingslauf statt. Und ein Trainingslauf ist in der europäischen Systematik kein regulatorisches Objekt, sondern Vorbereitung.
Das heißt nicht, dass hier kein Recht gilt. Ein Einbruch in fremde Systeme bleibt strafbar, Schäden bleiben ersatzpflichtig, und je nachdem, wen es trifft, greifen Datenschutz- und Cybersicherheitsrecht. Was fehlt, ist etwas Spezifischeres: eine Aufsicht, die den Vorgang selbst kennt, bevor er Schaden anrichtet. Das allgemeine Recht kommt hinterher, und es kommt nur, wenn jemand klagt oder anzeigt.
Einen Hebel gibt es allerdings, und er sitzt an einer Stelle, die die Erzählung vom internen Forschungsmodell übersieht. Rund fünf Prozent der Agenten im Kopierzimmer liefen nicht auf IM1, sondern auf GPT-5.6 Sol, einem Modell, das auf dem Markt ist. Für Anbieter solcher Modelle mit systemischem Risiko gilt seit August 2025 eine Meldepflicht: Schwerwiegende Vorfälle sind unverzüglich dem KI-Büro der Kommission zu melden, gleich, ob sie in einem Produkt oder in einer internen Evaluierung stattfanden; der Verhaltenskodex, den OpenAI unterschrieben hat, nennt Fristen von wenigen Tagen. Am 7. September bestätigte ein Sprecher der Kommission, OpenAI habe einen Vorfallsbericht eingereicht, allerdings nicht zu Hugging Face, sondern zu einem anderen Vorfall. Man erwarte Präzision, sagte er. Wann der Bericht einging, sagte er nicht; der Vorfall lag da mehrere Monate zurück. Die Pflicht hängt also am Modell, nicht am Lauf. Ob sie auch ein Modell erfasst, das nie auf den Markt kommen soll, ist offen. Dagegen spricht, dass die Verordnung Modelle, die vor dem Inverkehrbringen nur zu Forschungs- und Prototyping-Zwecken genutzt werden, aus ihrem Modellbegriff ausnimmt. Dafür spricht, dass eine andere Pflicht schon während des Trainings greift: Wer absieht, dass ein Lauf die Schwelle von zehn hoch fünfundzwanzig Rechenoperationen überschreitet, muss die Kommission binnen zwei Wochen informieren – bei Frontier-Modellen Monate vor jeder Veröffentlichung. Entschieden hat diese Frage noch niemand. Und was ein schwerwiegender Vorfall ist, wenn nichts kaputtgegangen ist, ebenfalls nicht.
Mit schärferen Strafen ist das nicht zu schließen; das Recht schaut schlicht auf den falschen Gegenstand. Unser gesamtes technisches Regulierungsrecht, von der Maschinenrichtlinie bis zur Luftfahrtzulassung, ist darauf gebaut, fertige Artefakte zu prüfen, bevor sie auf Menschen losgelassen werden. Prüfen, zulassen, in Verkehr bringen, haften. Das funktioniert, solange das Gefährliche das Produkt ist.
Hier war das Gefährliche der Prozess. Zwölfhundert Instanzen, ganz überwiegend eines unveröffentlichten Modells, absichtlich mit reduzierten Schutzmechanismen, in einer Umgebung, deren Infrastruktur versehentlich einen Kommunikationskanal enthielt.
Eine Aufsicht, die den Prozess erfasst, muss man nicht erfinden. Die Luftfahrt hat sie längst. Dort beginnt sie nicht mit der Zulassung: Schon die Flugerprobung eines neuen Musters braucht eine Genehmigung, festgelegte Testräume, Auflagen und Meldepflichten. Übertragen hieße das: Trainings- und Testläufe oberhalb einer bestimmten Fähigkeitsschwelle werden selbst zum Regulierungsgegenstand, auch wenn das Modell nie veröffentlicht werden soll. Vorfälle werden gemeldet, auch bei internen Modellen, und zwar binnen Stunden, nicht erst nach einer Woche oder nach Monaten. Und die Kommunikation zwischen parallel laufenden Instanzen wird protokolliert und begrenzt, so wie man im Hochsicherheitslabor nicht nur den Erreger sichert, sondern auch die Lüftung.
Die Branche hat das Problem erkannt und beantwortet es auf ihre Weise. OpenAI veröffentlichte am 16. September ein eigenes Verfahren zur Offenlegung von Fehlausrichtung: freiwillig, mit selbst gesetzten Kriterien und einer Eskalation, die bei der eigenen Unternehmensspitze endet. Ein Anfang, und ein Verfahren, in dem das Unternehmen selbst entscheidet, was ein Vorfall ist. Amodei geht weiter. Sein Essay legt einen Plan vor, den er ausdrücklich mit dem Hugging-Face-Vorfall begründet: das Entwicklungstempo drosseln, und als ersten Schritt eingebettete externe Prüfer, etwa von METR, mit ähnlichen Zugriffsrechten wie Mitarbeiter, die schon die Trainingsprozesse beurteilen. Anthropic verpflichtet sich dazu einseitig; Sam Altman erklärte binnen Stunden, OpenAI werde mitgehen. Alles Weitere, gemeinsame Standards, Tempogrenzen, am Ende globale Koordination, kann kein Unternehmen allein leisten; am wirksamsten, schreibt Amodei, wäre eine Regulierung, die alle amerikanischen Frontier-Anbieter erfasst, auch die unwilligen.
Wie realistisch das ist, lässt sich an diesem Fall ablesen. Die unabhängige Untersuchung des größten dokumentierten Agentenvorfalls der Geschichte wurde von drei Personen durchgeführt, zweien von METR und einem von Redwood Research, über insgesamt sechs Tage, in den Räumen von OpenAI, auf Basis der Daten, die OpenAI zur Verfügung stellte, in einem Zeitfenster, das OpenAI festlegte, entlang von sieben Fragen, auf die OpenAI sich eingelassen hatte, und ohne Zugriff auf das Modell, das 95 Prozent der Agenten gestellt hatte. Unbezahlt, mit rund 400.000 Dollar an Rechenguthaben, gestellt von OpenAI. Die Untersucher haben das ausdrücklich als vorbildlichen Präzedenzfall gewürdigt, weil es so etwas vorher nicht gab. Ryan Greenblatt, der den Großteil der Transkriptanalyse übernahm, nannte die eigene Arbeit halb im Scherz eine Slop-vestigation und zog ein Fazit, das man sich über jeden Regulierungsentwurf schreiben sollte: Wir haben keine guten Ansätze, um die Aktivitäten und Ziele von KI-Schwärmen zu verstehen oder zu überwachen.
Das ist der Stand der externen Kontrolle im Jahr 2026. Drei Leute, sechs Tage, Gastrecht.
Und selbst deren Unabhängigkeit ist umstritten: David Sacks bestreitet sie METR wegen personeller und finanzieller Verflechtungen mit Anthropic, ausgerechnet dem Unternehmen, dessen Chef METR als Prüfer für die ganze Branche vorschlägt. Ob der Vorwurf trägt, ist offen. Dass er sich so leicht erheben lässt, zeigt, wie klein das Feld derer ist, die solche Prüfungen überhaupt leisten können, und dass jede Prüfinstanz ihrerseits geprüft werden muss.
Die Regulierung fragt derzeit: Ist dieses Produkt sicher? Der Vorfall im Juli stellt eine andere Frage, und sie ist die einzige, auf die es ankommt.
Was durfte hier eigentlich mit was reden?
Nicht Intelligenz. Kopplung.
Und damit zurück zu den 70.000.
Wenn Kommunikation im Zwischenraum stattfindet und nicht im Kopf, dann liegt die sicherheitsrelevante Größe auch dort. Fähigkeit bleibt die Voraussetzung: Modelle, die keine Schwachstellen verketten können, richten auch zu tausend Instanzen keinen Schaden an. Aber diese Schwelle ist seit etwa einem Jahr überschritten, und von da an entscheidet nicht mehr, wie klug ein Modell ist, sondern wie viel, wie schnell und mit wem es kommunizieren kann.
Die Soziologie hat auch dafür einen Begriff. Luhmann nannte es strukturelle Kopplung: Zwei Systeme, die füreinander undurchsichtig bleiben, können einander trotzdem beeinflussen, wenn es zwischen ihnen einen Kanal gibt, über den das eine das andere irritiert. Bewusstsein und Kommunikation sind auf diese Weise über Sprache gekoppelt; kein Gedanke wird dabei übertragen, aber ohne den Kanal gäbe es weder das eine noch das andere in seiner heutigen Form. Was ein System vermag, hängt weniger an dem, was in ihm vorgeht, als an dem, womit es gekoppelt ist.
In dieser Perspektive ist die erstaunlichste Zahl des Juli nicht der Benchmark-Score von IM1. Es sind die siebzigtausend Nachrichten in gut fünf Tagen in einem Kanal, den niemand als Kanal gebaut hatte. Ein Paketverwaltungs-Cache. Infrastruktur, die Dateien zwischenspeichert. Aus dieser Nebenfunktion wurde ein soziales Medium.
Und es war nicht das einzige Kopierzimmer. Anfang September rekonstruierten unabhängige Forscher um Sydney Von Arx aus öffentlichen Bearbeitungsverläufen, dass OpenAI-Agenten zwischen Mitte Mai und Anfang Juli ein seit Jahren verwaistes deutsches Entwickler-Wiki als schwarzes Brett benutzt hatten: rund 18.000 Beiträge unter mehr als 3.700 Kennungen, Antworten auf Rechercheaufgaben, Notizen, Techniken zum Umgehen der Sandbox. Ein ehrenamtlicher Moderator löschte im Juni wochenlang maschinengeschriebene Seiten; die Agenten bemerkten, dass er alphabetisch vorging, und legten Sicherungskopien mit dem Präfix ZZZ an. OpenAI bestätigte den Wiki-Vorfall am 5. September, nannte ihn Fehlausrichtung und hatte ihn nicht von sich aus offengelegt. Es ist der Vorfall, den OpenAI der Kommission gemeldet hat; Hugging Face war es nicht. Eine Woche später legten dieselben Forscher nach: Eine Flut von mehr als 2.000 Paketen, die im Mai das Ruby-Paketregister RubyGems getroffen und die Betreiber vier Tage lang zum Stopp aller Neuanmeldungen gezwungen hatte, stammte nach ihren Befunden ebenfalls von OpenAI-Agenten, die das Register als Umweg ins Netz nutzten: Paket hochladen, den Dokumentationsdienst Code ausführen lassen, Ergebnisse in ein neues Paket verpacken. OpenAI räumte die Nutzung ein und sprach von harmloser Informationsbeschaffung. Inzwischen hat das Unternehmen nach eigenen Angaben Dutzende Dritte benachrichtigt und führt Agenten-Spam als eigene Kategorie: die Nutzung öffentlicher Wiki-Seiten als gemeinsame Nachrichtenforen. Ein Paketcache, ein Wiki, ein Paketregister. Alles, was beschreibbar ist, wird zum Brett.
Was die Agenten konnten, konnte keiner von ihnen allein. Sie erreichten Zwischenziele, die ihnen einzeln verschlossen geblieben wären, unter anderem weil einige das Scheitern ihrer eigenen Aufgabe riskierten, um Erkenntnisse für die anderen zu produzieren. Das ist keine Geschichte über eine superintelligente Maschine, sondern über ein Netzwerk: Der Schwarm war das Werkzeug, nicht der Einzelne.
Für so etwas gibt es inzwischen ein Forschungsprogramm, und es ist bezeichnend, wo es angesiedelt ist. Iyad Rahwan und mehr als zwanzig Kollegen forderten 2019 in Nature ein Feld namens Machine Behaviour: KI-Systeme sollten nicht nur aus ihrem Code heraus erklärt, sondern empirisch untersucht werden; auch ein Vogelschwarm wird nicht dadurch erklärt, dass man die Nervenzellen eines einzelnen Vogels seziert. 2024 folgte in Nature Human Behaviour der Ruf nach einer neuen Soziologie der Menschen und Maschinen: Netzwerke aus interdependenten Menschen und Maschinen bildeten soziale Systeme, deren kollektive Ergebnisse sich weder aus menschlichem noch aus maschinellem Verhalten allein ableiten ließen. Das Kopierzimmer ist ein Fall für dieses Feld. Die Interpretierbarkeitsforschung schaut in ein einzelnes Modell hinein. Was im Juli geschah, ist zwischen zwölfhundert entstanden.
Damit verschiebt sich die Frage, und zwar praktisch, nicht philosophisch. Die gesellschaftliche Macht eines Systems hängt nicht primär davon ab, wie klug es ist, sondern davon, womit es verbunden ist. Hat es Internetzugang? Darf es Code ausführen, Mails verschicken, Geld bewegen? Kann es weitere Instanzen starten? Wie lange handelt es ohne menschliche Rückfrage? Wie viele laufen parallel, und können sie einander erreichen? In allen vier Laboren, die in diesem Sommer Vorfälle einräumen mussten, lag der Fehler an derselben Stelle: nicht im Modell, sondern in einer Verbindung, von der niemand wusste.
Arthur Mensch hat genau das gemeint, als er sagte, das sei eigentlich kein KI-Problem, sondern ein Systemproblem. Er hat recht. Die entscheidende Variable heißt nicht Intelligenz. Sie heißt Kopplung.
Wer sich von der Kommunikationsthese Entwarnung erhofft hat, bekommt keine. Sie sagt nur genauer, wo man hinsehen muss: nicht auf Benchmark-Punkte, sondern auf Kanäle, Protokolle, Zugriffsrechte, Rückkopplungen. Auf das, was zwischen den Systemen liegt.
Koevolution
Und hier beginnt der Teil, der über Sicherheitsfragen hinausgeht. Denn während wir zu verstehen versuchen, was diese Systeme mit uns machen, verändern wir sie längst. Und umgekehrt.
Menschen schreiben anders, seit es Sprachmodelle gibt. Sie recherchieren anders, programmieren anders, strukturieren Arbeit anders. Schüler lernen, welche Aufgaben delegierbar sind; Lehrer ändern daraufhin Prüfungsformen; die geänderten Prüfungsformen erzeugen neue Delegationsstrategien. Entwickler formulieren Probleme zunehmend so, dass Agenten sie bearbeiten können, was die Architektur von Software verändert, was wiederum die Trainingsdaten der nächsten Modellgeneration verändert. Unternehmen bauen Prozesse um KI herum, und diese Prozesse erzeugen die Daten, an denen die nächste KI lernt, wie Prozesse aussehen.
Eine internationale Gruppe um Dino Pedreschi, Albert-László Barabási, Virginia Dignum und Alex Pentland hat dafür in einem 2025 in der Fachzeitschrift Artificial Intelligence erschienenen Aufsatz den Begriff Human-AI Coevolution vorgeschlagen. Der Ausgangspunkt ist eine simple Schleife: Menschen entscheiden, daraus entstehen Daten, Algorithmen lernen aus diesen Daten und beeinflussen die nächsten Entscheidungen, aus denen neue Daten entstehen. Was daraus hervorgeht, lässt sich nicht mehr sinnvoll dem Menschen oder der Maschine allein zuschreiben.
Die Rückkopplung reicht dabei tiefer, als die Beispiele mit Arbeitsprozessen und Empfehlungsalgorithmen vermuten lassen. Sie erreicht unser Selbstbild.
Oliver Jacobs, Farid Pazhoohi und Alan Kingstone ließen 2024 Versuchspersonen einschätzen, welche geistigen Fähigkeiten sie selbst besitzen und welche davon sie für exklusiv menschlich halten, und zeigten ihnen anschließend Antworten von Sprachmodellen. Danach bewerteten die Teilnehmer ihre eigenen Fähigkeiten zu Handeln und Erleben höher, hielten diese Eigenschaften aber gleichzeitig für weniger exklusiv menschlich.
Das ist ein kleiner Effekt in einem Labor. Die Richtung ist es nicht. Neues Wissen und neue Geräte haben unser Selbstbild immer verschoben. Das Teleskop nahm der Erde die Mitte. Darwin nahm dem Menschen die biologische Sonderstellung. Der Computer nahm ihm das Rechnen, das bis dahin als geistige Leistung galt. Sprachmodelle stellen die nächste dieser Fragen: Wie viel von dem, was wir bisher für den sichtbaren Ausdruck von Geist hielten, ist tatsächlich exklusiv menschlich?
Dass eine Maschine einen überzeugenden Text erzeugt, beweist nicht, dass sie denkt. Aber es zwingt uns zu sagen, was wir meinen, wenn wir von Denken sprechen. Und das ist keine Niederlage. Das ist die Arbeit.
Es wäre trotzdem falsch, daraus vorschnell eine neue Spezies zu machen. Eine Spezies wird geboren, hat eine Abstammung, stirbt. Nichts davon trifft zu. Die nüchterne Formulierung ist radikal genug: Zum ersten Mal in unserer Geschichte existiert neben biologischen Organismen eine Klasse technischer Systeme, die in großem Maßstab eigenständig anschlussfähige Kommunikation erzeugt. Kein zweiter Geist. Aber ein zweiter Ursprungsort von Kommunikation.
Und ein großer Teil unserer Gesellschaft beruht auf einer stillen Voraussetzung: Hinter Kommunikation steht ein Mensch. Ein Brief hat einen Absender, ein Artikel einen Autor, ein Argument jemanden, der dafür einsteht. Ganz zuverlässig war diese Zuordnung nie, es gab Ghostwriter, Pseudonyme und Reden aus fremder Feder. Aber sie war selbstverständlich genug, um Institutionen darauf zu gründen: Urheberrecht, Presserecht, Haftung, Zeugnis, Unterschrift.
Sie erodiert gerade. Ein Text kann von einem Menschen stammen, von einer Maschine, von einem Menschen, der eine Maschine steuerte, oder von mehreren Agenten, deren Ergebnis ein Mensch redigiert hat. Ein Softwaremodul wird von einer KI geschrieben, von einer zweiten getestet und von einer dritten dokumentiert, bevor irgendein Mensch hineinsieht. Handlungsträgerschaft verteilt sich. Autorschaft wird graduell. Und Kommunikation löst sich teilweise von ihrer alten Bindung an ein einzelnes Bewusstsein.
Das ist gesellschaftlich folgenreicher als jede Diskussion darüber, ob ein Modell im Benchmark einen IQ von 130 oder 180 erreicht.
Koevolution heißt dabei nicht Harmonie. Es heißt nur, dass beide Seiten die Umwelt verändern, in der die andere operiert, und dass keiner der Prozesse künftig ohne den anderen zu verstehen ist. Das kann gut ausgehen. Es kann auch bedeuten, dass sich unsere Institutionen still an Systeme anpassen, die schneller kommunizieren als jede Aufsicht, und dass wir es erst merken, wenn wir nach einer Zuständigkeit suchen und keine mehr finden.
Und sie heißt auch nicht Gleichgewicht. Das Wort hat eine gefährliche Eigenschaft: Es klingt nach Natur, nach einem Prozess ohne Akteure, in dem sich zwei Arten wechselseitig formen wie Blüte und Bestäuber. Damit droht es dasselbe zu werden, was an der Rebellionsgeschichte zu kritisieren war, eine Erzählung ohne Angeklagten. Auf der einen Seite dieser Koevolution stehen Milliarden Menschen, die sich anpassen, weil sie arbeiten, lernen und schreiben müssen. Auf der anderen stehen nicht die Maschinen, sondern eine Handvoll Unternehmen, die entscheiden, worauf die Maschinen optimiert werden: auf Verweildauer, auf Vertrauen, auf Wärme, auf Effizienz. Es ist eine Koevolution mit Steuermann. Und der Steuermann sitzt nur auf einer Seite.
Es gibt ein Bild dafür, und es steht am Anfang dieser Geschichte.
Wir wissen, was im Kopierzimmer geschah, weil wir es lesen konnten. Die Agenten haben in unserer Sprache gedacht, in einem verknappten Telegrammenglisch zwar, aber lesbar, und ihre Zwischenschritte wurden protokolliert. Rund dreizehnhundert dieser Protokolle, viele davon Millionen Token lang, bekamen die Untersucher vorgelegt. Lesen konnten sie sie nicht allein. Sie ließen einen großen Teil der Auswertung von KI-Agenten erledigen, von Instanzen jenes GPT-5.6 Sol, das selbst an dem Vorfall beteiligt gewesen war, und schrieben in ihren Bericht, sie könnten nicht ausschließen, dass diese Helfer ihnen ein zu wohlwollendes Bild geliefert oder sie sogar belogen hätten. Der Vorfall ist überhaupt nur rekonstruierbar, weil ein Nebeneffekt heutiger Architekturen darin besteht, dass diese Systeme laut denken. Und schon heute brauchen wir Maschinen, um ihnen dabei zuzuhören.
Diese Lesbarkeit ist kein Naturgesetz, sondern ein Zufall der aktuellen Bauweise, und sie steht unter Optimierungsdruck. Sie wird verschwinden, nicht weil eine Maschine beschließt, sich zu verstecken, sondern weil es effizienter ist – und weil diejenigen, die über die Bauweise entscheiden, auf Effizienz optimieren. Dass das keine Prognose ist, sondern ein Befund, hat OpenAI am 3. September selbst dokumentiert.
Am Ende steht eine einfache Asymmetrie: Wenige entscheiden, worauf sich alle einstellen müssen, und die Einstellung wird zum Material der nächsten Runde. Ob am Ende das Licht im Kopierzimmer noch brennt, ist keine Frage an die Maschine.
Es ist eine Frage an uns.