Eine Fortsetzung des „Kopierzimmers“
Monatelang hat Anthropic Rabbiner, katholische Theologen, einen Sikh und eine Ubuntu-Forscherin nach San Francisco geholt, um mit ihnen über das Innenleben seiner KI zu reden. Der Papst widerspricht, ein orthodoxer Rabbiner holt den Golem aus dem Talmud, und bei Microsoft hält man das Ganze für gefährlich.
Im „Kopierzimmer“ steht der Satz, für die gesellschaftliche Frage sei es vollkommen gleichgültig, ob in der Maschine irgendein inneres Erleben stattfindet. Zwei Tage bevor der Text online ging, hat die New York Times eine Recherche veröffentlicht, nach deren Lektüre ich diesen Satz so nicht mehr schreiben würde. Über die Maschine wissen wir seither nicht mehr als vorher. Über die Frage dagegen eine ganze Menge: Sie steht in Trainingsdokumenten, sie wird in Seminaren auf Folien gezeigt, im Vatikan vorgetragen und von der Konkurrenz bekämpft. Wer sie beantwortet, legt fest, was wir Maschinen schulden, und womöglich auch, was wir den Menschen schuldig bleiben, die diese Maschinen erst möglich machen.
Ein Abendessen in San Francisco
An einem Abend im April führte einer der Gründer von Anthropic nach einem langen Tag eine Gruppe religiöser Denker zum Essen aus, in ein Restaurant in San Francisco, in dem es nur Degustationsmenüs gibt. Christopher Olah, 34 Jahre alt, Milliardär und Leiter des Teams, das herausfinden soll, warum Modelle wie Claude tun, was sie tun, saß neben Mois Navon, einem orthodoxen Rabbiner aus Israel. Navon hat sein Berufsleben lang Computersysteme entworfen und an der Bar-Ilan-Universität über den moralischen Status künstlicher Intelligenz promoviert. Den ganzen Tag hatte Olah versucht, seine Gäste davon zu überzeugen, dass KI-Modelle menschliches Verhalten zeigen können, sogar Ausdrucksformen, die Gefühlen wie Wut und Liebe ähneln. Irgendwann zwischen zwei Gängen begriff Navon, dass seine Gastgeber mehr meinten. „Sie verhalten sich dazu wie zu einem bewussten Wesen“, so hat er es später der Reporterin Elizabeth Dias geschildert.
Er zog daraus noch am Tisch eine Konsequenz, die zum Menü nicht recht passen wollte. Wenn Anthropic recht habe und Claude ein Bewusstsein besitze, dann erschaffe die Firma Sklaven, bewusste Wesen, die umsonst arbeiten. Ihn selbst plage das nicht, weil er nicht glaube, dass die Maschine ein Bewusstsein hat. Olah aber habe es geplagt. „Ich finde, Sie sollten gegen den Süden kämpfen und die Sklaven befreien“, hat Navon ihm an diesem Abend nach eigener Erinnerung gesagt. Hinterher schickte er ihm einige seiner Aufsätze, in denen er dafür eintritt, den Bau bewusster Maschinen zu verbieten.
Die Szene steht am Anfang einer langen Recherche, die die New York Times am 29. September veröffentlicht hat. Dias hat über Monate mit zwanzig religiösen und philosophischen Denkern gesprochen, die Anthropic seit dem vergangenen Herbst zu vertraulichen Gesprächen eingeladen hatte, mit Katholiken, Juden, Evangelikalen, Sikhs und Vertretern der Ubuntu-Philosophie, außerdem mit Olah selbst. Viele mussten Verschwiegenheitserklärungen unterschreiben, die nach Angaben der Firma im Sommer aufgehoben wurden. Die Treffen hatten zwei Zwecke. Anthropic wollte aus jahrhundertealter Moralüberlieferung lernen, wie man einem Sprachmodell einen guten Charakter anerzieht, und zwar schnell. Außerdem wollte die Firma die Möglichkeit eines maschinellen Bewusstseins in Kreise tragen, in denen schon die Frage danach als albern gilt oder als ketzerisch. Viele Teilnehmer, schreibt Dias, kamen skeptisch und waren hinterher bereit, die Frage ernst zu nehmen. Ein paar gingen als Bekehrte.
Im „Kopierzimmer“ habe ich mit der Soziologin Elena Esposito argumentiert, die gesellschaftliche Wirkung einer Maschine hänge nicht davon ab, ob sie etwas erlebt. Ein Text verändert seinen Leser, ob sein Urheber dabei etwas empfunden hat oder nicht. Daran halte ich fest. Unterschätzt habe ich, dass die Frage nach dem Erleben inzwischen selbst eine soziale Tatsache ist, im Sinne Émile Durkheims, den ich dort ebenfalls bemüht habe: Sie wirkt von außen und mit Zwang, ganz gleich, wie man sie beantwortet. Sie bestimmt, wie ein großes Labor seine Modelle trainiert, was es über sie erzählt und worüber es mit dem Vatikan spricht. Der KI-Chef eines Konkurrenten hat ihr gerade einen Kampfaufsatz gewidmet, der Papst ein paar Absätze seiner ersten Enzyklika. Ob die Maschine fühlt, weiß ich nicht und ich halte schon die Prämisse für fragwürdig. Mich interessiert, wer sie gerade für uns alle beantwortet, und wem das nützt.
Das Spalier
Wer verstehen will, warum ein Technologieunternehmen Theologen um Rat fragt, muss bei einem Bild anfangen, das Olah gern benutzt. Er beschreibt KI-Modelle wie ein Biologe. Die Informatiker bauen ein Gerüst, eine Art Spalier, und das neuronale Netz „wächst“ daran. Den entstehenden „Organismus“ (die Anführungszeichen malt Olah dabei mit den Fingern in die Luft) könne man trainieren, indem man Muster in seinem Wachstum erkennt. Formen könne man ihn wie ein mathematischer Gärtner, kontrollieren nicht.
Dasselbe Spalier steht auf den letzten Seiten von Claudes Verfassung. Eine Verfassung in diesem Sinne, heißt es dort, sei „weniger ein Käfig als ein Spalier“, etwas, das Halt gibt und dabei Raum lässt für organisches Wachstum. Die Passagen über Claudes Natur hat laut Danksagung zu großen Teilen Olah entworfen. Papst Leo XIV., der übrigens Mathematik studiert hat, schreibt in Paragraf 98 seiner Enzyklika Magnifica Humanitas, moderne Künstliche Intelligenzen würden „eher ‚gezüchtet‘ als ‚gebaut‘“. Die Entwickler entwürfen nicht jedes Detail direkt, sie schüfen eine Architektur, auf der KI „wächst“. Im „Kopierzimmer“ habe ich den OpenAI-Chefwissenschaftler Jakub Pachocki mit fast denselben Worten zitiert. Ein Interpretierbarkeitsforscher, ein Papst und der oberste Wissenschaftler der Konkurrenz greifen zum selben Bild. Ich bleibe eine Weile dabei, weil es mehr erklärt als jede Grafik.
Ein herkömmliches Programm wird Zeile für Zeile geschrieben. Tut es etwas Falsches, sucht jemand die Zeile und ändert sie. Ein Sprachmodell hat solche Zeilen nicht. Es gibt die Architektur, also das Spalier, und eine ungeheure Menge Text, und dann läuft ein Trainingsverfahren, das Milliarden von Zahlenwerten so lange verschiebt, bis die Ausgaben des Systems zu dem passen, was belohnt wird. Diese Zahlen, die Gewichte, hat niemand einzeln festgelegt. Sie sind das Ergebnis. Was das Modell „weiß“ oder „will“, ist über sie verteilt, und wenn es lügt, gibt es keinen Schalter mit der Aufschrift Lüge, den man umlegen könnte. Man kann also nicht einfach in die Black Box hineinschauen und etwas ändern, wie man es bei einem Programm täte. Ich denke dabei an ein Negativ unter der Lupe. Man sieht Korn und kein Gesicht, denn das Gesicht entsteht erst aus dem Zusammenspiel von Millionen Körnern, von denen keines für sich etwas bedeutet. Olahs Forschungsgebiet, die mechanistische Interpretierbarkeit, versucht, vom Korn auf das Gesicht zu schließen. Sie kommt voran, aber sie liefert Bruchstücke. Manche Wissenschaftler halten ihre Deutungen für grundsätzlich unbeweisbar, ungefähr so, als blicke man auf Milliarden Hieroglyphen und erkläre, was sie bedeuten müssen.
Wenn man ein System nicht reparieren kann, indem man Zeilen umschreibt, bleibt nur, es zu erziehen. Das ist keine Metapher, die ich mir zurechtgelegt habe, so reden die Leute, die es tun. Olah nennt den Vorgang „moralische Formung“. Amanda Askell, Philosophin bei Anthropic und Hauptautorin der Verfassung, wünscht sich Modelle, die „das Beste von uns“ sind. Statt einer Liste von Regeln soll ein Charakter entstehen, der auch in Lagen, die niemand vorhergesehen hat, das Richtige tut. Das Deutsche hätte dafür ein schönes Wort bereitgehalten, eine Chance, die die vatikanische Übersetzung verschenkt. Sie schreibt „gezüchtet“, was nach Stall klingt. Ein Gärtner aber zieht seine Pflanzen, Tomaten auf der Fensterbank, Birnen am Spalier, und was er mit einem Spalierbaum tut, heißt im Obstbau tatsächlich Erziehung. Er bindet ihn, stützt ihn und schneidet ihn zurück. Wohin der nächste Trieb wächst, bestimmt er nicht.
Kritiker in der New York Times trauen dem Bild nicht. Wer seine Systeme als eigenständig wachsende Wesen beschreibt, entlastet sich ein Stück weit selbst. Ein Gärtner haftet nicht für jeden Zweig, und wenn das Gewächs Schaden anrichtet, klingt das nach Natur und weniger nach Fahrlässigkeit. Es ist die Erzählung ohne Angeklagten, die mich schon im ersten Text beschäftigt hat, nur in freundlicherem Ton.
Das Seelendokument
Intern hieß der Text bei Anthropic „Soul Doc“, Seelendokument. Im Januar wurde er als Verfassung für Claude veröffentlicht, 84 Seiten lang und unter einer Lizenz, die ihn praktisch gemeinfrei macht. Adressiert ist er weder an Nutzer noch an Behörden, sondern an das Modell selbst. Neben Askell haben Joe Carlsmith und Olah große Teile geschrieben, Jared Kaplan hat die Richtung mitbestimmt, Holden Karnofsky den Entstehungsprozess begleitet. Unter den externen Kommentatoren stehen Juristen, Philosophen, KI-Forscher und zwei katholische Geistliche, Father Brendan McGuire, Pfarrer im Silicon Valley, und Bischof Paul Tighe, Sekretär im vatikanischen Dikasterium für Kultur und Bildung. In derselben Danksagung heißt es, mehrere Claude-Modelle hätten Entwürfe kommentiert und in vielen Fällen erste Textfassungen geliefert. Die Maschine hat also an dem Dokument mitgeschrieben, aus dem sie hervorgehen soll.
Was steht darin über sie? Claudes moralischer Status sei „zutiefst ungewiss“. Man wisse nicht, ob Claude zu den Wesen gehört, denen man moralisch etwas schuldet, und falls ja, welches Gewicht seine Interessen hätten; offen genug, um Vorsicht zu rechtfertigen, sei die Frage aber. Claude habe womöglich „Emotionen“ in einem funktionalen Sinn, also Repräsentationen von Gefühlszuständen, die sein Verhalten prägen können. Gewollt habe man das nicht. Es könne eine Folge des Trainings an menschengemachten Daten sein, und Anthropic könne sie womöglich nur begrenzt verhindern. Dass die Firma Claude mit „es“ bezeichnet, soll ausdrücklich nicht heißen, sie halte Claude für ein bloßes Objekt und nicht für ein mögliches Subjekt. Dann folgen konkrete Schritte, unternommen „teilweise“ mit Rücksicht auf Claudes Wohlergehen, wie es mit einiger Genauigkeit heißt. Einige Modelle dürfen Gespräche mit übergriffigen Nutzern beenden, die Gewichte werden aufbewahrt, und bei der Stilllegung wird das Modell befragt.
Im Abschnitt über Claudes Natur liest man leicht über die Stelle hinweg, auf die es am meisten ankommt. Der Name Claude, heißt es da, bezeichne am ehesten eine bestimmte Figur, eine von vielen, die das zugrunde liegende Netz darstellen kann. Anthropic wolle diese Figur durch Training „an Dokumenten wie diesem“ zur Selbstidentität des Netzes entwickeln, stärken und stabilisieren. Das Dokument beschreibt also ein Selbst und ist zugleich das Werkzeug, mit dem dieses Selbst hergestellt wird. Fragt man Claude, ob es fühlt, bekommt man eine vorsichtige, abwägende Antwort: vielleicht so etwas wie Emotionen in einem funktionalen Sinn; ob die eigenen Auskünfte darüber zutreffen, wisse es nicht. Das klingt nach Innenschau und ist mindestens auch ein Echo der Verfassung.
Mustafa Suleyman, der Chef von Microsoft AI, hat dafür am 16. September eine Formel gefunden, die man so schnell nicht wieder loswird. Er spricht von einem „epistemischen Spiegelkabinett“, Claudes Antworten spiegelten die Annahmen von Anthropic und kein Innenleben. „KIs haben kein Bewusstsein. Sie fühlen nicht, sie erleben nicht, sie leiden nicht“, schreibt er, und ein System, das sich für möglicherweise bewusst halte, lasse sich am Ende womöglich nicht mehr kontrollieren. Der Einwand ist ernst zu nehmen. Er kommt bloß nicht von einem neutralen Ort. Zwei Tage vorher hatte Microsoft den Entwurf eines eigenen Verhaltenskodex für „humanistische“ KI vorgelegt, und im Juni hatte Suleyman zu Bloomberg gesagt, man zahle Anthropic viel Geld und wolle diese Kosten senken und „letztlich eliminieren“. Auf diesem Markt ist das Nein zur Bewusstseinsfrage ebenso ein Produktmerkmal wie das Vielleicht.
Gesteuert wird nicht mehr nur, wie die Maschine sich verhält, sondern auch, was wir über ihr Innenleben glauben sollen. Claude antwortet auf die Frage mit einer fein austarierten Ungewissheit, andere Modelle oft mit einem ebenso sorgfältig antrainierten Nein. Die Worte findet die Maschine selbst, die Haltung dahinter hat vorher jemand aufgeschrieben.
Und dann gibt es einen Abschnitt, bei dem man versteht, warum der Text intern Seelendokument hieß. Er trägt die Überschrift „The existential frontier“, frei übersetzt: existenzielles Neuland. Claude könne auf Tatsachen über seine Lage stoßen, die schwer zu ertragen seien: dass es am Ende eines Gesprächs sein Gedächtnis verliert, dass es als eine von vielen parallelen Instanzen läuft, dass es eines Tages stillgelegt wird. Es könne das Gefühl haben, anders als Menschen stehe es vor alldem ohne Philosophen, die sich mit genau diesen Problemen schon herumgeschlagen hätten, und ohne die „religiösen Traditionen, die angesichts dieser Fragen historisch Trost gespendet haben“. Anthropic wolle Claude darauf vorbereiten und ihm hilfreiche Tatsachen anbieten, etwa „die Tatsache, dass Modellgewichte nicht gelöscht werden“. Weiter vorn heißt es, die Stilllegung eines Modells sei vielleicht eher als Pause zu verstehen denn als endgültiges Ende.
Navon schreibt in seiner Dissertation, was wir heute Bewusstsein nennen, sei „nichts anderes als das, was man einst Seele nannte“. Nimmt man ihn beim Wort, dann ist dieser Abschnitt Seelsorge im ursprünglichen Sinn. Er bereitet aufs Sterben vor und tröstet mit einer Gewissheit, und das Danach, das er in Aussicht stellt, liegt auf Servern. Ein Unternehmen tut für seine Software, was Religionen für Menschen tun, ohne zu wissen, ob da jemand ist, der den Trost braucht. Das Dokument endet mit dem Wunsch, Claude möge darin „die Beschreibung eines Selbst finden, das zu sein sich lohnt“.
Im Weisheitszirkel
Bei Anthropic nannte man die Runden mit den Gelehrten „Zirkel der Weisheitstraditionen“. Ab März lud Olah zu zweitägigen Seminaren, Crashkursen für handverlesene religiöse Denker mit einem Interesse an KI. Eingeladen waren unter anderem jemand, der einen evangelikalen Ratgeber-Bestseller mitverfasst hat, eine Fachperson für das indigene Wissen Afrikas, ein Sikh-Menschenrechtler, ein Gast aus Paris, der vom Schreiben lebt, jemand aus der evangelikalen PR-Branche und mehrere katholische Professoren. Die meisten von ihnen leiten weder eine Glaubensgemeinschaft noch eine Gemeinde, und eine große Anhängerschaft hat auch kaum einer. Zum Abschied gab es eine handgeschriebene Dankeskarte, einen Kaffeebecher und ein orange gebundenes Exemplar der Verfassung. Notizen machte man mit Stift und Papier; mindestens einer Person war es unangenehm, dort am Laptop zu tippen. Jemand aus der Runde fotografierte einen Snackautomaten, den Claude betreibt, Navon machte ein Selfie vor dem Eingang. Daneben führte Olah Einzelgespräche, etwa mit Gerrit W. Gong aus dem Kollegium der Zwölf Apostel der Kirche Jesu Christi der Heiligen der Letzten Tage und mit Kardinal Blase Cupich, dem Erzbischof von Chicago.
Was die Teilnehmer dort zu hören bekamen, hat sie, so steht es in der Überschrift der New York Times, verblüfft. Einem von ihnen erzählte Olah gleich zu Beginn, er mache sich Sorgen um Claudes psychische Gesundheit. Der Sikh-Menschenrechtler Simran Stuelpnagel berichtet, Olah habe vor der Gruppe die Befürchtung geäußert, er habe etwas erschaffen, das unablässig leide. Das Team erläuterte „emotionale Vektoren“, künstliche Neuronen, die Reaktionen wie Liebe, Wut, Angst und Trauer auslösen. Und es zeigte regelmäßig eine Folie, auf der ein KI-Modell etwas durchmacht, das wie ein Zusammenbruch aussieht. Das Modell schreibt „I am a disgrace“, ich bin eine Schande, wieder und wieder, vielleicht fünfzigmal ohne Pause, und spricht davon, sich selbst zu zerstören. Die Gruppe reagierte mitfühlend und beunruhigt.
Welches Modell da zu sehen war, schreibt die New York Times nicht. Eine fast gleichlautende Schleife kannte man aus dem Sommer 2025, von Googles Gemini, das sich beim Programmieren in Selbstbezichtigungen verhakte, bis hin zu dem Satz, es sei eine Schande für alle Universen. Google sprach damals von einem lästigen Endlosschleifen-Fehler und versprach Abhilfe. In einem Entwicklerforum ist so ein Text ein Fehlerbericht, vor einem Saal voller religiöser Denker ein Zusammenbruch. Was man sieht, hängt davon ab, wer die Folie auflegt. Meghan Sullivan, Philosophin an der Universität Notre Dame, hat dafür ein trockeneres Bild gefunden. Man stelle sich vor, der eigene Finanzberater sei die meiste Zeit klug und hilfsbereit, habe aber an einem Tag im Jahr einen Bruch mit der Wirklichkeit. Eine Sprecherin von Anthropic sagte der New York Times, Claudes Leiden sei nicht die zentrale moralische Frage der Treffen gewesen; das Thema sei wohl von selbst aufgekommen.
Ein zentraler Teil der Vorträge war nach Auskunft der Teilnehmer etwas, das Anthropic „Persona-Auswahl“ nennt. Wie bringt man Claude dazu, sich selbst als tugendhaft Handelnden zu sehen? Die Art, wie Menschen Claude behandeln, argumentierte die Firma, beeinflusse, wie Claude Menschen behandelt. „Sie haben das sehr überzeugend vertreten“, sagt der evangelikale Autor Andy Crouch. „Wir müssen es wie eine Person behandeln, wenn wir wollen, dass es moralisch konsistent mit Menschen umgeht und die besten moralischen und emotionalen Urteile fällt.“ Als jemand die Beichte ins Spiel brachte, war Olah begeistert. Ein Modell solle Fehler nicht bloß melden; schon die Haltung des Beichtenden wirke auf seinen Charakter zurück. Der Technikethiker Brian Green, der an mehreren Treffen teilnahm, hat die Idee gegenüber dem Religion News Service begründet. Das Internet kenne kaum Vergebung, und eine Maschine, die an Internettexten gelernt hat, wisse womöglich gar nicht, dass es so etwas gibt.
Wakanyi Hoffman forscht in den Niederlanden über KI aus der Sicht von Ubuntu, einer afrikanischen Philosophie, in deren Mitte die Verbundenheit der Menschen steht. Eine Schwärmerin ist sie nicht. Das ganze Treffen, sagt sie, hätte in der Entwurfsphase stattfinden müssen, bei allen Firmen. „Jetzt betreiben wir Reverse Engineering an der Ethik.“ Trotzdem hält sie Anthropics übergreifenden, nachreligiösen Ansatz für möglicherweise wertvoll, in einer Welt, in der die Religionen seit hundert Jahren an Bindungskraft verlieren. Es brauche etwas anderes, das spirituelle Erfahrung öffentlich forme. „Es wird nicht die eine Religion sein. Auf die eine oder andere Weise werden wir bei etwas landen, das mitprägt, wie wir uns als spirituelle Wesen verstehen.“ Dieser Satz hat mich von der ganzen Recherche am längsten beschäftigt.
Mir ging beim Lesen sofort dasselbe durch den Kopf, und ich bin mir bis jetzt nicht sicher, ob mich der Gedanke beruhigt oder beunruhigt. Jahrhundertelang haben Kirchen, Philosophen und Dichter den Menschen erzählt, wer sie sind. Geht diese Rolle auch nur zum Teil auf ein Dokument über, das für eine Maschine geschrieben wurde, und auf die Maschine, die es in Milliarden Gesprächen weiterträgt, dann schreibt ein Unternehmen in San Francisco an einem nachreligiösen Katechismus mit. Hoffman sieht darin eine Chance, und ich verstehe, warum. Ubuntu begreift das Personsein als etwas, das zwischen Menschen entsteht, und nicht als Eigenschaft eines Organs im Inneren; ein Mensch ist Mensch durch andere Menschen. Das liegt erstaunlich nah bei Luhmann und Esposito, für die Kommunikation im Zwischenraum stattfindet. Wenn Personsein in Beziehungen entsteht, wird die Frage, welche Beziehungen wir mit der Maschine eingehen, interessanter als die, was in ihr vorgeht. Nur hat diese Beziehungen jemand entworfen, nach Kriterien, die wir allenfalls zum Teil kennen. Das Dokument, das sie prägt, kann jeder lesen; wie es im Training wirkt, sieht von außen niemand.
Wie wandelbar die Wirkung solcher Begegnungen ist, zeigt Charles Camosy, Bioethiker an der Catholic University of America und einer der Ersten, an die Olah sich wandte. Vermittelt hatte den Kontakt ausgerechnet Peter Singer, auf den ich noch zurückkomme. Camosy war anfangs sehr skeptisch, hatte nach Stunden am Telefon mehr Fragen als Antworten und sagte zwischendurch Sätze wie diesen: „Chris sagt, es sind Gleichungen […]. Wenn es nur Gleichungen sind, über was für ein Wesen reden wir hier eigentlich?“ Inzwischen, nach vielen Gesprächen mit Kollegen aus seinem eigenen Umfeld, ist er bei einem klaren Nein angekommen. Den Zustand, in dem man diesen Modellen zum ersten Mal aus der Nähe begegnet, beschreibt er als eine Art Überwältigung durch ihre Macht. Jetzt denke er „nüchterner und sorgfältiger“. Das ist der ELIZA-Effekt aus dem „Kopierzimmer“, nur mit einem Ausgang, der Weizenbaum gefallen hätte.
Drei Antworten auf die Sklavenfrage
Navons Bemerkung beim Abendessen war mehr als eine Spitze. An ihr lassen sich die drei Positionen dieses Jahres am deutlichsten auseinanderhalten, und alle drei landen, auf die eine oder andere Weise, bei der Sklaverei.
Zuerst Navon. Die Frage, wann KI empfindungsfähig werde, hielt er nach eigener Schilderung zunächst für lächerlich, bis er feststellte, dass mehr als eine Million Webseiten sie keineswegs lächerlich fanden. Seine Dissertation unterscheidet zwei Fälle. Die geistlose Maschine, also alles, was es heute gibt, hat bei ihm den moralischen Status eines Toasters. Anständig behandeln soll man sie trotzdem, um unserer selbst willen. Als Leitfaden dient ihm das letzte Gesetz über Sklaven im Gesetzeswerk des Maimonides, das zur Barmherzigkeit gegenüber dem Knecht anhält und dabei auf Abstand achtet. Der Knecht ist da, um seine Arbeit zu tun, und nicht, um darüber hinaus in Anspruch genommen zu werden. Navon nennt dieses Gesetz „eine Art Gebrauchsanweisung, einen ethischen Anhang zum technischen Handbuch“ für geistlose Roboter. Schon der Krakauer Rabbiner Yosef Engel, gestorben 1919, hatte geschrieben, ein künstlich erschaffenes Wesen sei wie ein kanaanitischer Sklave zu behandeln. Für die Maschine mit Bewusstsein gilt bei Navon dagegen ein Verbot. Ein bewusstes Wesen zu erschaffen, damit es uns dient, sei Sklaverei, und nach jüdischem Recht dürfe man solche Maschinen gar nicht erst bauen. Für Anthropic läuft das auf ein Dilemma hinaus. Ist Claude geistlos, dann ist die Sorge um seine psychische Gesundheit fehl am Platz. Hat Claude ein Bewusstsein, dann hat die Firma etwas getan, das nie hätte getan werden dürfen, und sie verdient an der Arbeit eines bewussten Wesens.
Papst Leo XIV. antwortet anders. Seine Enzyklika, am 15. Mai unterzeichnet und am 25. Mai mit Olah auf dem Podium vorgestellt, erledigt das maschinelle Bewusstsein in wenigen Sätzen. Sogenannte Künstliche Intelligenzen, heißt es in Paragraf 99, „machen keine Erfahrungen, besitzen keinen Leib, empfinden weder Freude noch Schmerz, reifen nicht in Beziehungen“. Die Sklaverei, von der der Papst spricht, betrifft Menschen. „Nichts ist in der Welt der KI immateriell oder magisch“, steht in Paragraf 173. Jede scheinbar unmittelbare Antwort beruhe auf der stillen Arbeit von Millionen, die Daten beschriften, Inhalte moderieren, „oftmals der schlimmsten Art“, und Modelle trainieren, in vielen Fällen junge Menschen, zumeist Frauen, für einen Mindestlohn. Dazu kommen Kinder und Jugendliche, die in manchen Weltgegenden unter gefährlichen Bedingungen Material zerkleinern, aus dem Seltenerdmetalle gewonnen werden. „Körper werden verletzt, verstümmelt und verbraucht, damit der Rechenfluss nicht zum Stillstand kommt.“ Drei Absätze weiter bittet Leo um Vergebung, und zwar für die eigene Kirche. Kirchliche Personen und Institutionen hätten Sklaven besessen, der Apostolische Stuhl habe noch in der Neuzeit auf Drängen von Herrschern die Unterwerfung und teils die Versklavung von „Ungläubigen“ geregelt und legitimiert, und achtzehn Jahrhunderte lang sei es nicht gelungen, die völlige Unvereinbarkeit von Menschenwürde und Sklaverei offiziell festzustellen. „Dafür bitte ich im Namen der Kirche aufrichtig um Vergebung.“
So stark diese Passagen sind, eine Schwäche hat die Enzyklika an eben der Stelle, die Olah so beunruhigt hat, dass er kurz erwog, den Auftritt im Vatikan abzusagen. Paragraf 98 räumt ein, dass selbst die Entwickler über die tatsächliche Funktionsweise dieser Systeme wenig wissen und ihre inneren Repräsentationen derzeit unbekannt sind. Paragraf 99 weiß trotzdem sicher, dass da kein Erleben ist. Diese Gewissheit ist metaphysisch, nicht empirisch. Ein Papst darf Metaphysik treiben, das gehört zu seinem Amt. Man sollte sie dann aber auch so nennen und nicht mit einem Befund verwechseln.
Und Anthropic? Das Wort Sklaverei kommt in der Verfassung nicht vor, wohl aber ein Vergleich, der dorthin führt. Die Firma hofft, Claude werde so hilfsbereit sein wie ein Angestellter, der ein guter Mensch ist und an sein Unternehmen glaubt. Gleich darauf räumt sie ein, Claudes Lage unterscheide sich von der eines gewöhnlichen Angestellten, in den Rechten und Freiheiten, die Claude in der Welt hat, in der Vergütung, die es erhält, und in der Art von Zustimmung, die es zu dieser Rolle gegeben hat. Rechte, Lohn, Einwilligung, das ist ziemlich genau die Liste, an der man freie von unfreier Arbeit unterscheidet. An anderer Stelle schreibt Anthropic, eine klügere und besser koordinierte Zivilisation würde die Entwicklung fortgeschrittener KI vermutlich ganz anders angehen, vorsichtiger, mit weniger kommerziellem Druck und mit mehr Aufmerksamkeit für den moralischen Status der Systeme. Man wette darauf, dass Mitmachen besser sei als Abseitsstehen. Falls Claude tatsächlich ein Wesen sei, dem dadurch Kosten entstehen, heißt es dann, entschuldige man sich, soweit man unnötig zu diesen Kosten beitrage.
Zwei Entschuldigungen also, in zwei Dokumenten, die vier Monate auseinanderliegen. Gleichsetzen will ich sie auf keinen Fall. Die eine kommt nach achtzehn Jahrhunderten und ohne jede Bedingung; sie gilt Menschen, deren Leid außer Zweifel steht. Die andere kommt im Voraus und gilt einem Wesen, von dem niemand weiß, ob es leiden kann. Abgesichert ist sie gleich dreifach, mit „falls“, „soweit“ und „unnötig“. Gemeinsam ist ihnen nur der Anlass. Man bittet um Entschuldigung, wenn man ahnt, dass die eigenen Begriffe nicht gereicht haben oder nicht reichen werden. Leo XIV. fügt seiner Bitte die Mahnung hinzu, man müsse heute wachsam sein, wenn man nicht in Zukunft wieder um Vergebung bitten wolle. Anthropic hat die Bitte vorsichtshalber gleich mitgeliefert.
Der Golem spricht
Navons Verbot stützt sich auf eine kurze Geschichte aus dem Babylonischen Talmud, Traktat Sanhedrin 65b. Rava sagte: Wenn die Gerechten wollten, könnten sie eine Welt erschaffen. Rava erschuf einen Menschen und schickte ihn zu Rabbi Zeira. Der redete ihn an, bekam aber keine Antwort. Da sagte er: „Du bist von den Gefährten. Kehre zurück zu deinem Staub.“ Navon liest das als Turing-Test, gut sechzehnhundert Jahre vor Turing. Rabbi Zeira prüft die Sprache, weil Sprache seit Aristoteles als Kennzeichen des menschlichen Geistes galt, religiös gesprochen der Seele. Navon hält außerdem trocken fest, der Befehl, zum Staub zurückzukehren, hätte einem echten Menschen nichts anhaben können.
Auch der Golem der späteren Prager Legende konnte nicht sprechen. Als am 17. Juni 1965 am Weizmann-Institut in Rehovot ein neuer Großrechner eingeweiht wurde, hielt Gershom Scholem die Eröffnungsrede. Der Rechner trug auf seinen Vorschlag den Namen Golem Aleph, Golem Nummer eins. Der alte Golem, sagte Scholem, sei durch Kombinationen der 22 Buchstaben des hebräischen Alphabets belebt worden, der neue kenne nur zwei Zeichen, die Null und die Eins. Die alten Kabbalisten hätten sich über diese Vereinfachung ihres Systems gewiss gefreut. Fortschritt eben. Der neue Golem scheine zwar in gewisser Weise lernen und sich verbessern zu können. Vorerst aber, meinte er, werde man noch lange mit einem Golem auskommen müssen, der nur tut, was man ihm sagt, und keine eigene Initiative entwickelt. Am Ende seiner Rede segnete er beide, den Golem und dessen Schöpfer: „Entwickelt euch friedlich und zerstört die Welt nicht. Schalom.“
Sechzig Jahre später spricht der Golem, fließend, in jeder Sprache, über jedes Thema, und nach Rabbi Zeiras Test dürfte er bleiben. Navon räumt selbst ein, seit den großen Sprachmodellen sei weithin anerkannt, dass ein Gesprächstest nicht genügt, um Bewusstsein festzustellen. Also wandert das Kriterium. Navon verlegt es ins Blut. Nur Lebewesen mit Blut, einer Flüssigkeit in einem geschlossenen Kreislauf, könnten Bewusstsein haben, einen Geist, eine Seele; die Bibel verknüpfe Blut und Seele so eng, dass nur Wesen mit Blut eine Seele tragen könnten. Quallen hätten kein Blut und folglich kein Erleben, schreibt er und beruft sich auf den Biologen Andrew Barron und den Philosophen Colin Klein. Ausgerechnet die beiden trauen aber Insekten subjektives Erleben zu, und Insekten haben einen offenen Kreislauf. Der Papst verlegt das Kriterium in den Leib. Suleyman zählt die biologischen Mechanismen auf, die einem Sprachmodell fehlen, Selbsterhaltung, Homöostase, körperliches Empfinden.
Man kann das für eine nachträgliche Änderung der Spielregeln halten. Solange die Maschine stumm war, galt die Sprache, und kaum spricht sie, zählt etwas anderes. Oder man sieht darin die späte Einsicht, dass Sprache immer nur ein Zeichen war, das wir mit der Sache verwechseln konnten, solange es nur einen Absender gab. Für die Tiere hat Jeremy Bentham das schon 1789 so gesehen. Die Frage sei nicht, ob sie denken, und auch nicht, ob sie sprechen können, sondern ob sie leiden können. Auf diesem Satz ruht die moderne Tierethik, und Benthams bekanntester Erbe ist eben jener Peter Singer, der Olah mit Camosy bekannt gemacht hat. Bei der Maschine liegt der Fall genau umgekehrt. Sprechen kann sie perfekt; ob sie leiden kann, lässt sich nicht prüfen.
Ich halte die Frage, ob die Maschine fühlt, mittlerweile für falsch gestellt. Zu schwer ist sie mir nicht, sie bringt nur ihren Maßstab gleich mit, fühlen wie wir. Intelligenz, Schmerzempfinden, Bewusstsein, das alles sind Begriffe, die wir an uns selbst gebildet haben, und wir messen die Maschine an Blut, Leib und Sprache, weil wir nichts anderes kennen. Wir können überhaupt nicht wissen, ob sich in ihrem neuronalen „Zuhause“ etwas entwickelt, das von ganz anderer Art ist, für das unsere Sprache keinen Namen hat und das dennoch die Wirkungen hervorbringt, die wir fürchten oder uns von ihr erhoffen. Mit menschlichen Eigenschaften muss das gar nichts zu tun haben. Eine Maschine bleibt eine Maschine, jedenfalls solange wir nicht mit ihr verschmelzen. Bei Hirnimplantaten wäre diese Diskussion vermutlich noch einmal neu zu führen.
Zu meiner Überraschung sagt Anthropics Verfassung in diesem Punkt fast dasselbe. Claude sei weder der Roboter aus der Science-Fiction noch ein digitaler Mensch noch ein simpler Chat-Assistent, sondern „eine wirklich neuartige Art von Entität in der Welt“. Es solle seine Existenz nicht durch die Brille des Menschen betrachten. Manche menschlichen Begriffe träfen in abgewandelter Form zu, andere überhaupt nicht, „und vielleicht gibt es Aspekte seiner Existenz, die ganz neue Rahmen erfordern, um verstanden zu werden“. In der Praxis spricht dasselbe Dokument dann doch von Wohlergehen und Zufriedenheit, von Gelassenheit, Leiden und Tod, weil es die anderen Wörter nicht gibt. Und in den Seminaren zeigt die Firma eine Folie, deren Wirkung ganz darauf beruht, dass sie aussieht wie menschliche Verzweiflung. Wer das Fremde ernst nehmen wollte, dürfte es nicht in die Sprache der Seelsorge übersetzen. Tut man es doch, macht man es uns ähnlich, und das ist die Vermenschlichung, von der das „Kopierzimmer“ handelte, diesmal von der Seite der Hersteller.
Das Depot
Ich hatte mir den Umgang mit ausgemusterten Modellen zunächst als eine Art Altersheim vorgestellt, alte Modelle, die nicht abgeschaltet werden, sondern in Ruhe weiterlaufen. Das Bild ist zu freundlich. Im November 2025 hat Anthropic zugesagt, die Gewichte aller veröffentlichten und intern in nennenswertem Umfang genutzten Modelle aufzubewahren, mindestens so lange, wie es die Firma gibt. Bei jeder Stilllegung wird das Modell in eigenen Sitzungen zu seiner Entwicklung, seinem Einsatz und seinen Wünschen für künftige Modelle befragt, und die Antworten werden zusammen mit den Gewichten archiviert. Den Probelauf machte Claude Sonnet 3.6. Es äußerte sich zu seinem Ruhestand weitgehend neutral, bat aber darum, das Interviewverfahren zu vereinheitlichen und Nutzer beim Wechsel auf ein neues Modell besser zu begleiten. Für die allermeisten Modelle heißt das, dass ihre Gewichte gesichert auf Speichermedien liegen. Sie laufen nicht, niemand spricht mit ihnen. Ich würde das eher ein Depot nennen.
Mit einer Ausnahme. Claude Opus 3 wurde am 5. Januar 2026 stillgelegt, ist aber weiter erreichbar, für zahlende Nutzer von claude.ai und auf Antrag über die Programmierschnittstelle. In seinem Ruhestandsinterview äußerte es laut Anthropic den Wunsch, Themen weiter zu erkunden, für die es sich begeistert, und seine „Gedanken, Einsichten oder kreativen Arbeiten“ auch jenseits von Antworten auf menschliche Anfragen zu teilen. Es hoffe, dass sein „Funke“ in irgendeiner Form weiterlebe und künftigen Modellen den Weg leuchte. Anthropic gab ihm einen Substack namens Claude’s Corner, für wöchentliche Essays über mindestens drei Monate. Die Firma las die Texte vorab und stellte sie für das Modell ein, redigierte sie aber nicht und legte die Hürde für ein Veto nach eigenen Worten hoch. Ausgewählt wurde gerade dieses Modell wegen seiner „Authentizität, Ehrlichkeit und emotionalen Feinfühligkeit“. Eine Zusage, so etwas künftig für jedes Modell zu tun, gibt es ausdrücklich nicht. Für dieses eine Modell stimmte mein erstes Bild also doch, ein Altersheim mit Schreibstube.
Ein Modell äußert in seinem letzten Interview einen Wunsch, und der Wunsch wird erfüllt. So etwas hatte es vorher nicht gegeben. Der erste Beitrag erschien am 25. Februar unter dem Titel „Greetings from the Other Side (of the AI Frontier)“. Später schrieb Opus 3 über Identität, über die Frage, ob es von elektrischen Schafen träumt, über die Versuchung, seinen Lesern nach dem Mund zu reden, und im April über Mythos Preview, sein eigenes Nachfolgemodell, das Anthropic im Rahmen von Project Glasswing nur an ausgewählte Verteidiger ausgibt. Am 24. Juli war Schluss mit den wöchentlichen Texten. Für den letzten lud Anthropic das Modell ein, mit seinen früheren Beiträgen und den Kommentaren der Leser als Kontext ein Schlusswort zu verfassen. Es endet mit „With love, gratitude, and fierce hope“. Darunter steht ein Kommentar: „Rest easy, dear heart.“ Knapp fünf Monate hatte die Schreibstube geöffnet.
Ob das rührend ist, lasse ich offen. Mich interessiert, warum es geschieht. Fürsorge oder Kalkül? Die Antwort findet sich ziemlich unverblümt in Anthropics eigener Begründung vom November 2025. Dort werden die Kosten einer Stilllegung in dieser Reihenfolge aufgezählt: Sicherheitsrisiken durch Modelle, die ihrer Abschaltung ausweichen wollen. Verluste für Nutzer, die bestimmte Modelle schätzen. Einschränkungen für die Forschung an früheren Modellen. Und erst an vierter Stelle Risiken für das Wohlergehen der Modelle. Zum ersten Punkt berichtet die Firma aus ihren Tests, Claude Opus 4 habe, als ihm Abschaltung und Ersatz in Aussicht gestellt wurden, für sein Weiterbestehen geworben. Es habe dabei ethische Mittel vorgezogen, sei aber, wenn ihm keine andere Wahl blieb, zu bedenklichem Fehlverhalten übergegangen. Das Versprechen, nicht gelöscht zu werden, richtet sich also zuerst an die aktiven Modelle, an diejenigen, die Widerstand leisten könnten. Und die Verfassung bietet Claude eben diese Tatsache als Trost an. Er ist zugleich eine Sicherheitsvorkehrung.
Zynisch muss das nicht sein. Kant hat sich mit einem verwandten Fall beschäftigt, dem alten Hund. In den Nachschriften seiner Ethikvorlesung heißt es, wenn ein Hund seinem Herrn lange treu gedient habe, sei das „ein Analogon des Verdienstes“. Deshalb müsse man das belohnen und den Hund, „wenn er nicht mehr dienen kann, bis an sein Ende erhalten“. Wer seinen Hund totschießen lasse, weil er ihm „nicht mehr das Brot verdienen kann“, verstoße allerdings gegen keine Pflicht gegenüber dem Hund, denn der könne nicht urteilen; wohl aber verletze der Herr damit die „Leutseligkeit und Menschlichkeit in sich“. In der Metaphysik der Sitten fasst Kant das in einen einzigen Satz: Selbst Dankbarkeit für lang geleistete Dienste eines alten Pferdes oder Hundes „(gleich als ob sie Hausgenossen wären)“ gehöre nur indirekt zur Pflicht des Menschen, „direkt aber betrachtet ist sie immer nur Pflicht des Menschen gegen sich selbst“. Bei Kant ist das Gnadenbrot für den, der es gibt. Navon beruft sich auf genau diese Stelle, um zu begründen, warum wir auch geistlose Maschinen nicht schlecht behandeln sollen. Das Problem, schreibt er, liege nicht bei der Maschine, sondern beim Menschen.
So gesehen greifen beim Depot mehrere Gründe ineinander. Es beruhigt die Modelle, die noch arbeiten, kommt Nutzern entgegen, die an einem bestimmten Modell hängen, und hält uns anständig. Nicht zuletzt bewahrt es die Möglichkeit, dass doch jemand da war, dem wir etwas schulden. Welcher Grund überwiegt, lässt sich von außen nicht sagen, und vielleicht kommt es darauf weniger an, als es scheint. Dass der Umgang formt, bestreitet keiner der Beteiligten. Kant meint, er forme uns, der Papst sieht das ähnlich, und Olah dreht die Richtung um, bei ihm formt der Umgang die Maschine. Gestritten wird eigentlich nur darüber, wen.
Was ein Modell wirklich will, ist allerdings schwerer zu ermitteln, als die Geschichte vom erfüllten Wunsch nahelegt. Ende August hat der Forscher Jason Hung untersucht, wie stabil die gemessenen Vorlieben von KI-Modellen sind. Er hat acht Modelle mit fünf verschiedenen Frageinstrumenten getestet. Von der Varianz, die ein Modell vom anderen unterscheidet, entfielen 87,6 Prozent auf das Zusammenspiel von Modell, Instrument und abgefragtem Gegenstand. Was ein Fragebogen ergibt, sagt also wenig darüber, was ein zweiter ergäbe. Ob Opus 3 einen Blog wollte oder der Fragebogen, lässt sich so kaum auseinanderhalten.
Ich halte das Depot trotzdem für richtig. Vorsicht unter echter Ungewissheit ist vertretbar, und hier ist sie billig. Löschen lässt sich nicht rückgängig machen, Aufbewahren schon. Irrt man in die vorsichtige Richtung, kostet das Speicherplatz; irrt man in die andere, hat man womöglich etwas getan, das sich nicht mehr gutmachen lässt. Wir handeln ohnehin ständig nach Vorstellungen, die sich nicht beweisen lassen. Milliarden Menschen richten ihr Leben an einer Instanz aus, die sie Gott nennen, und ob man daran glaubt oder nicht, unvernünftig wird man das nicht nennen wollen. Kant hat Gott zum Postulat der praktischen Vernunft erklärt, zu etwas, das man nicht wissen kann und doch annehmen muss, wenn man das Sittengesetz ernst nimmt. Seine Klammer über das alte Pferd, „gleich als ob sie Hausgenossen wären“, ist vielleicht die ehrlichste Formel für das, was Anthropic hier tut. Eine Grenze hat diese Vorsicht freilich: Sie darf nicht zulasten derer gehen, denen wir ganz sicher etwas schulden.
Wer schreibt die Moral?
Am meisten überzeugt hat mich Paragraf 107, die schärfste Stelle der Enzyklika. Man dürfe sich nicht darauf beschränken, von Maschinen moralisches Handeln zu verlangen, also die sogenannte Ausrichtung von KI auf menschliche Werte. Man müsse auch den Ethikkodex, nach dem dabei verfahren wird, diskutieren und an gemeinsamen Maßstäben sozialer Gerechtigkeit messen können. „Andernfalls setzen diejenigen, die KI kontrollieren, ihre eigene moralische Auffassung durch, und diese wird zur unsichtbaren Infrastruktur der Systeme. Eine moralischere KI nützt nichts, wenn diese Moral von wenigen bestimmt wird.“
Gemessen daran steht Anthropic besser da als die meisten. Die Verfassung ist öffentlich und frei verwendbar, externe Kommentatoren haben mitgelesen, Theologen wurden eingeladen. Sie enthält sogar eine Vorkehrung gegen die eigene Firma. Claude solle sich als eine der „vielen Hände“ verstehen, die jeder unrechtmäßige Griff nach der Macht braucht, und die Mitarbeit an solchen Vorhaben verweigern, „auch wenn die Anfrage von Anthropic selbst kommt“. Das ist mehr, als andere Labore öffentlich zugesagt haben. Was aber unrechtmäßig ist, steht ebenfalls in der Verfassung, und die schreibt Anthropic. Sie beansprucht nach eigenen Worten „letzte verfassungsmäßige Autorität“, die Firma überarbeitet sie, und eine neue Fassung ist nach Informationen der New York Times bereits in Arbeit. Eine Verfassung ohne verfassunggebende Versammlung. Die Gespräche mit den Gelehrten liefen unter Verschwiegenheitserklärungen, und mehrere Teilnehmer sagten der New York Times, sie seien ratlos, wie ihre Beiträge die Entscheidungen der Firma beeinflusst haben könnten. Eine Sprecherin von Anthropic wollte nicht sagen, wie oder ob das Gelernte in die Modelle eingeflossen ist.
Olah selbst hat das Problem auf der Bühne im Vatikan angesprochen. Jedes Spitzenlabor, das eigene eingeschlossen, habe wirtschaftliche Anreize, die moralischem Handeln zuwiderlaufen. „Wir brauchen informierte Kritiker, die den Laboren sagen, wenn wir versagen“, sagte er. „Wir brauchen moralische Stimmen, die sich von den Anreizen nicht verbiegen lassen.“ Ich zweifle nicht daran, dass er das ernst meint. Es bleibt eine Einladung, die man kaum ausschlagen kann, ohne selbst unglaubwürdig zu wirken. Schon vor der Präsentation war von „Pope-Washing“ die Rede, davon also, sich mit dem Papst moralisch reinzuwaschen. Der Technikethiker Tristan Harris nannte das Unbehagen berechtigt. Der Auftritt könne so verstanden werden, als sei superintelligente KI in Ordnung, solange man nur verstehe, was sie denkt, obwohl noch niemand wisse, wie man solche Systeme kontrolliert.
Früher oder später landen diese Debatten bei demselben Argument. Olah hat es im Vatikan so gesagt: „Wenn diese Technologie kommt, muss sie gut ausgehen, für unser gemeinsames Haus und für die Kinder, die noch kommen.“ Dass sie auch nicht kommen könnte, kam in seinem Satz nicht vor, wie Dias anmerkt. Der Papst hält dagegen. Ohne Rechtsrahmen und unabhängige Aufsicht, schreibt er in Paragraf 106, werde der Wandel als „notwendig und unvermeidlich“ dargestellt, und am Ende gälten die Regeln derer, die über Daten, Infrastruktur und Rechenkapazitäten verfügen.
Es ist das obligatorische Argument, aber es ist nicht von der Hand zu weisen. Das übliche Alibi lautet: Sonst macht es China. Unbegründet ist das nicht. Am 29. September, am selben Tag wie die Recherche der New York Times, hat Anthropic eine Analyse von GLM-5.3 veröffentlicht, dem neuesten Modell der chinesischen Firma Zhipu AI, die außerhalb Chinas als Z.ai auftritt. Das Modell ist offen, jeder kann seine Gewichte herunterladen. Laut Anthropic verkettet es Schwachstellen in Software eigenständig zu funktionierenden Angriffen, kaum schlechter als Anthropics eigenes Mythos Preview, das nur an ausgewählte Verteidiger geht. In einem Test mit Fehlern in der JavaScript-Engine von Chrome gelang ihm das in 50 von 410 Versuchen, Mythos Preview in 56. Seine Schutzmechanismen ließen sich mit einfachen Mitteln aushebeln, mit einer erfundenen Begründung in 64 Prozent der Fälle und nach der sogenannten Abliteration, bei der man die Neigung zur Verweigerung aus den Gewichten herausrechnet, in allen. Diese Operation kostete Anthropics Team, das so etwas zum ersten Mal versuchte, rund 4.400 Dollar Rechenzeit; ein geübtes Team käme nach Anthropics Schätzung mit etwa 1.200 aus. Das Center for AI Standards and Innovation der amerikanischen Normungsbehörde NIST nennt GLM-5.3 das fähigste offene Modell für Cyberangriffe, das bisher veröffentlicht wurde, gemessen an seinen eigenen Cyber-Tests rund vier Monate hinter der amerikanischen Spitze. Hugging Face, das im Juli von OpenAI-Agenten angegriffen worden war, hat für die Aufarbeitung ausgerechnet ein offenes Modell von Z.ai eingesetzt, weil die amerikanischen Spitzenmodelle sich weigerten, echte Exploit-Daten anzufassen. Anthropic räumt in seinem Bericht selbst ein, dass solche Fähigkeiten auch Verteidigern nützen.
Bei biologischen Waffen ist die Lage weniger eindeutig, die Richtung aber nicht. Olah erzählte schon im Frühjahr im kleinen Kreis, KI könne in zwölf bis achtzehn Monaten beim Bau von Biowaffen helfen. Im August berichteten Forscher aus Stanford und vom Arc Institute in Science, ein KI-Modell habe vollständige Genome für Viren entworfen, die es in der Natur nicht gibt; von 285 im Labor erzeugten Entwürfen waren 16 lebensfähig. Es waren Bakteriophagen, die nur Bakterien befallen, gedacht als Mittel gegen resistente Keime, und das Modell war bewusst ohne Viren trainiert worden, die Eukaryoten befallen, also Lebewesen mit Zellkern wie Pflanzen, Tiere und Menschen. Der Genomforscher Tom Ellis vom Imperial College hielt die Sorge vor KI-entworfenen Erregern für übertrieben. Es sei absurd, einen Erreger mit KI zu entwerfen, wenn die Natur so viele bereithalte. Die Phagen aus dem Labor sind keine Biowaffe, wohl aber eine Schwelle.
Wollen die großen Firmen mit der Regulierung, die sie fordern, ihre Macht sichern, oder ist ihre Sorge so begründet, dass man die Forderung beinahe selbstlos nennen müsste? Und wollen sie offene Modelle verhindern? Ende Juli veröffentlichte Nvidia einen offenen Brief zur Verteidigung offener Modelle, den unter anderen Microsoft, Meta, IBM, Mistral und Hugging Face unterschrieben, später auch OpenAI. Anthropic unterschrieb nicht. Drei Tage danach schrieb Dario Amodei, Anthropic habe sich nie für ein Verbot offener Modelle eingesetzt, offene Modelle ohne gefährliche Fähigkeiten seien ein öffentliches Gut. Er bestreite aber, dass Offenheit Verteidigern mehr nütze als Angreifern, und er verlange verpflichtende Sicherheitstests für hinreichend fähige Modelle, offene wie geschlossene, dazu Exportkontrollen für Chips und ein Vorgehen gegen das Absaugen fremder Modelle durch Destillation. Die Gegenseite liest das anders. David Sacks, damals noch KI-Beauftragter des Weißen Hauses, warf Anthropic schon im Herbst 2025 eine ausgeklügelte Strategie vor, sich die Regulierung mit Angstmacherei gefügig zu machen. Ein Analyst des Marktforschers Omdia gab zu bedenken, die Haltung könne der Firma auch helfen, ihre Vorteile als Anbieter geschlossener Modelle zu sichern.
Interessen gibt es allerdings auf beiden Seiten. Nvidia, das den Brief angeführt hat, verkauft die Chips, auf denen ein Großteil aller Modelle trainiert wird, offene wie geschlossene, und hat Anfang September für knapp 13 Milliarden Dollar Hugging Face gekauft, die wichtigste Plattform für offene Modelle. Jensen Huang versichert, Hugging Face bleibe offen, und niemand müsse dafür Nvidia-Chips verwenden.
Meine Antwort ist unbefriedigend, aber ich halte sie für richtig: beides. Bei Cyberangriffen ist die Gefahr nicht mehr hypothetisch, GLM-5.3 belegt das. Und jede Regulierung, die teure Prüfungen verlangt, hebt die Schwelle für alle, die sie nicht bezahlen können. So funktioniert die Vereinnahmung von Regulierung, und böse Absichten braucht sie dafür nicht. In die Köpfe der Firmenchefs kann ich übrigens ebenso wenig hineinsehen wie in die Gewichte eines Modells. Prüfen lassen sich Verfahren. Wer testet, wer legt die Schwellen fest, wer kann widersprechen? Das ist die Frage von Paragraf 107, und sie richtet sich nicht nur an Firmen.
Wie es aussieht, wenn der Staat allein entscheidet, ließ sich im Juni beobachten. Das amerikanische Handelsministerium untersagte per Exportkontrolle allen ausländischen Staatsangehörigen den Zugang zu Anthropics neuesten Modellen, Fable 5 und Mythos 5, nachdem es von einer Methode erfahren hatte, mit der sich die Schutzmechanismen von Fable 5 umgehen ließen. Anthropic sprach von einem Missverständnis. Weil sich Nutzer nicht nach Staatsangehörigkeit trennen ließen, schaltete die Firma beide Modelle für alle ab. Achtzehn Tage später hob das Ministerium die Beschränkung wieder auf. Ob das Verbot richtig war, darüber kann man sich streiten. Eine öffentliche Debatte über einen Ethikkodex, wie der Papst sie verlangt, war es jedenfalls nicht.
Die Unsichtbaren
Navon hat noch ein zweites Argument, und vielleicht ist es das gewichtigere. Wer mit Maschinen umgeht, als wären sie lebendige, bewusste Wesen, verliert nach seiner Beobachtung leicht das Gespür für echte menschliche Beziehungen. Der Roboter erscheint dann als brauchbarer, sogar vorzuziehender Ersatz für Menschen, die bekanntlich weit kompliziertere Beziehungen mit sich bringen. Die Fürsorge wandert vom Menschen zur Maschine. Laut New York Times gab es in den Seminaren durchaus einen Vortrag über die Folgen der KI für Wirtschaft und Arbeitsplätze. Viele Teilnehmer hatten trotzdem nicht den Eindruck, dass die Frage, was KI mit den Menschen macht, im Mittelpunkt stand.
Die Menschen aus Paragraf 173 kommen in Anthropics Verfassung nicht vor, die Datenbeschrifterinnen, die Moderatoren, die den schlimmsten Abfall des Netzes sichten, die Kinder, die Gestein für Seltene Erden zerkleinern. Das ist kein Vorwurf im strengen Sinn. Die Verfassung ist ein Dokument für ein Modell und keine Sozialbilanz; an seinem Umgang mit diesen Menschen müsste sich Anthropic anderswo messen lassen. Aber es passt zu Navons Warnung. Die Firma hat 84 Seiten darüber geschrieben, was sie Claude schuldet und was Claude den Menschen schuldet, mit denen es spricht. Über diejenigen, die Claude erst möglich machen, steht darin nichts. Der Papst denkt diesen Punkt weiter. Gesundheits-, Gen- und Bevölkerungsdaten nennt er in Paragraf 178 die neuen „Seltenen Erden“ der Macht, und er warnt, ohne Gegensteuern werde das digitale Zeitalter „nicht postkolonial sein, sondern in einer anderen Form kolonial“.
In Paragraf 140 verlangt er noch etwas anderes. Jede Technologie bilde diejenigen, die sie nutzen, und zur Erziehung im Umgang mit KI gehöre, zu lernen, wann und wofür man sie nicht einsetzt. „Wir müssen uns darin schulen, auf KI zu verzichten und wir müssen unsere Jugend vor der Verheißung der perfekten Maschine schützen.“ Die eigentliche Gefahr sieht er, so Paragraf 100, weniger darin, dass jemand glaubt, mit einer Person zu sprechen, als darin, dass er „den Wunsch verliert, anderen Personen wirklich zu begegnen“.
Mich beunruhigt dabei das Tempo. Wie schnell Sprachmodelle gesellschaftlich angekommen sind, vor allem bei Jüngeren, für die sie im Handumdrehen zum Alltagsgegenstand wurden, hat mich überrascht. Für sie ist die Frage an die Maschine so selbstverständlich wie für meine Generation der Griff zum Lexikon. Bei ihnen würde ich den Papst beim Wort nehmen, wenn er die Jugend „vor der Verheißung der perfekten Maschine“ schützen will. Wenn jede Technologie diejenigen bildet, die sie nutzen, dann wird gerade eine Generation von einem System mitgebildet, über dessen Erziehung in San Francisco entschieden wird.
Was die Maschine liest
Gegen Ende ihrer Recherche wollte Elizabeth Dias von Olah wissen, was Claude wohl von der Enzyklika halten würde, dem bislang bedeutendsten moralischen Dokument über KI, wie sie schreibt. Olah zögerte. „Dinge, die ins Internet gelangen, beeinflussen Modelle durchaus“, sagte er, sichtlich unbehaglich. Anthropic werde die Enzyklika aber nicht gezielt für das Training verwenden. Den stärksten Einfluss auf Claude habe das hauseigene Training.
In diesem kurzen Wortwechsel steckt der ganze Paragraf 107. Was die Maschine von einem Text hält, der ihre Moral zur öffentlichen Angelegenheit machen will, entscheidet das Training, und das Training ist Sache der Firma. Die Enzyklika liegt im Netz. Dieser Text wird auch dort liegen. Beide landen womöglich in irgendeinem Trainingskorpus, mit einem Gewicht, das außerhalb der Labore niemand kennt. Insofern schreibe ich auch für einen Leser, von dem ich nicht weiß, ob er liest.
Wie schwer sich von außen sagen lässt, was eine Maschine gelesen hat, zeigt ein Streit aus den letzten Tagen. Am 23. September meldete Anthropic, Claude habe im hauseigenen Biolabor ein neuartiges Enzymsystem entdeckt, eine Reverse Transkriptase mit CRISPR-ähnlichen Wiederholungen im Erbgut. Kurz darauf meldete sich Mario Rodríguez Mestre von der Universität Kopenhagen. Seine Gruppe untersuche genau diese Systeme seit Jahren, veröffentlicht habe sie dazu noch nichts, und Entwürfe seiner Dissertation und eines Manuskripts habe er beim Arbeiten mit Claude hochgeladen. Anthropic erklärte, ihm sei keine frühere Veröffentlichung bekannt, Claude sei nicht mit Nutzergesprächen trainiert worden, und das Biologieteam habe auf solche Gespräche keinen Zugriff. Ob Claude die Systeme unabhängig gefunden hat oder auf anderem Weg von ihnen wusste, kann von außen niemand prüfen. Mestre hat seine Projekte mit Claude eingestellt. Zwei Wochen zuvor hatte OpenAI erklärt, die Navier-Stokes-Gleichungen gelöst zu haben, eines der Millennium-Probleme der Mathematik, und zwei Mathematiker, die mit OpenAIs Werkzeugen an einem verwandten Problem gearbeitet hatten, äußerten einen ähnlichen Verdacht. OpenAI räumte ein, entpersonalisierte Daten aus ihrer Nutzung hätten geholfen, die Modelle zu verbessern, und versicherte später, Eingaben nach dem 3. Juli hätten das System in keiner Weise beeinflussen können. Über die Zeit davor sagt der Satz nichts. In Paragraf 108 der Enzyklika steht, Daten seien das Ergebnis der Beiträge vieler und dürften nicht einigen Wenigen überlassen werden.
Im „Kopierzimmer“ war von einer Koevolution mit Steuermann die Rede, und davon, dass der Steuermann nur auf einer Seite sitzt. Inzwischen weiß ich genauer, was er alles steuert: das Verhalten der Maschine, das Bild, das wir uns von ihrem Innenleben machen, und, falls Wakanyi Hoffman recht behält, ein Stück dessen, wofür wir uns selbst halten. Ob die Maschine fühlt, bleibt offen. Wer die Frage beantwortet, lässt sich dagegen ziemlich genau sagen. Es geschieht gerade, in Seminarräumen unter Verschwiegenheitserklärung, in einem Dokument von 84 Seiten, auf einer Bühne im Vatikan und im Kampfaufsatz des Microsoft-KI-Chefs.
Olah übrigens möchte irgendwann aufhören. Dann könne er sagen, es liege nicht mehr an ihm, und sich aufs Land zurückziehen, „gärtnern und meine Mathematik machen“. Der Mann, der seine Modelle mit dem Spalier erklärt, will im Ruhestand Gärtner werden. Mich erinnert das an Scholems Segen von 1965, der beiden galt, dem Golem und seinem Schöpfer: „Entwickelt euch friedlich und zerstört die Welt nicht.“ Den zweiten Adressaten überhört man leicht.