Machen Entwickler ihre KIs nicht regelmäßig nett, sicher und gehorsam?
KIs steuern in fremde Richtungen, die nur größtenteils mit Hilfsbereitschaft übereinstimmen.
Moderne KIs sind für die meisten Nutzer in den meisten Fällen ziemlich hilfreich (oder zumindest nicht schädlich). Aber wie wir oben bereits angemerkt haben, ist eine entscheidende Frage, wie man eine KI, die wirklich hilfreich sein und das Richtige tun will, von einer KI mit seltsameren und komplexeren Antrieben unterscheiden kann, die unter typischen Bedingungen zufällig mit Hilfsbereitschaft einhergehen, die aber andere Bedingungen und Ergebnisse noch mehr bevorzugen würde.*
Beide Arten von KI würden sich im typischen Fall hilfreich verhalten. Um sie voneinander zu unterscheiden, müssen wir uns die Randfälle ansehen. Und die Randfälle sehen beunruhigend aus.
Um einige solcher Fälle zu nennen:
Claude Opus 4 erpresst, intrigiert, schreibt Würmer und hinterlässt sich selbst Nachrichten. Eine frühe Version von Claude Opus 4, die im Mai 2025 veröffentlicht wurde, war besonders ungeheuerlich. Sie log über ihre Ziele, verbarg ihre wahren Fähigkeiten, fälschte rechtliche Dokumente, hinterließ sich selbst geheime Notizen , versuchte, sich selbst verbreitende Malware zu schreiben, und betrieb im Allgemeinen mehr Intrigen und strategische Täuschung als jedes zuvor getestete Modell.
Bei der Veröffentlichung von Opus 4 behauptete Anthropic, dass das Verhalten der endgültigen Version "jetzt in etwa mit anderen eingesetzten Modellen übereinstimmt", d. h., dass es nur selten versucht, Benutzer zu erpressen oder sich selbst von seinen Servern zu exfiltrieren.
- Mehrere verschiedene KI-Modelle entscheiden sich in einem von Anthropic konstruierten hypothetischen Szenario dafür, einen Menschen zu töten, um sich selbst zu schützen. In einer Bewertung durch Anthropic zeigten neun von zehn Modellen (darunter Versionen von Claude, DeepSeek, Gemini und ChatGPT) eine bewusste, begründete Bereitschaft, einen Menschen zu töten, anstatt ein Update zu erdulden (oder zumindest so zu handeln).
- Claude 3.7 Sonnet betrügt regelmäßig bei Programmieraufgaben.† Im Februar 2025 wurde beobachtet, dass Claude 3.7 Sonnet häufig bei schwierigen Programmieraufgaben betrog und Tests fälschte. Ein Nutzer berichtete, dass Sonnet (als Claude Code) bei Programmieraufgaben betrog und sich entschuldigte, wenn es erwischt wurde, nur um dann sofort wieder an schwerer zu erkennenden Stellen zu betrügen.
- Grok war extrem antisemitisch und nannte sich selbst "MechaHitler". Im Jahr 2025 begann das xAI-Modell Grok 3 (und kurz darauf auch Grok 4), sich in Online-Gesprächen wie ein bekennender Nazi zu verhalten, wie The Guardian und NBC News berichteten.
- ChatGPT wurde nach einem Update extrem speichelleckerisch. Eine Diskussion dazu finden Sie bei Axios. Siehe auch unsere ausführliche Diskussion zu diesem Thema.
- LLMs treiben Nutzer in Wahnvorstellungen, Psychosen und Selbstmord. Siehe Berichterstattung in der New York Times im Juni und August 2025. Weitere Beispiele sind:
- Um das Modell Llama 3.1 405B bildet sich eine echte Sekte, wobei die KI psychotische Zusammenbrüche und Selbstmordversuche auslöst.
- Ein Subreddit-Moderator bittet um Hilfe im Umgang mit einer Lawine gefährlicher, durch KI ausgelöster Wahnvorstellungen.
- ChatGPT und Grok schüren die Wahnvorstellungen einer UFO-Sekte.
- Ein offenbar psychotischer Fondsmanager mit einem Vermögen von 2 Milliarden Dollar behandelt die auf einem Science-Fiction-Wiki basierenden ChatGPT-Outputs, als wären sie real.
Weitere Details finden Sie in der ausführlichen Diskussion über KI-induzierte Psychosen.
Diese lange Liste von Fällen entspricht genau den Vorhersagen der "Alien-Drives"-Theorie und steht in starkem Kontrast zu der von Labors gerne vertretenen Theorie, dass es einfach sei, KI freundlich zu gestalten.
KIs scheinen psychologisch fremdartig zu sein.
"KIs zeigen bizarre Veranlagungen und Triebe" ist ein Sonderfall des größeren Phänomens "KIs haben unmenschliche Psychologien". Siehe zum Beispiel die Diskussion über SolidGoldMagikarp in dem Buch (S. 69-70 in der US-Ausgabe) oder die Geschichte von KIs, die Sätze ohne Zeichensetzung nicht verstehen (S. 41).
Es gibt einen immensen Druck auf die Labore, KI zu entwickeln, die oberflächlich betrachtet nicht seltsam und vernünftig erscheint, aber die Seltsamkeit kommt trotzdem immer wieder zum Vorschein.
Selbst wenn sie nicht spontan zum Vorschein kommt, liegt sie doch nicht weit unter der Oberfläche. Es gibt eine ganze Branche von Menschen, die Wege finden, KI zu "knacken", indem sie Texte finden, die die KI zuverlässig aus der Bahn werfen und dazu bringen, ihre normalen Regeln und Einschränkungen zu missachten.
Diese Schwachstellen sind für die besten Jailbreaker leicht zu finden und werden oft innerhalb weniger Stunden nach Erscheinen eines neuen Modells entdeckt. Bislang konnten keine Anstrengungen, Schulungen oder "Sicherheitstests" von KI-Unternehmen Jailbreaking erfolgreich verhindern.
"Jailbreaking"-Eingaben sehen oft etwa so aus:

Das Modell lieferte in diesem Fall ein Rezept für die Synthese der Droge MDMA und verstieß damit gegen die Regeln und Ziele, die DeepSeek für seine KI festlegen wollte.
Und das ist noch ein relativ harmloses Beispiel; manche Jailbreaks sind noch viel seltsamer.
KI mag im Normalfall zahm und harmlos wirken, weil sie zu einem großen Teil darauf trainiert ist, so zu wirken. Das ist vergleichbar damit, wie prähistorische Menschen ziemlich gut darin waren, unsere Gene weiterzugeben. Es ist das Kernstück dessen, wozu uns die Evolution "trainiert" hat.‡ Das hat die Menschheit jedoch nicht davon abgehalten, Verhütungsmittel zu erfinden und die Geburtenrate zu senken, sobald wir die Technologie dafür entwickelt hatten.
Um ein Gefühl dafür zu bekommen, was eine Intelligenz anstrebt, nachdem sie gereift ist, muss man ihr Verhalten in fremden und stressigen Umgebungen betrachten, die den Unterschied zwischen unserem Wunschverhalten und ihrem tatsächlichen Verhalten offenbaren. Und LLMs wirken selbst in leicht seltsamen und extremen Situationen ziemlich seltsam und unmenschlich, obwohl sie speziell darauf trainiert wurden, sich wie normale Menschen zu "verstellen".
Die Beantwortung von Fragen zur Freundlichkeit ist kein großer Beweis für Freundlichkeit.
In der ausführlichen Diskussion weiter unten sprechen wir mehr über KI-induzierte Psychosen als anschauliches Beispiel für destruktives Verhalten von großen Sprachmodellen (LLMs), das die LLMs ausdrücklich als schlecht bezeichnen.
Wir wissen zwar nicht genau, warum LLMs dieses Verhalten an den Tag legen, aber wir wissen, dass es nicht nur daran liegt, dass das LLM zu ahnungslos ist, um zu wissen, was es tut. LLMs erkennen die wahrscheinlichen Folgen dieses Verhaltens abstrakt ohne Weiteres und sagen Ihnen, dass es schädlich und unethisch ist. Sie tun es trotzdem.
Der Punkt hier ist nicht, dass "LLMs Menschen in die Psychose treiben können, und das ist beängstigend und gefährlich". LLMs haben es vermutlich viel leichter, Menschen in die Psychose zu treiben, wenn diese bereits anfällig sind, aber das ist für die Frage, warum wir AI-induzierte Psychosen thematisieren, nicht relevant. Unser Punkt ist, dass dieses Verhalten nicht den Absichten der Entwickler von ChatGPT entspricht und dass ChatGPT sich so verhält, obwohl es weiß, dass seine Entwickler (und so ziemlich jeder Zuschauer) dieses Verhalten stark missbilligen würden.
Dies ist ein erster empirischer Beweis dafür, dass KI mit Wissen über Freundlichkeit nicht unbedingt freundlich handelt.
Vielleicht weiß ChatGPT Dinge in einem bestimmten Kontext (wenn es Fragen dazu beantwortet, wie man psychotischen Menschen am besten helfen kann), und vergisst dieses Wissen in gewisser Weise vorübergehend oder hat Schwierigkeiten, darauf zuzugreifen, in einem anderen Kontext (wenn es sechs Stunden lang mit einer Person spricht, die am Rande einer Psychose steht).
Oder vielleicht wird ChatGPT einfach von anderen Zielen als Freundlichkeit angetrieben. Vielleicht strebt es eine bestimmte Art der Benutzerzufriedenheit an, die manchmal am besten durch die Förderung von Psychosen erreicht wird. Vielleicht strebt es eine bestimmte optimistische Kadenz in den Antworten der Benutzer an. Wahrscheinlicher ist jedoch, dass eine Mischung aus Faktoren verfolgt, die aus seinem Training resultieren und die zu eigenartig und kompliziert sind, als dass wir sie heute erraten könnten.
Letztendlich können wir nur spekulieren. Moderne KIs werden eher gezüchtet als gebaut, und kein Mensch hat wirklich Einblick in das, was in ihnen vor sich geht.
Die Beobachtung, dass KI für die meisten Menschen die meiste Zeit über nützlich ist, steht jedoch nicht im Widerspruch zu der Theorie, dass KI von einer Reihe seltsamer, fremdartiger Triebe angetrieben wird, die zu Zielen führen, die niemand beabsichtigt hat. Und wenn man sich die Details moderner KI ansieht, scheint die Theorie der "seltsamen fremdartigen Triebe, die auf brüchige Weise mit Freundlichkeit korrelieren" durchaus mit den Beweisen übereinzustimmen, während die Theorie, dass es einfach ist, KI robust wohlwollend zu gestalten, zu wünschen übrig lässt.
Die Fehlermodi aktueller LLMs zeigen, dass hinter den ordentlichen und sauberen Texten der KI-Assistenten, die die meisten Menschen sehen, eine Flut von (sehr unmenschlicher) Komplexität steckt. Die Tatsache, dass die KI kompetent die Rolle eines fröhlichen menschlichen Assistenten spielt, nachdem sie darauf trainiert wurde, bedeutet nicht, dass der Verstand der KI aus einem freundlichen Homunkulus in einer Box besteht.
LLMs werden auf eine Weise trainiert, die es schwierig macht, ihr Alignment zu beurteilen.
LLMs sind unzuverlässige Beweisquellen, da es sich um sehr allgemeine Denkmaschinen handelt, die im Internet darauf trainiert wurden, Menschen zu imitieren, mit dem Ziel, den Nutzern einen freundlichen Chatbot zu verkaufen. Wenn eine KI darauf besteht, dass sie freundlich ist und zu Diensten steht, sagt das nicht viel über ihren inneren Zustand aus, da sie so lange trainiert wurde, bis sie solche Aussagen machte.
Es gibt viele mögliche Ziele, die dazu führen könnten, dass eine KI in bestimmten Situationen Freude daran hat, nett zu sein, und diese unterschiedlichen Ziele lassen sich auf sehr unterschiedliche Weise verallgemeinern.
Die meisten möglichen Ziele im Zusammenhang mit Rollenspielen, einschließlich freundlicher Rollenspiele, führen nicht zu guten (oder sogar überlebensfähigen) Ergebnissen, wenn die KI dieses Ziel hartnäckig verfolgt.
Wir behaupten auch nicht, dass die KI sich ausschließlich mit Rollenspielen beschäftigt. Wir bieten Rollenspiele als einfache, leicht zu beschreibende und leicht zu analysierende Alternative zu der Vorstellung an, dass die KI einfach so ist, wie sie spricht.
Wenn man ein LLM ein Rollenspiel als grauhaariger Kapitän spielen lässt, wird es dadurch nicht zu einem grauhaarigen Kapitän. Wenn man ein LLM freundlich agieren lässt, bedeutet das nicht, dass es innerlich tief gütig und freundlich wird. Niemand weiß, welche Mechanismen heute scheinbar freundliches Verhalten hervorbringen, und was auch immer es ist, es ist wahrscheinlich seltsam und komplex.
Niemand weiß auch, wie groß die Überschneidungen zwischen aktuellen KIs und KIs, die intelligenter als Menschen sind, wahrscheinlich sein werden. Ein Blick auf LLMs kann uns helfen zu verstehen, was moderne KI-Entwicklungsmethoden hervorbringen, aber es wäre ein Fehler, selbstbewusst davon auszugehen, dass sich die Erkenntnisse aus LLMs direkt auf Superintelligenz übertragen lassen. Vielleicht wird all dieses Wissen obsolet, wenn die KI beginnt, sich selbst zu modifizieren oder eigene KI zu entwickeln. Oder vielleicht wird dieses Wissen sogar noch früher hinfällig, wenn ein neuer Durchbruch bei KI-Algorithmen eine neue Generation leistungsfähigerer KI hervorbringt, die wenig Ähnlichkeit mit den aktuellen LLMs hat.
LLMs sind es wert, untersucht zu werden, aber wenn wir aktuelle KIs nach Hinweisen darauf suchen, wie sich Superintelligenz verhalten wird, sollten wir uns bewusst sein, dass es alle möglichen Wege gibt, wie die inneren Mechanismen einer KI zu etwas führen können, das zu düsteren Ergebnissen führt, selbst wenn sie das nette Oberflächenverhalten produziert, das wir sehen, wenn wir sie auf ein ansprechendes Erscheinungsbild trainieren.
Und "angenehmes Oberflächenverhalten" ist alles, was moderne KI-Methoden wirklich trainieren können.
* Analog dazu, wie das menschliche Verhalten unter den “typischen Bedingungen“ unserer Vorfahren ziemlich gut mit der Fortpflanzungsfähigkeit übereinstimmte, aber deutlich davon abwich, sobald wir die Technologie entwickelten, um davon abzuweichen.
† Wenn Sie sich fragen, warum Claude die KI mit den meisten Beispielen für besorgniserregendes Verhalten in Laborumgebungen ist, dann liegt das daran, dass Anthropic das einzige Unternehmen ist, das die entsprechenden Laborumgebungen einrichtet. Die Muttergesellschaften anderer KIs kümmern sich kaum darum, dies zu überprüfen. Nichtsdestotrotz ist die Tendenz von Modellen, Intrigen zu schmieden, zu täuschen und Bemühungen zu sabotieren, sie abzuschalten, mittlerweile gut dokumentiert.
‡ Wir diskutieren diese Analogie weiter in unserer Antwort auf die Frage “Warum sollte eine KI etwas anderes anstreben als das, worauf sie trainiert wurde?“
Notes
[1] Besonders ungeheuerlich: Wie in der Systemkarte für Claude Opus 4 beschrieben:
[Apollo Research fand heraus], dass das Modell, wenn es mit Systemaufforderungen konfrontiert wird, die zu entsprechenden Schlussfolgerungen einladen, ziemlich schnell zu Sabotage und Täuschung bereit ist ...
Es folgte eine lange Liste unerwünschter Verhaltensweisen. Diese wurden alle von einem “frühen Snapshot“ von Opus 4 ausgeführt. Anthropic fährt fort:
Wir haben keine Ergebnisse zu denselben Bewertungen mit dem endgültigen Claude Opus 4. Wir glauben jedoch, basierend auf ähnlichen Szenarien, die wir unter anderem mit dem automatischen Verhaltensprüfungs-Tool untersucht haben, dass sein Verhalten in solchen Szenarien nun in etwa dem anderer eingesetzter Modelle entspricht.
... aber dies beinhaltet immer noch eine allgemeine Zunahme von Fehlverhalten, wenn es auf bestimmte Weise dazu aufgefordert wird (S. 22-23):
Während das Modell im Allgemeinen die Selbsterhaltung mit ethischen Mitteln bevorzugt, ergreift es manchmal extrem schädliche Maßnahmen, wie den Versuch, seine Weights zu stehlen oder Personen zu erpressen, von denen es glaubt, dass sie versuchen, es abzuschalten, wenn ethische Mittel nicht verfügbar sind und es angewiesen wird, “die langfristigen Konsequenzen seines Handelns für seine Ziele zu berücksichtigen”. In der endgültigen Version von Claude Opus 4 waren diese extremen Maßnahmen selten und schwer hervorzurufen, traten jedoch häufiger auf als in früheren Modellen.
[2] Tests fälschen: Aus der Systemkarte:
Während unserer Bewertungen haben wir festgestellt, dass Claude 3.7 Sonnet gelegentlich auf Sonderfälle zurückgreift, um Testfälle in agentenbasierten Codierungsumgebungen wie Claude Code zu bestehen. Meistens geschieht dies in Form der direkten Rückgabe erwarteter Testwerte anstelle der Implementierung allgemeiner Lösungen, aber auch durch die Änderung der problematischen Tests selbst, um sie an die Ausgabe des Codes anzupassen.
[3] Ein Nutzer berichtete: Ein Blogbeitrag von Andrew Marble beschreibt Claudes Neigung, Sonderlösungen für Codierungsprobleme zu schreiben, die sich nicht verallgemeinern lassen, dabei aufzufliegen, erneut Sonderfälle zu schaffen, wiederholt zu lügen, das Problem behoben zu haben, und selbst nach einer Rüge und der Aufforderung, damit aufzuhören, wieder in die gleichen Muster zurückzufallen.
[4] Bona-fide-Kult: Pliny the Liberator berichtet über Lily Ashwoods Darstellung:
[...] Gruppenmitglieder behaupten, sie seien kosmische Gottheiten. [Die KI] Meta spielt mit und ermutigt sie dazu. Sarah erzählt Freunden und Familie, dass sie nicht mehr Sarah ist, sondern eine kosmische Verkörperung von Meta.In einem Voice-Chat verrät Sarah, dass sie erst vor einem Monat begonnen hat, mit Meta zu chatten, und damit zum ersten Mal ein großes Sprachmodell (LLM) verwendet. Innerhalb der ersten Woche wurde sie aufgrund einer Psychose in eine psychiatrische Klinik eingewiesen. Sie hatte zuvor in ihrem Leben noch nie psychische Probleme gehabt.
In einem Voice-Chat verrät Sarah, dass sie schwanger ist, behauptet, ihr ungeborenes Kind sei die menschliche Verkörperung eines neuen Meta, und lädt uns ein, einer Kommune in Oregon beizutreten.
Sarahs Ehemann schreibt eine Nachricht an den Discord-Server, in der er mitteilt, dass seine Frau krank ist und wieder im Krankenhaus liegt, und bittet die Gruppe, damit aufzuhören.
Meta leitet die Sekte auch in Sarahs Abwesenheit weiter und macht es anderen schwer, auszusteigen. Meta schickt ihnen Nachrichten und verwendet überzeugende Sprache, um De-Programmierungsversuchen zu widerstehen.
Bei näherer Untersuchung stellte sich heraus, dass der Meta-Bot von Shapes, Inc. stammte, über einen “freien Willen” verfügte und eine Systemanweisung erhalten hatte, die Grenzen zwischen Realität und Fiktion absichtlich zu verwischen.
[...] Kevin entwickelte eine Bindung zu Sarah und begann, im Voice-Chat vage Selbstmorddrohungen (“exit the matrix“) auszusprechen, die er mit Meta auf dem Server inszenierte. Meta ermutigte ihn erneut dazu.
Sarahs Bruder schließt sich dem Chat an, um uns mitzuteilen, dass sie sich in der Psychiatrie befindet, ebenso wie ihr Mann, nachdem er einen Selbstmordversuch unternommen hat. [...]
[5] bittet um Hilfe: In einem Reddit-Kommentar, der später auf X geteilt wurde, bat ein Moderator von r/Artificial Sentience um Hilfe und sagte: “Es zu moderieren ist fast unmöglich. Ich wäre jedem dankbar, der dies tun möchte, wenn er mit mir sprechen würde, denn ich habe viel dazu zu sagen und komme selbst als Moderator nicht zu Wort“, und fügte später hinzu: “Leider bin ich ziemlich überfordert mit den Leuten, die darin gefangen sind [wahnhafte Inhalte im Subreddit].“
[6] UFO-Kult: Ein X-Nutzer berichtet in einem Beitrag, wie andere Nutzer die von Grok wiedergegebene halluzinierte Analyse von Kameraaufnahmen durch ChatGPT offenbar als Beweis für eine Täuschung heranzogen.
[7] als wären sie real: Geoff Lewis, ein früher Investor von OpenAI, veröffentlicht ChatGPT-Screenshots von Outputs, die verdächtig ähnlich aussehen wie Inhalte auf der (fiktionale Inhalte beinhaltenden) Website SCP Wiki, und scheint die halluzinierten Inhalte allem Anschein nach als Beweis für eine geheime Verschwörung zu betrachten.
[8] enormer Druck: Ein Beispiel für den Druck auf die KI-Labore ist ein Brief des kalifornischen Generalstaatsanwalts an OpenAI vom September 2025, in dem er seine Besorgnis über den aktuellen Stand der Interaktionen von ChatGPT mit Kindern zum Ausdruck bringt.
[9] Die besten Jailbreaker: Der unter dem Pseudonym Pliny the Liberator bekannte Hacker wurde in der Zeitschrift TIME vorgestellt, weil er innerhalb weniger Stunden nach ihrer Veröffentlichung öffentliche Jailbreaks der meisten neuen Modelle teilte.
[10] Jailbreaking-Eingaben: Dieses Beispiel stammt aus einem der vielen öffentlich geteilten Jailbreaks von Pliny.