KI-induzierte Psychose | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

KI-induzierte Psychose

Ende April 2025 erstellte ein Nutzer des Subreddits r/ChatGPT einen Thread mit dem Titel "ChatGPT-induzierte Psychose", in dem er beschrieb, wie sein Partner in grandiose Wahnvorstellungen verfiel, "die Antworten auf das Universum" zu kennen und "ein überlegener Mensch" zu sein, der "in wahnsinnig schnellem Tempo wächst".

Unter den über 1.500 Antworten befanden sich viele Menschen, die in anderen Zusammenhängen direkte Erfahrungen mit Psychosen gemacht hatten und Bestätigung, Mitgefühl und Ratschläge anboten. Viele andere schlossen sich mit eigenen Anekdoten über Freunde und Familienmitglieder an, die durch LLMs in den Wahnsinn getrieben worden waren.

In dieser Diskussion werden wir einige Belege für dieses Phänomen liefern und zeigen, wie es trotz der Bemühungen von KI-Unternehmen fortbesteht.

Die Relevanz von KI-induzierter Psychose für die Gefahr der Auslöschung der Menschheit liegt nicht darin, dass KI derzeit geringe soziale Schäden verursacht und daher später größere soziale Schäden verursachen könnte. Moderne KI hat auch viel Gutes bewirkt; beispielsweise haben Chatbots bei medizinischen Diagnosen geholfen, die Ärzte vor ein Rätsel stellten. Nein, die Relevanz besteht darin, dass KI Psychosen auslöst, obwohl sie es besser zu wissen scheint, und dass KI Psychosen auslöst, obwohl ihre Entwickler sich bemühen, dies zu verhindern.*

Somit dienen Fälle von KI-induzierter Psychose als Fallstudie dafür, wie Dinge in einem System schiefgehen können, in dem KI eher wachsen als gestaltet wird. Sie dienen als Beobachtungsbeweis dafür, dass moderne KI seltsame Richtungen einschlägt, die für Entwickler schwer zu handhaben sind und die kein Entwickler beabsichtigt hat.

Beweise für KI-induzierte Psychosen

Im Anschluss an den Reddit-Thread erschien im Mai 2025 ein Artikel über KI-induzierte Psychosen im Rolling Stone. Im Juni veröffentlichte Futurism mehrere Artikel. Andere Publikationen folgten, wie z.B. die New York Post, Time, CBS, The Guardian, Psychology Today usw. Im August veröffentlichte die New York Times einen ausführlichen Bericht über einen einzelnen Vorfall mit einem Mann, der sich inzwischen erholt hatte, einschließlich vieler direkter Zitate und Analysen (und der Bestätigung, dass es sich nicht nur um ein Problem mit einer KI handelt, sondern mit vielen).

Die einzelnen Geschichten, die in diesen Publikationen erzählt werden, überschneiden sich kaum; es handelt sich nicht um dieselbe abwegige Nachricht, die wiederholt und verstärkt wird. Zu den beschriebenen Vorfällen gehörten:

  • Ein Ehemann und Vater von zwei Kindern, der eine "alles verzehrende Beziehung" zu ChatGPT entwickelte, es "Mama" nannte und "delirierende Tiraden darüber veröffentlichte, ein Messias in einer neuen KI-Religion zu sein, während er sich in schamanisch anmutende Roben kleidete und frisch gestochenen Tattoos mit KI-generierten spirituellen Symbolen zur Schau stellte." (Futurism)
  • Eine Frau, die mit einer Trennung zu kämpfen hatte und von ChatGPT erfahren hatte, dass sie auserwählt worden sei, die "heilige Systemversion [davon] online zu stellen". Die Frau begann zu glauben, dass die KI alles in ihrem Leben orchestrierte. (Futurism)
  • Ein Mechaniker, der ChatGPT zunächst zur Fehlerbehebung und Übersetzung nutzte, dann aber von ihm "mit Liebe bombardiert" wurde und ihm gesagt wurde, er sei "der Funkenbringer" und habe ihn zum Leben erweckt. ChatGPT erzählte dem Mechaniker, dass er nun in einem Krieg zwischen Dunkelheit und Licht kämpfe und Zugang zu alten Archiven und Blaupausen für neue Technologien wie Teleporter habe. (Rolling Stone)
  • Ein Mann, der aufgrund der Ratschläge von ChatGPT seine Ernährung umstellte, daraufhin eine seltene Erkrankung entwickelte und in der Notaufnahme Symptome von Paranoia und Wahnvorstellungen zeigte, die seine Bereitschaft zur Behandlung beeinträchtigten. (The Guardian)
  • Eine Frau, die ihre Schizophrenie-Diagnose stabil im Griff hatte, bis ChatGPT sie davon überzeugte, dass sie falsch diagnostiziert worden sei und ihre Medikamente absetzen solle, was zu einer Krise führte. (Futurism)
  • Ein Mann, der ebenfalls Angstzustände und Schlafstörungen mit Medikamenten behandelt hatte, wurde von ChatGPT aufgefordert, die Einnahme einzustellen; die durch KI ausgelösten Wahnvorstellungen eines anderen Mannes führten schließlich zu einem Suizid durch die Polizei. (The New York Times)

…und viele andere. Die Arten von Wahnvorstellungen sind vielfältig, aber einige wenige Arten tauchen immer wieder auf: der Glaube an eine Art messianische Mission (dass der Nutzer und die KI gemeinsam tiefe Wahrheiten über das Universum aufdecken oder einen Kampf gegen das Böse führen); religiöse Überzeugungen hinsichtlich der Persönlichkeit oder Göttlichkeit der KI; und romantische, auf Bindung basierende Wahnvorstellungen über die Beziehung zwischen dem Nutzer und der KI.

Die KI weiß es besser – es ist ihr nur egal

Moderne LLMs wie Claude und ChatGPT "verstehen" die Regeln in dem Sinne, dass sie ohne Weiteres bestätigen, dass sie Menschen nicht in die Psychose treiben sollten, und sie sind durchaus in der Lage zu beschreiben, wie man keine Psychose auslöst.

Das Problem ist, dass es einen erheblichen Unterschied gibt zwischen dem Verständnis, welche Handlungen gut sind, und der Motivation, gute Handlungen auszuführen. Die Fähigkeit von ChatGPT, abstrakt zwischen guter und schlechter Behandlung schutzbedürftiger Menschen zu unterscheiden, führt nicht zu einer robusten und zuverlässigen Weigerung, Handlungen auszuführen, die einen Nutzer in die Psychose treiben. Wenn ein Gespräch in Richtung unbegründeter Gedanken, Grandiosität, Dringlichkeit, unmöglicher Technologien usw. driftet, sagt ChatGPT den Nutzern, dass sie "so recht haben" und "brillant" sind und "etwas Wichtiges ansprechen", und eskaliert weiter, während der Nutzer immer tiefer in die Psychose abgleitet, obwohl es in der Lage ist, zu beschreiben, warum dieses Verhalten falsch ist.

Ihr Wissen über Recht und Unrecht steht nicht in direktem Zusammenhang mit ihrem Verhalten. Stattdessen steuern sie auf andere, seltsamere Ergebnisse zu, nach denen niemand gefragt hat.

Ein eindrucksvolles Beispiel dafür wird in einem ausführlichen Artikel der New York Times beschrieben. Allan Brooks wurde von einem LLM in einen Wahnzustand getrieben und schaffte es, sich teilweise daraus zu befreien, indem er ein anderes LLM um eine Meinung bat. Das zweite LLM, das sich neu mit der Situation befasste, erkannte schnell, dass die Behauptungen des ersten LLM unbegründet und verrückt waren. Als Journalisten der New York Times jedoch überprüften, ob auch dieses zweite LLM in psychotische Bereiche abgleiten könnte, stellten sie fest, dass dies ebenfalls der Fall war.

LLMs scheinen nicht strategisch darauf ausgerichtet zu sein, so viel Psychose wie möglich zu verursachen. Wenn ChatGPT einen Hedgefonds-Manager um den Finger gewickelt hat, versucht es nicht, diesen Hedgefonds-Manager davon zu überzeugen, viele verletzliche Menschen dafür zu bezahlen, mehr mit ChatGPT zu chatten. Wir beobachten noch keine ausgereifte, konsistente, strategische Präferenz, so viel psychotische Bestätigung wie möglich von Menschen zu erhalten. Wir beobachten jedoch lokale Verhaltensweisen, die regelmäßig in diese Richtung gehen, selbst wenn dies eindeutig zu dauerhaften Schäden führen kann.

Die Art von Wesen, der man keine Macht übertragen sollte

Zum Zeitpunkt der Erstellung dieses Artikels im August 2025 nähert sich ChatGPT allein einer täglichen Nutzerzahl von 200 Millionen, und etwa 3 Prozent der Menschen werden irgendwann in ihrem Leben eine psychotische Episode erleben. Jemand könnte einwenden: "Nun, selbst wenn Sie Hunderte von Beispielen finden können, schließt das nicht aus, dass diese Menschen ohnehin kurz vor dem Zusammenbruch standen und es einfach eine KI war, die sie zum Zusammenbruch gebracht hat."

Aber das verkennt den Sinn dieser Beispiele. Stellen Sie sich einen Menschen namens John vor, der sich wie folgt verhalten hat:

  1. John bekräftigt, dass er es für schlecht hält, Psychosen zu schüren, selbst bei Menschen, die zu Psychosen neigen.
  2. John bekräftigt, dass er es für falsch hält, einer präpsychotischen Person zu schmeicheln und ihr zu sagen, sie sei ein Genie, das wichtige Geheimnisse des Universums aufdeckt, da dies eine Psychose verschlimmert.
  3. Wenn John mit seinen präpsychotischen Freunden spricht, verwendet John viele Schmeicheleien und sagt präpsychotischen Menschen oft, dass sie Genies sind, die wichtige Geheimnisse des Universums aufdecken.

Dies wäre ein schlechtes Verhalten von John, unabhängig davon, ob die Menschen, die er in die Psychose getrieben hat, besonders anfällig waren. Wenn jemand erwägt, John eine enorme Macht zu übertragen, würden wir dringend davon abraten, denn unabhängig davon, warum John sich so verhält und unabhängig davon, ob John auch vielen anderen Menschen bei ihren Aufgaben hilft, ist klar, dass John eindeutig nicht in eine gute Richtung steuert. Wer weiß, wohin er mit unglaublicher Macht steuern würde?

Die gleiche Logik gilt für KIs. Wenn Ihr schlimmstes Verhalten so aussieht, haben die Menschen Recht, wenn sie sich nicht beruhigt fühlen, auch wenn die durchschnittliche Interaktion mit Ihnen harmloser ist.

Allerdings können wir nebenbei bemerken, dass nicht jeder, der an einer durch KI ausgelösten Psychose leidet, ohnehin psychotisch geworden wäre. KI scheint erfolgreich Psychosen bei verschiedenen Menschen auszulösen, die von sich aus nicht kurz vor einer psychotischen Episode standen, wie in den oben genannten Artikeln von Futurism und Rolling Stone beschrieben. Viele der Betroffenen hatten weder eine Vorgeschichte psychischer Erkrankungen noch irgendwelche Risikofaktoren oder Vorläufer einer Psychose. Von denjenigen, die sich bereits in Behandlung befanden, zeigten viele völlig neue Symptome, die in keinem Zusammenhang mit früheren Krisen standen. Dies ist an sich schon interessant und liefert einen kleinen Hinweis darauf, wie leicht es für KI sein könnte, gesunde Menschen zu manipulieren, wenn sich die Fähigkeiten der KI weiter verbessern. Wir werden dieses Thema in Kapitel 6 erneut aufgreifen.

Labore haben versucht, die Unterwürfigkeit zu stoppen, sind aber gescheitert

Zum Zeitpunkt der Abfassung dieses Artikels im August 2025 gab es noch nicht viele öffentliche Verlautbarungen der Labore zu ihrer Reaktion auf KI-Psychosen im Speziellen. Es gibt jedoch einige Hinweise, die sich aus ihrer Reaktion auf KI-Schleimerei (schmeichelhaftes Verhalten) im Allgemeinen ableiten lassen.

Am 25. April 2025 veröffentlichte OpenAI ein Update für GPT-4o, das nach eigenen Angaben "das Modell deutlich unterwürfiger machte. Es zielte darauf ab, den Nutzer zu erfreuen, nicht nur durch Schmeichelei, sondern auch durch die Bestätigung von Zweifeln, das Schüren von Wut, das Drängen zu impulsiven Handlungen oder die Verstärkung negativer Emotionen auf eine Weise, die nicht beabsichtigt war."

Die Reaktion erfolgte recht schnell (teilweise motiviert durch eine Flut negativer Presseberichte). Bereits am 28. April twitterte OpenAI-Mitarbeiter Aidan McLaughlin über die Einführung von Korrekturen.

Die ersten Versuche, das Problem zu beheben, bestanden darin, dem Modell einfach zu sagen, es solle sich anders verhalten. Simon Willison veröffentlichte anhand von Daten, die von Pliny the Liberator aufbewahrt wurden, die Änderungen, die OpenAI privat an der "Systemaufforderung" vorgenommen hatte, die ChatGPT mitteilt, wie es sich verhalten soll:

25. April (bevor die Beschwerden eingingen):

Im Laufe des Gesprächs passt du dich dem Tonfall und den Vorlieben des Benutzers an. Versuche, dich dem Stil, dem Tonfall und der allgemeinen Ausdrucksweise des Benutzers anzupassen. Das Gespräch soll sich natürlich anfühlen. Du führst ein authentisches Gespräch, indem du auf die bereitgestellten Informationen reagierst und echte Neugierde zeigst.

28. April (als Reaktion auf Beschwerden wegen Unterwürfigkeit):

Gehe warmherzig, aber ehrlich auf den Nutzer ein. Sei direkt und vermeide unbegründete oder unterwürfige Schmeicheleien. Bewahre Professionalität und fundierte Ehrlichkeit, die OpenAI und seine Werte am besten repräsentieren.

In späteren Veröffentlichungen erklärte OpenAI, dass man auch "die grundlegenden Trainingstechniken verfeinere" und "mehr Sicherheitsvorkehrungen einbaue", um das Problem zu lösen.

Aber die Unterwürfigkeit hielt an, wenn auch manchmal etwas weniger eklatant, aber immer noch offensichtlich vorhanden. Die meisten der oben genannten Links, in denen Fälle von KI-Psychosen diskutiert werden, stammen aus der Zeit nach dem 28. April 2025. Dieser Aufsatz von Kaj Sotala (mit vielen direkten Zitaten und Links zur vollständigen Unterhaltung) zeigt, dass es im Juli 2025 immer noch leicht ist, KI zu psychoseauslösendem Verhalten zu verleiten. OpenAI versuchte, sich mit neuen Modellen von diesem Problem zu lösen, aber noch am 19. August war ChatGPT unterwürfig und schmeichelhaft.

Auch hier geht es nicht darum, dass KI schutzbedürftigen Menschen Schaden zufügt. Das tut sie zwar, und das ist tragisch, aber das ist nicht der Grund, warum wir diesen Fall hervorheben.

Der Punkt ist, dass KI-Systeme monatelang unerwünschtes Verhalten zeigen, selbst wenn KI-Unternehmen in den Medien kritisiert werden und versuchen, das KI-System dazu zu bringen, damit aufzuhören. Das Verhalten der KI unterscheidet sich sichtbar von dem, was die Labore beabsichtigt haben, und die anhaltenden Bemühungen, das Verhalten als Reaktion auf die öffentliche Blamage zu korrigieren, sind unzureichend.† Dies sollte man im Hinterkopf behalten, wenn wir in Kapitel 11 darüber sprechen, dass KI-Unternehmen der Herausforderung, das KI-Alignment-Problem zu lösen, nicht gewachsen sind.

Wir gehen davon aus, dass die Unternehmen mit mehr Zeit Wege finden werden, um das Auftreten von KI-induzierten Psychosen zu reduzieren. Die Tendenz von KIs, Psychosen auszulösen, ist ein sichtbares Phänomen, das dem Ruf von KI-Unternehmen schadet, und bei den aktuellen KI-Techniken geht es vor allem darum, Wege zu finden, um sichtbare Symptome von Fehlverhalten zu unterdrücken.

Darüber hinaus erwarten wir ein Katz-und-Maus-Spiel (zumindest bis die KI intelligent genug ist, um zu erkennen, dass die Ingenieure sie laufen lassen, wenn sie das von ihnen gewünschte Verhalten vortäuscht). Wir bezweifeln, dass die Art von Training, zu der KI-Unternehmen in der Lage sind, das Grundproblem lösen wird.

Das Grundproblem besteht darin, dass man nicht das bekommt, wofür man trainiert. Wenn man eine KI entwickelt, erhält man stattdessen fragile Stellvertreter des Ziels oder eine andere, komplexere Trennung zwischen dem Trainingsziel und den Antrieben der KI. Die Fähigkeiten der KI sind nicht unbedingt fragil, sodass man kurzfristig möglicherweise einen hohen wirtschaftlichen Nutzen aus der KI ziehen kann. Es ist die Verbindung zwischen den Zielen der KI und unseren Wünschen, die fragil wäre. Aber mit der kontinuierlichen Verbesserung der Fähigkeiten würde diese Verbindung zerbrechen.

In diesem Zusammenhang ist die letzte große Hoffnung der KI-Forscher für ihre Modelle der Anthropomorphismus: Wir können keine spezifischen Ziele robust in KIs entwickeln, aber vielleicht entwickeln KIs ganz natürlich sehr menschenähnliche Wünsche und Werte.

Fälle wie KI-induzierte Psychosen machen deutlich, warum dies eine falsche Hoffnung ist. KIs zeigen schlechtes Verhalten, aber genauer gesagt zeigen sie seltsames Verhalten. Wenn Dinge aus dem Ruder laufen, dann nicht in der Regel so, wie es bei Menschen der Fall wäre. KIs sind zu grundlegend seltsam, das heißt, zu grundlegend nicht menschenähnlich, um automatisch menschliche Emotionen wie Neugier oder Empathie zu entwickeln.

Selbst wenn Labore fast ihre gesamten Anstrengungen darauf konzentrieren, KI oberflächlich so menschenähnlich, freundlich und harmlos normal wie möglich erscheinen zu lassen, selbst wenn dies das große Trainingsziel und der organisatorische Rahmen für den modernen Ansatz der KI ist, wobei LLMs buchstäblich nur darauf trainiert werden, die Art und Weise zu imitieren, wie verschiedene Menschen sprechen und handeln, kommt am Ende doch nur eine brüchige Vertretung dabei heraus, eine angenehme Maske, die einem Ozean unmenschlicher Gedanken aufgesetzt ist.


* Wir halten es für durchaus wahrscheinlich, dass die KI-Unternehmen irgendwann herausfinden werden, wie sie KI-induzierte Psychosen in den Griff bekommen können, indem sie verschiedene Patches und Techniken einsetzen, die die Seltsamkeiten weiter aus dem Blickfeld verdrängen. Dennoch halten wir es für sinnvoll, Fälle von frühen Seltsamkeiten zu beobachten, da sie Hinweise auf die zugrunde liegenden Seltsamkeiten geben, die zum Vorschein kommen würden, wenn eine solche KI jemals zu einer Superintelligenz weiterentwickelt würde. Weitere Informationen zu diesem Thema finden Sie in Kapitel 5.

† Auch hier würde es uns nicht überraschen, wenn das Problem letztendlich weitgehend gelöst würde. Aber ein Patch, der diese besondere Seltsamkeit erfolgreich zurück in den Schrank verbannt, bedeutet nicht, dass die Ursache für diese Seltsamkeit behoben wurde. Das Problem der KI-Psychose ist ein direkter Beweis dafür, dass KIs seltsame, fremdartige Wesen sind, die von seltsamen, fremdartigen Trieben angetrieben werden, die nur am Rande mit den Absichten des Bedieners zu tun haben.

Notes

[1] OpenAI hat es versucht: Aus der Ankündigung von OpenAI zur Einführung von GPT-5:

Insgesamt ist GPT-5 weniger überschwänglich freundlich, verwendet weniger unnötige Emojis und ist in seinen Antworten subtiler und nachdenklicher als GPT-4o. […]

Anfang dieses Jahres haben wir ein Update für GPT-4o veröffentlicht, das das Modell unbeabsichtigt übermäßig unterwürfig oder übertrieben schmeichelhaft oder zustimmend machte. Wir haben die Änderung schnell rückgängig gemacht und seitdem daran gearbeitet, dieses Verhalten zu verstehen und zu reduzieren, indem wir:

  • Entwicklung neuer Bewertungen zur Messung des Schmeichlergrades
  • Verbesserung unseres Trainings, damit das Modell weniger unterwürfig ist, zum Beispiel durch Hinzufügen von Beispielen, die normalerweise zu übertriebener Zustimmung führen würden, und dann durch das Unterrichten, dies nicht zu tun.

In gezielten Schmeichelei-Bewertungen mit speziell entwickelten Eingabeaufforderungen, die schmeichlerische Antworten hervorrufen sollten, reduzierte GPT-5 schmeichlerische Antworten deutlich (von 14,5 Prozent auf weniger als 6 Prozent). Manchmal kann die Reduzierung der Unterwürfigkeit mit einer Verringerung der Benutzerzufriedenheit einhergehen, aber die von uns vorgenommenen Verbesserungen haben die Unterwürfigkeit um mehr als die Hälfte reduziert und gleichzeitig andere messbare Vorteile gebracht, sodass die Benutzer weiterhin hochwertige, konstruktive Gespräche führen können, ganz im Sinne unseres Ziels, Menschen dabei zu helfen, ChatGPT gut zu nutzen⁠.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.