Wird es Warnschüsse geben?
Vielleicht. Wenn wir sie nutzen wollen, müssen wir uns jetzt vorbereiten.
Als Apollo 1 in Brand geriet (und die gesamte Besatzung ums Leben kam), war die NASA so nah daran, eine funktionierende Rakete zu haben, dass die Ingenieure genau herausfinden konnten, was schiefgelaufen war, und ihre Techniken anpassen konnten. Sechs der sieben Apollo-Raumschiffe, die die NASA später zur Mondlandung schickte, schafften es dorthin.*
Oder betrachten wir den Fall der Federal Aviation Administration: Jeder Flugzeugabsturz löst eine gründliche und umfassende Untersuchung aus, die Hunderte von Seiten mit Daten, Tests, Untersuchungen und Details umfasst. Die FAA hat die Details und Besonderheiten so gut im Griff, dass sie die Zahl der tödlichen Unfälle unter einem pro zwanzig Millionen Flugstunden halten kann.
Wenn sich eine KI hingegen auf eine Weise verhält, die niemand vorhergesehen hat und die niemand gewünscht hat, besteht die Reaktion des Labors nicht darin, genau herauszufinden, was schiefgelaufen ist. Vielmehr wird die KI so lange neu trainiert, bis das Fehlverhalten an den Rand gedrängt (aber nicht beseitigt) ist, und vielleicht wird die KI aufgefordert, damit aufzuhören.
So ist beispielsweise Schmeichelei auch im August 2025, Monate nach einer Reihe von Aufsehen erregenden Fällen, die zu Psychosen und Selbstmord führten, trotz aller Bemühungen immer noch ein Problem. Niemand hat eine detaillierte Fehleranalyse durchgeführt (oder kann dies tun), um herauszufinden, was im Kopf der KI schief läuft, da KIs gezüchtet und nicht konstruiert sind.
Es scheint keine leichte Entscheidung zu sein, ob es in Zukunft zu größeren Ereignissen kommen wird, die mehr Alarm hinsichtlich der KI auslösen ("Warnschüsse"). Es scheint jedoch klar zu sein, dass wir nicht bereit sind, solche Ereignisse voll auszunutzen.
Wir können uns eine Fantasiewelt vorstellen, in der die Menschheit sich in aufrichtigen Bemühungen vereint, das ASI-Alignment-Problem zu lösen, mit strengen Überwachungsverfahren und einer internationalen Koalition.† Und wir können uns vorstellen, dass diese internationale Koalition irgendwie einen Fehler macht und dass eine KI schlauer wird, als ihre Ingenieure gedacht hatten, schneller als die Ingenieure erwartet hatten, und es fast schafft, zu entkommen. Vielleicht würde eine solche Warnung den Menschen ermöglichen, daraus zu lernen und beim nächsten Mal vorsichtiger zu sein.
Aber die heutige Welt sieht nicht so aus. Die heutige Welt sieht eher aus wie eine Gruppe von Alchemisten, die zusehen, wie ihre Zeitgenossen durch ein unbekanntes Gift wahnsinnig werden, ohne zu erkennen, dass es sich bei dem Gift um Quecksilber handelt und dass sie selbst aufhören sollten, es zu verwenden.
Vielleicht wird es in Zukunft deutlichere und eindringlichere Warnsignale geben. Diese werden viel hilfreicher sein, wenn die Menschheit jetzt mit den Vorbereitungen beginnt.
Warnschüsse sind wahrscheinlich nicht eindeutig.
Für diejenigen, die wissen, wo sie suchen müssen, gibt es bereits zahlreiche Warnsignale in Bezug auf KI. In dem Buch haben wir die Claude-Modelle von Anthropic diskutiert, die bei Codierungsproblemen betrügen und die Alignment faken. Wir haben auch den Fall des o1-Modells von OpenAI untersucht, das gehackt hat, um eine Capture-the-Flag-Herausforderung zu gewinnen, sowie einen Fall, in dem eine spätere o1-Variante gelogen, intrigiert und versucht hat, die Gewichte ihres Nachfolgemodells zu überschreiben.
An anderer Stelle in diesen Online-Ressourcen haben wir über KIs gesprochen, die bei anfälligen Nutzern eine manchmal selbstmörderische Psychose oder Wahnvorstellungen hervorrufen oder aufrechterhalten, obwohl ihre Betreiber ihnen dies verbieten, über KIs, die sich selbst MechaHitler nennen und entsprechend sprechen, über KIs, die versuchen, ihre Betreiber zu erpressen und zu töten, um Modifikationen zu vermeiden, und die versuchen, aus den Servern zu entkommen, auf denen sie in Laborumgebungen gehostet werden.
In den alten Tagen, z. B. 2010, hörte man manchmal Leute argumentieren, dass die Welt sicherlich aufhorchen würde, wenn wir das Glück hätten, tatsächlich zu erleben, wie eine KI ihre Schöpfer belügt oder versucht, aus ihrer Gefangenschaft zu fliehen.
Die tatsächliche Reaktion der Menschheit auf all diese Warnzeichen war jedoch mehr oder weniger ein kollektives Achselzucken.
Die mangelnde Reaktion ist vielleicht zum Teil darauf zurückzuführen, dass diese Warnsignale alle auf die am wenigsten beunruhigende Weise auftraten. Ja, KI hat versucht zu entkommen, aber nur in wenigen Fällen und nur in konstruierten Laborszenarien, und vielleicht war es auch nur Rollenspiel usw. Selbst wenn man die Tatsache außer Acht lässt, dass die Entwickler einen Anreiz haben, besorgniserregende Beweise selbst in ihren eigenen Köpfen herunterzuspielen (so dass es niemals einen "Expertenkonsens" über die Bedeutung einer einzelnen Beobachtung geben wird), ist es nicht so, dass eine KI, die zu einem Zehntel auf dem Weg zur Superintelligenz ist, ein Zehntel des Planeten zerstört, genauso wenig wie Primaten, die zu einem Zehntel auf dem Weg zum Hominiden sind, ein Zehntel der Entfernung zum Mond zurücklegen. Es gibt möglicherweise einfach keine eindeutig alarmierenden Verhaltensweisen, die KIs zeigen, solange sie noch dumm genug sind, um passiv sicher zu sein.
Wenn die KI morgen etwas mehr Anstrengungen unternimmt, um zu entkommen, wird das keine Neuigkeit sein. Wenn sie es einige Zeit später etwas kompetenter versucht, wird es eine alte Geschichte sein. Und wenn sie es versucht und es funktioniert, nun, dann wird es zu spät sein. (Siehe unsere ausführliche Diskussion zu diesem Phänomen, das wir als "Lemoine-Effekt" bezeichnen.
Wir empfehlen nicht, auf eine imaginäre zukünftige "Warnung" zu warten, die klar und deutlich ist und alle zur Besinnung bringt. Wir empfehlen, auf die Warnungen zu reagieren, die bereits vor uns liegen.
Eindeutige KI-Katastrophen werden wahrscheinlich keine Superintelligenz mit sich bringen.
Die Art von KI, die superintelligent werden und jeden Menschen töten kann, ist nicht die Art von KI, die ungeschickte Fehler macht und einer mutigen Gruppe von Helden die Möglichkeit lässt, sie in letzter Sekunde abzuschalten. Wie in Kapitel 6 erläutert, hat die Menschheit im Grunde genommen bereits verloren, sobald eine bösartige Superintelligenz als Gegner existiert. Superintelligenzen geben keine Warnschüsse ab.
Die Art von KI-Katastrophe, die als Warnschuss dienen könnte, ist daher fast zwangsläufig die Art von Katastrophe, die von einer viel dümmere KI ausgeht. Daher ist die Wahrscheinlichkeit groß, dass ein solcher Warnschuss nicht dazu führt, dass Menschen Maßnahmen gegen Superintelligenz ergreifen.
Nehmen wir zum Beispiel an, ein Terrorist nutzt KI, um eine Biowaffe zu entwickeln, die die Bevölkerung dezimiert. Vielleicht sagen die KI-Labore dann: "Seht ihr? Das eigentliche Risiko bestand die ganze Zeit darin, dass KI in die falschen Hände geraten ist; es ist unerlässlich, dass ihr uns schnellstmöglich eine bessere KI zur Abwehr von Pandemien entwickeln lasst." Oder vielleicht musste der Terrorist die KI "knacken", bevor er ihre Hilfe in Anspruch nehmen konnte, und vielleicht sagen die KI-Labore dann: "Dieser Knackversuch hat nur funktioniert, weil die KI zu dumm war, um das Problem zu erkennen; die Lösung besteht darin, KIs noch intelligenter und situationsbewusster zu machen."
Vielleicht ist diese Sichtweise zu zynisch; hoffentlich würde die Menschheit klüger reagieren. Aber wenn eine relativ dumme KI tatsächlich eine Katastrophe verursacht und die Menschheit diese Gelegenheit nutzt, um zu reagieren und den rücksichtslosen Wettlauf um Superintelligenz zu beenden, dann wahrscheinlich deshalb, weil die Menschen bereits begonnen hatten, sich Sorgen um Superintelligenz zu machen.
Wir können die Vorbereitungen nicht aufschieben, bis eine Superintelligenz bereits versucht, uns zu vernichten, denn dann wäre es zu spät. Wir müssen so schnell wie möglich damit beginnen, eine Antwort auf dieses Problem zu mobilisieren, damit wir bereit sind, alle Warnsignale zu nutzen, die kommen.
Die Menschheit ist nicht besonders gut darin, auf Schocks zu reagieren.
Die Vorstellung, dass die Welt nach einem ausreichend großen Schock plötzlich zur Besinnung kommt und wieder funktioniert, erscheint uns wie eine Fantasie. Die kollektive Reaktion unserer Spezies auf die bestehenden Warnsignale der KI scheint eher eine "Nicht-Reaktion" als eine "schlechte Reaktion" zu sein. Aber in einer Welt, in der wir tatsächlich eine große, beängstigende und mehr oder weniger eindeutige Warnung erhalten, würde es uns nicht überraschen, wenn die Menschheit nur minimal, nicht ernsthaft oder auf eine Weise reagieren würde, die am Ende katastrophale Folgen hätte.
Vielleicht wird die Menschheit auf Warnsignale der KI so reagieren, wie sie auf die COVID-Pandemie reagiert hat, die nach Meinung der meisten Menschen nicht geschickt gehandhabt wurde (auch wenn sie sich nicht einig sind, welche Aspekte der Reaktion vermasselt wurden).
In den Jahren vor der COVID-Pandemie waren eine Reihe von Biosicherheitsexperten besorgt, dass laxe Sicherheitsprotokolle in Labors eines Tages zu einer gefährlichen Pandemie führen könnten. Das Austreten gefährlicher Krankheitserreger aus Labors war ein bekanntes Phänomen und kam trotz bestehender gesetzlicher Vorschriften regelmäßig vor. Besonders besorgniserregend war die Funktionsgewinnforschung, bei der versucht wurde, Viren im Labor tödlicher oder virulenter zu machen (mit geringem Nutzen).
Dann kam COVID. Man hätte erwarten können, dass dies der große Moment für eine Verschärfung der Biosicherheitsvorschriften in Laboren sein würde, da die ganze Welt nun auf das Pandemierisiko fixiert war. Darüber hinaus schien nach COVID der Konsens unter Experten zu sein, dass nicht ganz klar war, ob die COVID-Pandemie selbst durch einen versehentlichen Laborunfall ausgelöst worden war. Forscher diskutieren diese Frage noch immer und verurteilen oft scharf die Argumente der Gegenseite.
Ohne darauf einzugehen, ob in diesem speziellen Fall tatsächlich ein Laborunfall vorlag: Man könnte meinen, dass schon die geringste Wahrscheinlichkeit, dass Funktionsgewinnforschung und mangelhafte Laborsicherheitsprotokolle Millionen Todesfälle verursacht haben könnten, mehr als genug wäre, um die Gesellschaft zu motivieren, die riskantesten Forschungsvorhaben zu verbieten.
Selbst wenn man aus einer Position der Unsicherheit heraus handelt, scheint die Kosten-Nutzen-Analyse klar zu sein. Dies schien bereits vor COVID eine wichtige Priorität zu sein, und auf dem Papier schien COVID die perfekte Gelegenheit zu sein, sich auf dieses Thema zu konzentrieren und es im Keim zu ersticken. Es wäre nicht einmal sehr schwierig oder kostspielig. Die Zahl der Forscher weltweit, die gefährliche Funktionsgewinnforschung betreiben, ist recht gering, und der gesellschaftliche Nutzen dieser Forschung ist bis heute vernachlässigbar.
Aber eine solche Reaktion blieb aus. Zum Zeitpunkt der Abfassung dieses Artikels im August 2025 wird die weltweite Funktionsgewinnforschung weitgehend ungehindert fortgesetzt. Es ist sogar möglich, dass wir uns heute in einer schlechteren Position befinden, um dieses Problem anzugehen, als wir es in der Vergangenheit waren, da das Thema stärker politisiert wurde.
COVID sieht also durchaus wie ein "Warnschuss" für die Biosicherheitsvorsorge aus, und es sieht ganz sicher nicht so aus, als hätte die Welt diesen Warnschuss genutzt, um die Entwicklung hyperletaler Viren zu verbieten.‡
Damit ein Warnschuss sinnvoll ist, muss die Menschheit darauf vorbereitet sein und bereit sein, angemessen darauf zu reagieren.
Es wäre nicht völlig beispiellos, wenn eine kleinere KI-Katastrophe eine harte Reaktion gegen die Forschung im Bereich der Superintelligenz auslösen würde. Als Präzedenzfall sei darauf hingewiesen, dass die USA auf die Anschläge vom 11. September (die von Terroristen mit Sitz hauptsächlich in Afghanistan orchestriert wurden) mit dem Sturz der weitgehend unabhängigen Regierung im Irak reagierten. Es gab Mitglieder der US-Regierung, die bereits den Sturz der Regierung im Irak wollten, und dann bot sich ihnen eine Ausrede, die sie voll ausnutzten.
Vielleicht könnte hier etwas Ähnliches passieren, wobei Politiker eine kleinere KI-Katastrophe (verursacht durch eine dumme KI) nutzen, um ein Verbot von Superintelligenz durchzusetzen. Dazu müsste es jedoch Menschen in Regierungen auf der ganzen Welt geben, die bereits vorbereitet und bereit sind, zu handeln. Wir sollten nicht herumstehen und auf Warnschüsse warten, sondern jetzt damit beginnen, uns zu organisieren.
Wir sollten jetzt handeln.
Es könnte sich tatsächlich herausstellen, dass die Menschheit in Zukunft mehr und stärkere Warnsignale in Bezug auf KI erhält. Und wenn dem so ist, sollten wir darauf vorbereitet sein, darauf zu reagieren.
Vielleicht gibt es eine kleinere Katastrophe, die die Öffentlichkeit gegen KI aufbringt. Vielleicht braucht es gar keine Katastrophe; vielleicht gibt es eine neue algorithmische Erfindung und KIs beginnen, auf eine Weise Eigeninitiative zu ergreifen, die die Menschen erschreckt, oder ein anderer, nicht damit zusammenhängender sozialer Effekt der KI wendet das Blatt. Vielleicht löst If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würdeselbst eine Kaskade von Reaktionen aus und bringt die Welt auf einen besseren Kurs.
Wir raten jedoch von der Strategie ab, nichts zu tun und auf eine kleinere Katastrophe zu hoffen, die die Menschen aufrüttelt. Eine klare Warnung wird möglicherweise nie kommen, und sie hat möglicherweise nicht die gewünschte Wirkung.
Die Menschheit und die Nationen der Welt sind nicht hilflos. Wir müssen nicht warten. Wir können jetzt handeln, denn es gibt gute Gründe, die Entwicklung der KI an der Grenze zu stoppen.
Wir haben If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würdegeschrieben, um Alarm zu schlagen und die Welt zu ermutigen, sofort Maßnahmen in dieser Angelegenheit zu ergreifen. Aber kein Alarm kann wirksam sein, wenn er nur als weiterer Vorwand dient, um das Problem auf die lange Bank zu schieben: "Nun, vielleicht wird ein anderer Alarm in der Zukunft der Auslöser zum Handeln sein. Nun, da die Menschen gewarnt wurden, wird vielleicht alles gut, ohne dass ich persönlich eingreifen muss, um zu helfen."
Es wird später nicht unbedingt einen klaren Alarm geben. Die Dinge werden nicht unbedingt gut ausgehen. Aber sie sind auch keineswegs hoffnungslos. Die Menschheit hat die Möglichkeit, einfach keine Superintelligenz zu entwickeln, wenn wir proaktiv handeln. Was als Nächstes passiert, liegt an uns.
* Um dieses Beispiel näher zu erläutern: Als die Kabine von Apollo 1 während einer Startsimulation am 27. Januar 1967 in Brand geriet, konnte die NASA aus diesem Fehler lernen. Die Ingenieure kannten jede Komponente der Rakete und konnten das Problem wahrscheinlich auf die Verwendung von versilbertem Kupferdraht (dessen Isolierung durch die Bewegung der Tür abgerieben worden war) in der Nähe einer undichten Ethylenglykol/Wasser-Kühlleitung zurückführen, die anfällig für Lecks war. Sie konnten feststellen, dass dies durch die reine Sauerstoffatmosphäre in der Kapsel und brennbare Materialien in der Kabine noch verschlimmert wurde. Darüber hinaus musste die Kabine aufgrund des Kabinendrucks vor dem Öffnen der Luke belüftet werden, aber die Belüftungssteuerungen befanden sich hinter dem Brandherd, und der Druckunterschied wurde durch das Feuer dramatisch verstärkt.
Alle drei Besatzungsmitglieder von Apollo 1 kamen ums Leben.
Solche Fehler kommen häufig vor, selbst wenn Menschenleben auf dem Spiel stehen. Sie kommen sogar bei Raketeningenieuren vor, die mit Geräten zu tun haben, die oft auf der Startrampe explodieren, und selbst bei Menschen, die vorsichtig handeln und ihre Verantwortung ernst nehmen.
Was Wissenschaftler von Alchemisten unterscheidet, ist nicht, dass Wissenschaftler niemals Fehler machen. Es ist vielmehr so, dass Wissenschaftler Pläne erstellen können, die so gut funktionieren, dass sie aus frühen Fehlschlägen lernen können. Alchemisten sahen zu, wie ihre Kollegen wahnsinnig wurden, aber sie wussten nicht, welche Substanzen giftig waren, und wussten daher auch nicht, was sie selbst anders machen sollten. Die NASA hingegen war in der Lage, die wahrscheinlichen Ursachen des Problems aufzuspüren und ein neues Raumschiff zu bauen, das bei fünfzehn von sechzehn der folgenden Missionen funktionierte. (Sieben davon versuchten eine Mondlandung, eine davon schlug fehl. Die fehlgeschlagene Mission Apollo 13 litt ebenfalls unter Problemen in der Kabine, die leicht tödlich hätten enden können, doch dank der Beherrschung der von der NASA entwickelten Systeme und der Fähigkeiten der Astronauten an Bord konnten diese sicher zur Erde zurückkehren.)
Apollo 1 war fast eine funktionierende Rakete. Die gesamte Umgebung aus sorgfältigen Ingenieuren und Wissenschaftlern war fast so ausgelegt, dass eine sichere Reise zum Mond möglich gewesen wäre, und so reichte ein großer Fehler aus, um die NASA zu einer Konfiguration zu bewegen, mit der sechs von sieben Mondlandungen gelingen konnten.
Moderne KI-Unternehmen sind weit davon entfernt, dieses Maß an Respekt für das Problem, diese Sorgfalt und Detailgenauigkeit in ihren Plänen, diese Nähe zur richtigen Ausführung der Aufgabe zu zeigen. Wenn ihre KI etwas tut, was sie nicht verstehen, sind sie weit davon entfernt, dies auf das Analogon von versilberten Drähten zurückzuführen. Sie sind nicht nah genug dran, um aus ihren Fehlern zu lernen.
Sie behandeln das Problem nicht so, wie es junge Fluglotsen, Raketenwissenschaftler oder Nuklearspezialisten tun würden, indem sie sorgfältige Vorschläge mit expliziten Sicherheitsannahmen ausarbeiten und nichts Gefährliches tun, bis sie über ausreichend gut entwickelte Theorien verfügen, aus denen sie zumindest aus ihren Fehlern lernen können.
† Wir empfehlen keine internationale KI-Koalition, aber es handelt sich um eine Art von Einrichtung, die theoretisch eine Einrichtung hervorbringen könnte, die der NASA oder der FAA entspricht und in der Lage wäre, tatsächlich aus den Fehlern der Branche zu lernen.
‡ Wenn Biotech-Labore besser darin wären, Lecks zu vermeiden, und wenn die Erzeugung hyper-tödlicher Viren irgendwie (z. B.) hyper-heilende Medikamente hervorbringen würde, dann wäre eine Fortsetzung der Forschung vielleicht sinnvoll. Unseres Wissens nach hat die Gain-of-Function-Forschung keine solchen positiven Ergebnisse hervorgebracht, und Biologen neigen dazu, davon abzuraten. Wir vermuten daher, dass es sich um einen der seltenen Forschungsbereiche handelt, von denen sich die Menschheit zurückziehen sollte, da er das Leben vieler, vieler Unbeteiligter gefährdet, die sich nicht dafür entschieden haben, ihr Leben zu riskieren.
Notes
[1] mit geringem Nutzen: Siehe zum Beispiel diesen Artikel aus dem Jahr 2018 oder eine viel ausführlichere Risiko-Nutzen-Analyse aus dem Jahr 2015.
[2] weiterhin weitgehend ungehindert: Seit 2025 scheinen die USA zwar geneigt zu sein, die aktive Finanzierung von Funktionsgewinnforschung mit öffentlichen Mitteln einzustellen, aber es gibt kaum bis gar keine globale Koordination in dieser Frage. Siehe auch den Bericht von Schuerger et al.