Tiefe Unterschiede zwischen KI und entwickelten Spezies | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Tiefe Unterschiede zwischen KI und entwickelten Spezies

Vergleich zwischen natürlicher Selektion und Gradientenabstieg

Wie wir in "Menschliche Werte sind kontingent" diskutiert haben, hing die Entwicklung von Liebe und Freundschaft beim Menschen entscheidend von Merkmalen der natürlichen Selektion ab, die insbesondere für den Homo sapiens galten und die beim Gradientenabstieg fehlen.

Das offensichtlichste Problem ist der Datensatz. Aktuelle KIs werden darauf trainiert, synthetische Herausforderungen zu lösen und von Menschen erstellte Texte zu imitieren; sie stehen nicht vor kooperativ-kompetitiven Herausforderungen im Kontext von Jäger- und Sammlergesellschaften, in denen sie sich mit anderen Individuen ihrer Spezies paaren müssen, um ihre Gene weiterzugeben.

Wenn man das hört, ist der nächste Gedanke mancher Leute, sich daran zu machen, synthetische Stammes-Trainingsumgebungen zu schaffen, in der Hoffnung, etwas zu entwickeln, das der Umgebung der Vorfahren der Menschheit ähnlicher ist.

Aber man würde mit ziemlicher Sicherheit nicht die gleichen Ergebnisse erzielen, wenn man die Evolution zweimal durchlaufen würde, beginnend auf der Ebene der Quallen und ganz zu schweigen davon, was passiert, wenn man den Optimierer vollständig von der natürlichen Selektion auf Gradientenabstieg umstellt und ganz auf Gene verzichtet. Wir können einige der Faktoren erahnen, die dazu geführt haben, dass sich die Werte der Menschen so entwickelt haben, wie sie sind. Das bedeutet jedoch nicht, dass wir einen Algorithmus haben, mit dem wir die gleichen Ergebnisse ein zweites Mal reproduzieren können.

Selbst wenn man bei Primaten ansetzen würde statt bei fremdartigen Schauspielerinnen, die darauf trainiert sind, menschliche Texte vorherzusagen (d. h. moderne KIs), müssten wir davon ausgehen, dass es einen oder mehrere entscheidende kausale Faktoren gibt, die Biologen noch nicht herausgefunden haben, mindestens eine Sache, die wir übersehen, sodass die Fachartikel in zwanzig Jahren etwas anderes sagen werden als heute (wenn wir dann alle noch leben). Evolutionsbiologen befinden sich derzeit in der Phase, in der sie verschiedene Vermutungen darüber anstellen, wie sich diese Merkmale entwickelt haben, und nicht in der Phase, in der sie eine vollständige Theorie festlegen, geschweige denn eine präzise, deterministische Theorie.

Und über die oberflächlichen Unterschiede in den Trainingsumgebungen hinaus vermuten wir, dass es in diesem Fall wichtig ist, dass die natürliche Selektion das Genom optimiert und die Gradientenabstiegsmethode jeden Parameter im Verstand der KI direkt optimiert.

Die natürliche Selektion muss ein kleines, komprimiertes Genom verwenden, um ein ganzes, weitläufiges Gehirn zu erzeugen. Sie muss ihre Informationen durch einen engen Engpass zwängen. Freundlich auszusehen war in den Tagen unserer Vorfahren eine wichtige Eigenschaft für das Überleben und den Erfolg. Gene, die echte Freunde konstruieren, sind ein einfacher Hack, um Organismen zu schaffen, die für andere Mitglieder ihrer Spezies wie gute Freunde aussehen und die natürliche Selektion bevorzugt einfache Lösungen viel stärker als der Gradientenabstieg.

Die natürliche Selektion schafft manchmal Akteure, denen Ehrlichkeit wirklich wichtig ist (wenn auch nicht immer). Sie schafft solche Akteure, weil sie keine vollständigen Anleitungen zum Lügen kodieren kann und wir in vielen Situationen zunächst ehrlich wirken mussten, bevor wir klug genug waren, um herauszufinden, wann Lügen sicher ist, bevor wir die Möglichkeit hatten, nur dann ehrlich zu sein, wenn es sich lohnt. Das liegt zum Teil daran, dass die natürliche Selektion mit nur einer Handvoll Genen auskommen musste.

Der Gradientenabstieg kann jedoch eine enorme Anzahl von Konversationsmustern kodieren. Es gibt immer noch eine gewisse Tendenz zu einfacheren, leichter zu konvergierenden Lösungen, aber der Gradientenabstieg wirft ein viel, viel breiteres Netz aus.

Oder allgemeiner gesagt: Ehrlichkeit und Freundschaft sind Fälle, in denen wir uns nicht mit irgendeinem Gleichgewicht zwischen Agenten zufrieden geben, das die Gradientenabstiegsmethode finden könnte. Es gibt andere Lösungen für die Probleme, die Freundschaft und ein unbedingtes Streben nach Ehrlichkeit beim Menschen gelöst haben. Selbst wenn die Trainingsumgebung von KIs genau der von Menschen entspräche, sollten wir nicht die gleichen Ergebnisse erwarten, wenn sie durch Gradientenabstieg statt durch natürliche Selektion geprägt würden.

Selbst die meisten entwickelten Organismen sind in dieser Hinsicht nicht wie Menschen! Es scheint also ziemlich vorhersehbar, dass Gradientenabstieg nicht die gleichen Lösungen finden wird wie die Evolution, geschweige denn die gleichen Lösungen wie die Evolution, die auf bestimmte Populationen früher Primaten wirkt.

Optimierung ist kein magisches Ritual, bei dem man ein paar Schlüsselzutaten hinzufügt, die eine sympathische Beziehung zu einem Archetyp haben, und dann genau diesen Archetyp zurückbekommt. Der Versuch, KI-Agenten in Jäger- und Sammlerumgebungen zu züchten, wird nicht zu erkennbaren Menschen führen.

Natürlich kann man ein LLM so feinabstimmen, dass es vorhersagt, was Menschen darüber sagen werden, wie schrecklich es ist, einen Freund zu verraten. Das hat jedoch nichts mit dem Problem zu tun, das die natürliche Selektion durch die Optimierung von Genen gelöst hat, indem sie zumindest einige Menschen hervorgebracht hat, die ihre Freunde nicht verraten würden. Vielmehr gleicht die "Erfahrung" des LLM eher dem Eingesperrtsein in einer Kiste, wo man aufgefordert wird, eine Unterhaltung zwischen zwei extrem fremdartigen Wesen vorherzusagen, die ihm weniger ähnlich sind als einer Qualle, und wo man Billionen von Beispielen für fremdartige Unterhaltungen und Billionen von Stunden Zeit bekommt, um das herauszufinden.

Um dieses Problem lösen zu können, ist zwar eine gewisse Form von Intelligenz erforderlich. Aber man muss sich nicht betrinken, um vorherzusagen, was fremde Wesen ("Menschen") sagen werden, wenn sie betrunken sind.* Man muss nicht wirklich freundlich sein, um Freundlichkeit zu verstehen oder das Verhalten freundlicher Wesen vorherzusagen und nachzuahmen.

LLMs und KI um 2024 "Oberflächlichkeit"

In den Ressourcen zu Kapitel 1 haben wir festgestellt, dass KI heute in gewisser Weise immer noch oberflächlicher zu sein scheint als Menschen. Der Vergleich mit der natürlichen Selektion liefert eine mögliche Erklärung dafür, warum das so sein könnte.

Gradientenabstieg hat viel mit natürlicher Selektion gemeinsam, da es sich bei beiden um Optimierer handelt, die blind innere Parameter anpassen, um ein gewünschtes äußeres Verhalten zu erzeugen. Aber Gradientenabstieg und Evolution unterscheiden sich in einigen wichtigen Punkten und der wichtigste Unterschied (von dem wir wissen) besteht darin, dass Gradientenabstieg einen viel größeren Informationsengpass hinsichtlich der Menge der Muster hat, die er lernen kann.

Die natürliche Selektion, die auf Hominiden wirkt, konnte pro Generation nur eine Handvoll informationstheoretischer Bits lernen. Die natürliche Selektion musste alles, was sie gelernt hatte, in 3 Milliarden DNA-Basen oder etwa 750 Megabyte unterbringen, von denen ein Großteil aus sich wiederholender Junk-DNA besteht. Es gibt mathematische Grenzen dafür, wie viel die natürliche Selektion in einer einzigen Generation lernen kann. Jedes einzelne Merkmal, das die natürliche Selektion in die Gehirne der Hominiden eingebaut hat, musste in eine Handvoll Gene kodiert werden, die die Bildung späterer neuronaler Schaltkreise beeinflussen würden.

Gradientenabstieg ist ganz anders. Jedes Mal, wenn Gradientenabstieg eine neue Gruppe von Tokens sieht, berechnet er den Gradienten jedes einzelnen von Milliarden oder Billionen Parametern in Bezug auf diese Gruppe von Tokens und berechnet, um wie viel besser oder schlechter die Vorhersagen der gesamten KI gewesen wären, wenn jeder Parameter ein wenig anders gewesen wäre. In der Praxis, nicht nur im Prinzip, kann Gradientenabstieg viel mehr Informationen aus tausend Token-Gruppen lernen, als die natürliche Selektion über tausend Generationen in Genen kodiert.†

Wir können diese Beobachtung mit einer weiteren wichtigen Tatsache über (die öffentlich bekannten) LLM-Architekturen von 2024 kombinieren: Ihre Rechentiefe pro Token ist begrenzt.

Llama 3.1 405B hat 126 Schichten. Jede dieser Schichten umfasst etwa vier serielle Operationen.‡

Jedes Mal, wenn Llama das bereits Gesagte überprüft und ein neues Ausgabetoken berechnet, umfasst diese Berechnung höchstens ~500 serielle Schrittem obwohl es Milliarden von parallelen Operationen gibt, die dieser seriellen Grenze unterliegen. Um längere serielle Berechnungen als 500 kognitive Schritte durchzuführen, muss Llama Token ausgeben, die das Ergebnis vorheriger Überlegungen sind, und dann davon abhängig neue Operationen durchführen.§

Unsere wilde Vermutung wäre also, dass Llama 3.1 405B, anders als alles, was es in der Biologie gibt, eine riesige Sammlung relativ oberflächlicher, gespeicherter Richtlinienmuster ist, jedoch mit vielen optimierten Überschneidungen, Interaktionen und Kohärenzen zwischen diesen Richtlinienmustern (plus einigen wirklich tieferen kognitiven Strukturen, die jedoch noch immer eine begrenzte Rechentiefe haben).

Diese Tatsache liefert eine mögliche Erklärung für die offensichtliche Oberflächlichkeit der aktuellen LLMs. (Wir räumen ein, dass es viel schwieriger ist, zu sagen, dass die LLMs von 2025 im Vergleich zu den LLMs von 2023 und 2024 "oberflächlich" sind.

Normalerweise ist es nicht zulässig, KI als Menschen mit Hirnschäden zu betrachten. Aber einige engere Analogien wie diese sind hier vielleicht hilfreich. Beispielsweise sind LLMs aus dem Jahr 2024 speziell wie Menschen mit anterograder Amnesie: Sie erinnern sich an Ereignisse bis zu ihrem Trainingsstichtag, aber nicht daran, was Sie ihnen gestern gesagt haben.

In gleicher Weise könnte es nützlich sein, sich LLMs aus dem Jahr 2024 (nicht alle möglichen zukünftigen KIs im Allgemeinen) als Wesen vorzustellen, die sich an viele vergangene menschenähnliche Erfahrungen erinnern, aber aufgrund einer Hirnschädigung nicht in der Lage sind, neue Gedanken zu entwickeln, die so tiefgründig sind wie die tiefsten Gedanken, an die sie sich erinnern können.

Bei den früheren LLMs, GPT-3 oder GPT-3.5, war dies viel offensichtlicher. Wir würden niemandem, der nur die neuesten LLMs verwendet hat, einen Vorwurf machen, wenn er dies im Jahr 2025 oder später liest und sich fragt, ob wir uns dies in einem verzweifelten Versuch, an einem menschlichen Überlegenheitsgefühl festzuhalten, ausdenken. Viele haben sich zuvor in dieser Hinsicht geirrt.

Aber das ist immer noch die Organisationstheorie, oder besser gesagt, die wilde Vermutung, die Ihre Autoren verwenden, um LLMs im Jahr 2024 zu verstehen. Diesen Modellen fehlt eine gewisse Tiefe, und sie gleichen diesen Nachteil aus, indem sie sich eine Vielzahl von Mustern merken. Nicht nur Fakten, sondern auch Fertigkeitsmuster, Sprachmuster und Politikmuster.

Die Muster, die in die besten öffentlichen LLMs von 2024 eingeflossen sind, sind nicht so oberflächlich, wie wir vermuten würden. Sie befinden sich nicht auf dem außergewöhnlich bescheidenen Niveau einer Sphex-Wespe, um ein Beispiel aus den Online-Ressourcen in Kapitel 3 zu verwenden; vielleicht ähneln sie eher den Mustern, die ein Biberverstand verfolgen und verarbeiten kann.

Die erlernten kognitiven Fähigkeiten eines LLM können 500 aufeinanderfolgende Schritte durchlaufen, noch bevor man ihre Fähigkeit berücksichtigt, laut zu denken und ihre eigenen Gedanken zu hören. 2024-LLMs verfügen über eine gewisse Fähigkeit, sich Dinge vorzustellen, vorherzusagen und zu planen, ähnlich wie die (tatsächlich recht beeindruckende) Erkenntnis eines Bibers, der einen Damm baut. Aber unserer Meinung nach scheinen LLMs zumindest in einigen wichtigen Punkten noch nicht ganz auf dem Niveau eines Menschen zu sein.

Was heute für KI gilt, muss jedoch nicht unbedingt auch in einem Jahr oder einem Monat noch gelten. Diese Spekulationen sind interessant, aber während wir diesen Abschnitt im August 2025 fertigstellen, erscheinen uns die KIs von heute etwas weniger oberflächlich als die KIs von 2024; und diese wiederum schienen weniger oberflächlich und weniger engstirnig zu sein als die KIs von 2023.

Vielleicht wird die Lücke durch stetige Iterationen an Basis-LLMs langsam geschlossen werden; oder vielleicht wird die Lücke durch die Suche nach besseren Trainingsmethoden für die langen "Argumentationsketten" in modernen Argumentationsmodellen wie o1 (beschrieben in Kapitel 3) oder dessen Nachfolger o3 geschlossen werden; oder vielleicht wird eine brandneue architektonische Erkenntnis die Lücke über Nacht schließen. Dieser Teil der Zukunft ist nicht leicht vorherzusagen.

Aber früher oder später wird sich die Lücke schließen, wenn die internationale Gemeinschaft nichts unternimmt. Der Welt läuft die Zeit davon, um zu handeln.

* Weitere Informationen zu diesem Thema finden Sie in unserer Antwort auf die Frage “Werden LLMs nicht wie die Menschen in den Daten sein, mit denen sie trainiert werden?“

† Andererseits: Die natürliche Selektion kann in einigen Fällen tiefgreifendere, leistungsfähigere Tricks lernen. Die natürliche Selektion berücksichtigt alle alternativen Möglichkeiten, wie Gene Organismen aufbauen können. Der Gradientenabstieg optimiert Parameter, die ein festes Gerüst von neuronalen Netzwerkoperationen ausfüllen.

‡ Abfrage-Schlüssel-Wert-Aktivierungsvektoren, gefolgt von Aufmerksamkeit, gefolgt von einem zweistufigen Feedforward-Netzwerk.

§ Möglicherweise unterscheiden sich die proprietären Architekturen. Forscher veröffentlichen ständig neue Vorschläge, um die Grenzen der seriellen Operation zu durchbrechen. Aber keine der veröffentlichten Methoden hatte sich bis Dezember 2024 in Open Source durchgesetzt. (Allerdings produzieren die Ende 2024 erschienenen “Reasoning-Modelle” natürlich viel mehr serielles Denken, indem sie ihre vorherigen Token betrachten. Dies ist also keine Einschränkung dessen, was KI nach der Vor-Trainingsphase leisten kann, sondern eine Einschränkung während des Vor-Trainings.)

 Tatsächlich warnen wir vor generischen biologischen Analogien im weiteren Sinne. Anfang 2023 mag es verlockend gewesen sein, zu behaupten, dass sich LLMs in der Großen Kette des Seins noch im Stadium kleiner Säugetiere, oder sogar im Stadium von Eidechsen oder Insekten, befänden, was jedoch dadurch verschleiert würde, dass LLMs insbesondere auf englische Konversationen spezialisiert seien, so wie Bienen insbesondere auf den Bau von Bienenstöcken spezialisiert sind. Wir sind der Meinung, dass diese Analogie selbst Anfang 2023 bestenfalls weit hergeholt gewesen wäre. Nicht weil Transistoren sich so sehr von Biochemikalien unterscheiden, sondern weil sich Gradientenabstieg und natürliche Selektion, wie wir bereits diskutiert haben, so sehr unterscheiden. Spezifische und enge Analogien können manchmal nützlich sein, um Intuition aufzubauen, aber wir empfehlen, sie mit Vorsicht zu verwenden.

Notes

[1] nicht wie Menschen: Löwen beispielsweise töten regelmäßig die Jungen anderer Tiere, damit sie selbst mehr Junge bekommen können. Viele andere Tiere, darunter Säugetiere und einige Primaten, verhalten sich ähnlich.

[2] Mathematische Grenzen: Grenzen der Komplexität von Organismen werden in “Adaptation and Natural Selection“ (Williams 1966) diskutiert.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.