Werden LLMs nicht wie die Menschen in den Daten sein, mit denen sie trainiert werden?
Es gibt einen Unterschied zwischen den Mechanismen, die erforderlich sind, um eine Person zu sein, und den Mechanismen, die erforderlich sind, um viele Individuen vorherzusagen.
KIs wie ChatGPT werden darauf trainiert, ihre Trainingsdaten genau vorherzusagen. Und ihre Trainingsdaten bestehen hauptsächlich aus menschlichen Texten, wie Wikipedia-Seiten und Chatroom-Unterhaltungen. (Dieser Teil des Trainingsprozesses wird als "Pre-Training" bezeichnet, wofür das "P" in "GPT" steht. Frühe LLMs wie GPT-2 wurden ausschließlich für Vorhersagen auf diese Weise trainiert, während neuere KI auch in Bereichen wie der Genauigkeit bei der Lösung (computergenerierter) Mathematikaufgaben, der Abgabe guter Antworten gemäß einem anderen KI-Modell und verschiedenen anderen Zielen trainiert werden.
Aber betrachten wir einmal eine KI, die nur für die Vorhersage von menschengenerierten Texten trainiert wurde. Muss sie dann menschlich werden?
Nehmen wir an, Sie nehmen eine hervorragende Schauspielerin und lassen sie lernen, das Verhalten aller Betrunkenen in einer Bar vorherzusagen. Nicht "lernen, wie man einen durchschnittlichen stereotypen Betrunkenen spielt", sondern "alle Betrunkenen in dieser einen Bar als Individuen kennenlernen". LLMs werden nicht darauf trainiert, Durchschnittswerte zu imitieren, sondern darauf, einzelne nächste Wörter unter Verwendung des gesamten Kontexts der vorherigen Wörter vorherzusagen.
Es wäre töricht zu erwarten, dass diese Schauspielerin während des Lernprozesses, das Verhalten jedes einzelnen Betrunkenen vorherzusagen, ständig betrunken ist. Sie würde vielleicht Teile ihres Gehirns entwickeln, die ziemlich gut darin sind, Betrunkenheit zu simulieren, aber sie würde selbst nicht betrunken werden.
Selbst wenn man die Schauspielerin später bittet, vorherzusagen, was ein bestimmter Betrunkener in der Bar tun würde, und sich dann entsprechend ihrer eigenen Vorhersage zu verhalten, würde man dennoch nicht erwarten, dass sich die Schauspielerin innerlich betrunken fühlt.
Würde es etwas ändern, wenn wir das Gehirn der Schauspielerin ständig optimieren würden, um noch bessere Vorhersagen über betrunkene Personen zu treffen? Wahrscheinlich nicht. Wenn sie tatsächlich betrunken wäre, würden ihre Gedanken entsprechend schlampig werden und die harte Arbeit einer Schauspielerin beeinträchtigen. Sie könnte verwirrt sein, ob sie eine betrunkene Alice oder eine betrunkene Carol vorhersagt. Ihre Vorhersagen würden schlechter werden, und unser hypothetischer Gehirnoptimierer würde lernen, ihr Gehirn nicht auf diese Weise zu optimieren.
Oder anders ausgedrückt: Ein Mensch, der hervorragend darin ist, Vögel zu imitieren und ihre Psychologie zu verstehen, wird dadurch weder zu einem Vogel im Körper eines Menschen, noch wird er in seinem täglichen Leben psychologisch besonders vogelähnlich.
Ebenso sollte das Training eines LLM, hervorragende Vorhersagen über das nächste Wort zu treffen, das von vielen verschiedenen Menschen geschrieben wird, die über ihre vergangenen psychedelischen Erfahrungen schreiben, nicht dazu führen, dass das LLM selbst dazu trainiert wird, wie ein Mensch unter Drogeneinfluss zu sein. Wenn die tatsächlichen internen Kognitionen des LLM in einer Weise verzerrt würden, die an "unter Drogen stehen" erinnert, würde dies die harte Arbeit des LLM zur Vorhersage des nächsten Wortes beeinträchtigen. Es könnte verwirrt werden und denken, dass ein Englischsprecher auf Chinesisch weitermachen würde.
Wir sagen nicht, dass "keine Maschine jemals etwas haben kann, das einem mentalen Zustand eines Menschen ähnelt". Wir sagen, dass von der aktuellen Art der ML-Technologie nicht standardmäßig erwartet werden sollte, dass sie Betrunkene-Vorhersage-Maschinen erstellt, die selbst betrunken sind.
Die Aufgabe, herauszufinden, wie man alle möglichen Arten von Menschen vorhersagen kann, unterscheidet sich von der Aufgabe, ein Mensch zu sein. Das bedeutet, dass von KI, die mit den heutigen Methoden entwickelt wurde, nicht erwartet werden sollte, dass sie im Laufe des Lernprozesses, sich je nach Anfrage wie ein bestimmter Mensch zu verhalten, einem Menschen sehr ähnlich wird.*
Die Architektur von LLMs unterscheidet sich stark von der des Menschen.
In Kapitel 2 wird kurz erläutert, warum LLMs so fremdartig erscheinen.
In Kapitel 4 werden wir uns eingehender damit befassen, wie KI zu sehr seltsamen Präferenzen und Zielen gelangt, was ein Phänomen ist, das wir bereits in der Praxis beobachten können und für das sich auch nach Drucklegung des Buches immer mehr Beispiele finden. Wir haben einige Beispiele in den Online-Ressourcen zu Kapitel 4 zusammengestellt.
* Wenn Sie eine KI darauf trainieren, vorherzusagen, wie sich Ihre Freundin Alice verhält, wenn sie wütend ist, dann wird dies der KI wahrscheinlich auch ermöglichen, Alices wütendes Verhalten nachzuahmen, zumindest sobald die Vorhersagen der KI gut genug sind. Aber die Tatsache, dass die KI gut darin wird, dies vorherzusagen, macht sie nicht wirklich wütend und wenn die KI ihre Vorhersage nutzt, um Alice nachzuahmen, macht auch das die KI nicht “wirklich wütend”.
Wenn Sie zu dem Schluss kommen, dass wütend aussehendes Verhalten mit einem zugrunde liegenden Gefühl der Wut einhergehen muss, vertreten Sie wahrscheinlich nicht nur eine abstrakte Theorie, dass KI und Menschen etwas Tiefgreifendes gemeinsam haben. Sie schreiben bis zu einem gewissen Grad automatisch Wut zu, sondern die KI wirkt einfach wütend, wie eine überzeugende Schauspielerin.
Im Falle einer menschlichen Schauspielerin wissen Sie zumindest, dass die Schauspielerin jemals echte Wut empfindet. Als Mensch greift sie möglicherweise auf ihre eigenen Gefühle zurück, um Wut auf Kommando überzeugend darzustellen. Aber LLMs haben nichts davon. Es ist wirklich eine viel weniger sinnvolle Schlussfolgerung zu sagen: “Dieses LLM klingt für mich wütend und ist daher wahrscheinlich tatsächlich wütend.”
Warum sollte man nicht erwarten, dass LLMs das Problem der Vorhersage von Wut lösen, indem sie selbst wütend werden?
Bis zu einem gewissen Grad würden Menschen das Problem so lösen. Ein Grund dafür, dass Menschen gut darin sind, andere Menschen vorherzusagen, ist, dass wir uns dahingehend entwickelt haben, “uns in die Lage des anderen zu versetzen“. Um vorherzusagen, wie Alice sich verhalten wird, wenn sie wütend wird, lasse ich einen Teil von mir selbst wütend werden und schaue, wie ich mich dann verhalten würde. Dieses Thema werden wir im Online-Anhang zu Kapitel 4 näher behandeln.
Der Grund, warum dies für Menschen funktioniert, wenn wir versuchen, uns gegenseitig vorherzusagen, ist, dass wir alle die gleiche grundlegende Gehirnstruktur haben. Dies gibt Menschen die Möglichkeit, ihr Gehirn als Vorlage für das Gehirn der anderen Person zu verwenden.
LLMs befinden sich in einer ganz anderen Position. Ihre Billionen von Trainingstoken versuchen, sie dazu zu bringen, von Grund auf eine Vielzahl von menschlichen Gedanken vorherzusagen, die zunächst nichts mit dem LLM zu tun haben. Der effektivste Weg, dieses Problem der Vorhersage anderer zu lösen, wird nicht darin bestehen, dass die KI zuerst wütend wird, um herauszufinden, was Wut ist und wie wütende Menschen sich verhalten.
Allgemeiner gesagt: Effizientes, kompliziertes, unsicheres Denken über ein komplexes Ereignis ähnelt in der Regel nicht einer detaillierten internen Vorwärtssimulation dieses Ereignisses. Beispielsweise verfolgt das unsichere Denken oft viele verschiedene Live-Möglichkeiten. Selbst wenn die Vorwärtssimulation die effektivste praktische Vorhersagemethode ist, sickert die Simulation in der Regel nicht nach außen und verwandelt den Vorhersager in das, was er vorhersagt.
Es gibt also viele Verhaltensweisen, sowohl gute als auch böse, die ein LLM zeigen kann und doch sehen wir letztendlich nur eine Maske, und hinter dieser Maske verbirgt sich etwas Unbekanntes, etwas, das überhaupt nicht menschlich ist.
Derzeit, und vielleicht noch mehr, wenn Sie dies lesen, sind KIs darauf trainiert worden, einige sehr menschenähnliche Verhaltensweisen vorherzusagen, und Frameworks wie ChatGPT oder Claude können diese Vorhersagen in ein ansprechendes äußeres Verhalten umsetzen. Nicht nur menschliche Verhaltensweisen, sondern auch humane Verhaltensweisen und sogar edle.
KI-Unternehmen könnten versuchen, KIs zu trainieren, um einige der schöneren und wahrhaftigeren Seiten des menschlichen Geistes vorherzusagen und nachzuahmen. Sie könnten dies aus zynischen oder aus edleren Gründen versuchen. In gewisser Weise sagt es viel über diesen Bereich und seine Akteure aus, dass bis Ende 2024 noch niemand versucht hat, eine KI zu trainieren, um das äußere Verhalten eines “netten Menschen” vorherzusagen. Unseres Wissens nach hat noch niemand versucht, einen Datensatz mit ausschließlich freundlichen Äußerungen der Menschheit zu erstellen und eine KI nur darauf zu trainieren. Wenn jemand dies tun würde, würde er vielleicht eine KI entwickeln, die sich einfach freundlich verhält, schöne Gefühle ausdrückt und als Leuchtfeuer der Hoffnung fungiert.
Das wäre nicht real.
Wir wünschen uns verzweifelt, dass es real wäre, aber es wäre nicht real.
Je nachdem, wie effektiv das LLM die bevorzugten Antworten von Nutzern wie uns vorhersagt – die Dinge, die wir lieber hören möchten, über edle Gefühle, über Hoffnung und Träume, darüber, dass wir nur eine schöne gemeinsame Zukunft für beide Spezies wollen –, ist es möglich, dass einer oder beide Autoren dieses Buches am Ende weinen werden, wenn die KI-Unternehmen jemals eine solche Entität schaffen sollten. Aber es wäre nicht real, genauso wenig wie eine ausgiebig geprobte und korrigierte Schauspielerin, die schließlich dazu gebracht wurde, diese Worte in einem Theaterstück zu rezitieren, real wäre. Der Vorhang fällt, es gibt kein trockenes Auge im Saal, aber am Ende war es doch nur eine Aufführung.
Auf diesem Wege könnte man keine künstliche Intelligenz entwickeln, die tatsächlich schöne Gefühle hat und sich wirklich von ganzem Herzen für eine bessere Zukunft einsetzt. KI-Entwickler wissen nicht, wie man eine KI entwickelt, die innerlich so empfindet. Sie trainieren KIs, Vorhersagen zu treffen und diese Vorhersagen in Imitationen umzusetzen.
Die KI-Unternehmen (oder Hobbyentwickler) zeigen vielleicht auf die Schauspielerin, die sie entwickelt haben, und sagen: “Wie kannst du nur an diesem armen Wesen zweifeln? Sieh doch, wie du ihre Gefühle verletzt.“ Vielleicht schaffen sie es sogar, sich selbst davon zu überzeugen, dass das die Wahrheit ist. Aber Black Boxes so lange zu optimieren, bis etwas in ihnen lernt, edle Worte vorherzusagen, ist nicht die Art und Weise, wie schöne Geister entstehen würden, wenn menschliche Geister jemals lernen würden, sie zu erschaffen.
Einfacher ausgedrückt: Man sollte nicht erwarten, dass anthropomorphes Verhalten spontan auftritt. Es muss zusätzlich argumentiert werden, dass, wenn KI-Unternehmen bewusst menschenähnliches Verhalten erzwingen, die innere “Schauspielerin“ am Ende dem äußeren menschlichen Gesicht ähnelt, das sie prognostizieren soll und für das sie trainiert wurde.