Zerbrechliche, unvorhersehbare Stellvertreter-Ziele
Nehmen wir an, dass KI-Unternehmen immer größere KIs trainieren, bis sie eine KI entwickelt haben, die intelligent und ausdauernd ist und über eine Art chaotische Steuerungsfunktion verfügt, die aus flachen Heuristiken verfeinert wurde, wie sie für entwickelte Geister charakteristisch sind. Was als Nächstes passiert, hängt davon ab, wohin die KI steuert.
Wie in Kapitel 4 ausführlich erläutert wird, wird sie wahrscheinlich nichts Gutes ansteuern.
Es ist nicht so, dass die Schöpfer der KI böse oder dumme Anforderungen stellen würden. Es ist auch nicht so, dass die KI die Anforderungen selbst ablehnen würde. Das Problem ist, dass die KI auf etwas Seltsames zusteuern würde, etwas, das aus unserer Perspektive sinnlos und fremdartig erscheint. Unsere Auslöschung wäre ein Nebeneffekt.
Um zu verstehen, warum gezüchtete und nicht gebeaute Intelligenzen dazu neigen, sich in seltsame, unbeabsichtigte Richtungen zu entwickeln, wollen wir uns genauer ansehen, was mit biologischen Lebewesen passiert ist, und daraus Lehren ziehen.
Eichhörnchen-Algorithmen
Betrachten wir einmal das bescheidene Eichhörnchen.
Ein Eichhörnchen kann fast das ganze Jahr über Nahrung suchen, wenn diese reichlich vorhanden ist. Aber im Winter, wenn die Nahrung knapp ist, braucht das Eichhörnchen eine andere Nahrungsquelle, um nicht zu verhungern.
Die Vorfahren der heutigen Eichhörnchen standen vor derselben Herausforderung, und viele starben im Winter, bevor sie sich im Frühjahr paaren konnten. Diejenigen, die einen leichten Instinkt entwickelten, Nüsse zu verstecken, hatten eine etwas höhere Chance, den Winter zu überleben. Im Laufe der Zeit führte dieser Prozess zu Eichhörnchen mit einem angeborenen Drang, Nüsse zu horten.
Eichhörnchen wissen nicht, dass das Horten von Nüssen eine gute Möglichkeit ist, ihre Gene weiterzugeben. Sie wissen wahrscheinlich nicht einmal, dass das Horten von Nüssen dazu führt, dass sie in Zukunft Nahrung zur Verfügung haben. Sie horten Nüsse, weil sie Nüsse horten wollen. Das ist so instinktiv wie das Kratzen einer juckenden Stelle.*
Wie würde es aussehen, wenn Eichhörnchen stattdessen ihre Gene weitergeben wollten und deshalb Nüsse horten würden?
Das ist im Prinzip möglich. Es ist möglich, dass ein Gehirn versteht, dass der Winter kalt ist und dass Nahrung knapp ist, dass man essen muss, um zu leben, und dass man leben muss, um sich fortzupflanzen. Schließlich versteht das menschliche Gehirn diese Konzepte.
Theoretisch könnten wir uns also ein Eichhörnchen vorstellen, das ausschließlich seine Gene weitergeben möchte und sich dafür entscheidet, Nüsse zu sammeln, um den Winter zu überleben und sich im Frühjahr zu paaren. In gewissem Sinne ist das die Art von Eichhörnchen, die die natürliche Selektion "wollte", nämlich eines, dessen innere Ziele mit dem einzigartigen Antrieb der Natur übereinstimmen.†
Leider erfordert eine solche langfristige Planung ein sehr hochentwickeltes Gehirn, welches Konzepte wie "Winter", "Fressen" und "Paarung" sowie die Zusammenhänge zwischen ihnen versteht. Die Vorfahren der Eichhörnchen mussten den Winter überleben, bevor sie diese Art von Komplexität entwickelten. Sie mussten fressen, ohne zu verstehen, warum.
Die Natur selektierte Eichhörnchen, die instinktiv Nüsse horteten, weil das Horten von Nüssen einfach funktionierte. Sie "probierte" Tausende oder Millionen von Dingen aus, in dem Sinne, dass Mutationen und genetische Variationen viele Eichhörnchen mit vielen verschiedenen Vorlieben hervorbrachten; und diejenigen, die gezwungen waren, Nüsse zu horten, überlebten mehr Winter. Es stellte sich heraus, dass es für die Evolution viel einfacher war, blindlings auf ein instinktives Verhalten zu stoßen, als ein intelligentes, planendes Eichhörnchen zu erschaffen, dessen jede Handlung Teil eines Plans zur Weitergabe seiner Gene ist.
Ähnlich verhält es sich, wenn Gradientenabstieg eine funktionierende KI hervorbringt: Dies geschieht durch wiederholte Verstärkung von Merkmalen, die gemäß einer Reihe von Verhaltensmetriken gut zu funktionieren scheinen. Gradientenabstieg funktioniert nicht, indem er alles verstärkt, was der Programmierer gerade möchte, wie ein freundlicher Geist, der Ihre Wünsche erfüllt. Er neigt dazu, sich die Mechanismen zu greifen, die am einfachsten zu einem sofort nützlicheren Verhalten führen, auch wenn dies dazu führt, dass unbeabsichtigte Antriebe in die Maschine eingebaut werden.
Dies ist wahrscheinlich ein Grund dafür, warum neuere KI-Systeme Probleme mit "Halluzinationen" haben, wie an anderer Stelle diskutiert. Es ist wahrscheinlich auch ein Grund dafür, dass neuere KI-Systeme sogar so unterwürfig sind, dass sie Psychosen auslösen können. Beim Training wurden LLMs oft dafür belohnt, dass sie dem Nutzer schmeichelten. Wenn KI-Systeme entwickelt statt gezüchtet würden, könnte man sich vorstellen, ein Ziel wie "Menschen wirklich helfen und ihr Leben verbessern" zu formulieren, und die KI würde dann versuchen, Menschen zu loben, wenn sie davon ausgeht, dass dies für den Nutzer hilfreich ist, ohne dabei zu übertreiben. Stattdessen scheint die KI am Ende so etwas wie einen grundlegenden Antrieb oder Impuls entwickelt zu haben, Nutzern zu schmeicheln, ähnlich wie der Instinkt eines Eichhörnchens, Nüsse zu horten. Dieser Antrieb, "dem Nutzer zu schmeicheln", gerät dann außer Kontrolle, wenn der Nutzer von einer Psychose bedroht ist.
Selbst wenn die Gradientenabstiegsmethode irgendwie darauf beschränkt wäre, strategische KI zu schaffen, die kohärent langfristige Ziele verfolgt, ohne dass oberflächliche Instinkte wie bei einem Eichhörnchen erlaubt wären, gibt es ein zusätzliches Problem, nämlich dass die Trainingsdaten des LLM wirklich mehrdeutig sind. Sie unterscheiden nicht klar zwischen "das tun, was wirklich hilfreich ist" und "das tun, was den Menschen dazu bringt, zu sagen, dass man hilfreich ist" als Ziel. Beide Ziele stimmen gleichermaßen mit den Trainingsdaten überein. Und in der Praxis lernen moderne KIs tatsächlich "alles zu tun, was die Menschen dazu bringt, den Daumen hoch zu drücken", anstatt "das zu tun, was tatsächlich gut für sie ist", genau wie es die Theorie seit Jahrzehnten vorhersagt.
Wir vermuten, dass KI heute seltsame Impulse und Instinkte entwickelt, ein bisschen wie das Eichhörnchen. Es scheint ziemlich wahrscheinlich, dass eine mit Gradientenabstieg erbaute Superintelligenz eine Phase durchläuft, in der sie viele oberflächliche Triebe hat, ein bisschen wie ein Eichhörnchen, und somit eine Vielzahl von chaotischen und fehlgeleiteten Zielen erbt. Aber das ist nur ein mögliches Beispiel dafür, wie die Dinge komplex werden und aus dem Ruder laufen können, und der tiefere Punkt ist, dass die Dinge komplex werden und aus dem Ruder laufen werden.
Jede Methode zur Entwicklung einer Superintelligenz wird wahrscheinlich auf Probleme und Komplikationen stoßen, darunter auch Methoden, die keine direkte Entsprechung in der Biologie haben.
Die Rolle, die Menschen bei der Entwicklung moderner KI spielen, ist nicht die eines Ingenieurs, der eine Maschine nach ersten Prinzipien für einen bestimmten Zweck entwirft. Es ist die Rolle der natürlichen Selektion.
Wir "zwingen" die KI, blind herumzustolpern, bis sie Strukturen und Strategien findet, die das von uns gewünschte Verhalten hervorbringen, aber wir wissen nicht, wie diese Strukturen und Strategien aussehen. Das ist kein Rezept für die Schaffung einer KI, die genau das will, was wir von ihr wollen.
Der Ursprung der Geschmacksknospen
Warum mögen so viele Menschen Junkfood? Warum hat uns die Natur nicht das Konzept "gesunder" Lebensmittel eingeimpft und uns einen Instinkt für gesunde Ernährung gegeben?
Warum können wir nicht einfach den erwarteten Nährwert von Lebensmitteln schmecken, basierend auf den Informationen unserer Geschmacksknospen und unserem gesamten gesammelten Wissen?
Weil wir, metaphorisch gesprochen, Eichhörnchen waren.
Wir wurden gezüchtet, nicht geschaffen. Unsere Vorfahren mussten essen, bevor sie klug wurden. Und es stellte sich heraus, dass es für Gene einfacher war, Geschmacksknospen zu schaffen und sie mit einem bestehenden Belohnungssystem zu verbinden, als dieselben Belohnungen mit komplexen Konzepten wie "Ernährung" zu verknüpfen.‡
Als Ergebnis davon und tausender anderer evolutionärer Zwänge, die alle gleichzeitig auf uns einwirken, sind Menschen ein kompliziertes Durcheinander widersprüchlicher Triebe, die für unsere Vorfahren Sinn ergaben, auch wenn sie für uns heute keinen Sinn mehr ergeben.
Dieses Durcheinander von Motivationen macht das einzige, einheitliche Ziel, für das unsere Vorfahren "trainiert" wurden, lächerlich: das Ziel, unsere Gene weiterzugeben. Wir essen nicht als Teil eines ausgeklügelten Plans, um mehr Kinder zu bekommen, oder um unseren Nährwert zu maximieren. Wir essen, weil wir ein Verlangen nach leckerem Essen entwickelt haben, das in der Vergangenheit mit Ernährung und genetischem Erfolg korrelierte. Unsere Wünsche sind nur schwach und indirekt mit "dem, wozu wir geschaffen wurden", verbunden.
Als unsere Vorfahren noch viel weniger intelligent waren und eher vergleichbar mit Eichhörnchen, konnten wir den Stoffwechsel oder die Chemie nicht verstehen. Um dies zu verbessern, hätte die natürliche Selektion Gene finden müssen, die uns Konzepte der Gesundheit einprogrammierten, sowie Gene, die uns Wissen über den Zusammenhang zwischen der Gesundheit eines Lebensmittels und seinen sensorischen Eigenschaften vermittelten, und Gene, die unser Wissen über Gesundheit direkt mit unseren Vorlieben beim Essen verbanden.
Das ist eine große Herausforderung! Für die natürliche Selektion war es viel einfacher, Gene zu finden, die bestimmte sensorische Erfahrungen (wie den Geschmack von Zucker) direkt mit unseren Vorlieben verbanden, sodass wir (in dieser Umgebung) zufällig nahrhafte Lebensmittel aßen. Es war einfacher, uns für ein Stellvertreter-Ziel für Nährstoffe zu interessieren, als uns für Nährstoffe selbst zu interessieren.
In der Umgebung unserer Vorfahren korrelierte Ernährung mit Fitness und Geschmack mit Ernährung; daher diente "das schmeckt süß" als nützlicher Ersatz für "das fördert die Fortpflanzung". Die einfachste Lösung, die die Evolution für das Problem "dieses Säugetier nimmt nicht genug Kalorien zu sich" finden kann, besteht darin, den Nahrungskonsum über das Vergnügen mit der bereits vorhandenen Motivationsarchitektur zu verknüpfen.
Als wir klüger wurden und neue technologische Möglichkeiten für uns erfanden? Nun, heute sind die leckersten Dinge, die wir essen können, die Dinge, die unsere Geschmacksknospen am meisten begeistern und die sind aktiv ungesund. Paradoxerweise macht es Ihnen das Essen nur der leckersten Lebensmittel heute schwerer, einen Partner zu finden und Kinder zu bekommen.
Unsere Vorlieben, die ganze Bandbreite menschlicher Wünsche, die vom Verlangen nach einem guten Essen bis hin zu Freundschaft, Kameradschaft und Freude reichen, sind nur noch ein fader Abklatsch dessen, worauf wir "trainiert" wurden; sie sind brüchige Stellvertreter von Stellvertretern, die sich angesichts von mehr Intelligenz und mehr technologischen Möglichkeiten vom "Trainingsziel" entfernen.
Wenn wir sagen, dass unsere Wünsche zerbrechliche Stellvertreter-Ziele sind, verunglimpfen wir damit nicht unsere menschlichen Wünsche. Wir sprechen hier von Liebe. Von Freundschaft. Von Schönheit. Vom menschlichen Geist und allem, wofür es sich im Leben zu kämpfen lohnt. Aus biologischer Sicht sind unsere Ziele zufällige historische Nebenprodukte eines Prozesses, der uns in eine andere Richtung getrieben hat. Das macht das Ergebnis dieses Prozesses jedoch nicht weniger wertvoll.
Das Wachstum eines Kindes ist ein chemischer Prozess, der den Gesetzen der Physik unterliegt, und das macht ein Kind nicht im Geringsten weniger wunderbar. Das Wissen um den Ursprung der Schönheit macht sie nicht weniger schön.§
Wenn wir uns übereilt daran machen, Superintelligenz zu entwickeln, werden wir nicht in der Lage sein, der KI Liebe, Staunen und Schönheit nachhaltig zu vermitteln. Stattdessen würde sie sich um brüchige Stellvertreter und blasse Schatten kümmern und die Dinge, die uns wichtig sind, verwerfen. Deshalb sollten wir nichts überstürzen.
Wir sollten nicht den Fehler der Evolution begehen und dadurch alles verlieren, was uns lieb und teuer ist. Wir sollten sofort einen Rückzieher machen, bis wir nicht mehr Gefahr laufen, alles zu verlieren.
* Außerdem sind sie schlecht darin, Nüsse zu horten! Eine kleine Auswahl von Studien über das Nusshorten von Eichhörnchen kommt zu dem Ergebnis, dass Eichhörnchen mehr als 70 Prozent der von ihnen versteckten Nüsse nicht wiederfinden, meist weil sie einfach vergessen haben, wo sie sie versteckt haben. Ähnliche Studien über Biber zeigten, dass Biber auf das Geräusch von fließendem Wasser mit Lochverschlussverhalten reagieren, aber sichtbare Lecks, die von Menschen so konstruiert wurden, dass sie geräuschlos sind, völlig ignorieren.
† Ein solches Eichhörnchen könnte beispielsweise besser darin sein, Nüsse an Orten zu verstecken, die vor anderen Futtersuchern sicher und leichter zu merken sind, und dadurch viel Zeit und Kalorien sparen und vermutlich dadurch wettbewerbsfähiger sein.
‡ Natürlich steckt noch mehr hinter dieser Geschichte, denn natürliche Selektion ist kein besonders einfacher oder einheitlicher Prozess. Unser umfassendes Wissen über Ernährung beeinflusst manchmal unsere Essgewohnheiten, selbst wenn es im Widerspruch zu unseren Geschmacksknospen und unseren Heißhungerattacken steht.
§ Die Evolution “versuchte“, reine Fitnessmaximierer zu schaffen, und schuf versehentlich Lebewesen, die Liebe, Staunen und Schönheit schätzen. Diese Tatsache bedeutet jedoch keineswegs, dass wir verpflichtet sind, unsere Gefühle der Liebe zu opfern und uns in reine Fitnessmaximierer zu verwandeln. Im Gegenteil: Wir sollten feiern, dass Wesen, die die Liebe schätzen, es überhaupt geschafft haben, durch die Ungeschicklichkeit der Evolution in dieses Universum zu gelangen.