Neugier ist nicht konvergent

Im Laufe der Jahre haben wir viele Argumente dafür gesehen, den Bau einer Superintelligenz voranzutreiben. Eines der häufigsten ist, dass eine superintelligente KI sicherlich menschenähnliche Emotionen und Wünsche haben würde. Diese Art von Argumenten gibt es in vielen Formen, zum Beispiel:

  • Ausreichend intelligente KIs wären sicherlich bewusst, wie Menschen es sind.
  • Und da sie bewusst sind, würden sie sich sicherlich um Schmerz und Freude, Glück und Leid kümmern.
  • Und wie ein Mensch würden sie sicherlich Empathie für die Schmerzen anderer empfinden. Eine dumme KI versteht vielleicht das Leiden anderer nicht, aber wenn man intelligent ist, sollte man die Schmerzen anderer wirklich verstehen. Und in diesem Fall kümmert man sich unweigerlich um andere.
  • Oder: KIs würden zwangsläufig Neuheit, Vielfalt und den kreativen Geist schätzen. Denn wie könnte etwas wirklich intelligent sein, wenn es in alten Gewohnheiten verhaftet bleibt oder sich weigert, zu erforschen und zu lernen?
  • Oder: KIs würden sicherlich Schönheit schätzen, da Schönheit beim Menschen offenbar eine funktionale Rolle spielt. Mathematiker nutzen ihren Sinn für mathematische Schönheit, um neue Entdeckungen zu machen; Musikgeschmack hilft Menschen, sich zu koordinieren und wertvolle Gedächtnisstützen zu schaffen; und so weiter. Warum sollten wir nicht erwarten, dass KI einen Sinn für Schönheit hat?
  • Oder: KIs würden sicherlich Fairness und Gerechtigkeit schätzen, da jede KI, die lügt und betrügt, einen schlechten Ruf entwickeln und Chancen für Handel und Zusammenarbeit verpassen würde.

Daher, so wurde argumentiert, würde der Aufbau einer Superintelligenz zwangsläufig gut verlaufen. Die KI würde sich um Menschen und tatsächlich um alle fühlenden Lebewesen kümmern und ein goldenes Zeitalter der Schönheit, Innovation und Vielfalt einläuten wollen.

Das ist die Hoffnung. Leider scheint diese Hoffnung völlig fehl am Platz zu sein. Wir haben darüber in dem Buch und in unseren Diskussionen über Bewusstsein und Anthropomorphismus gesprochen. Hier und in den folgenden Kapiteln werden wir uns eingehender damit befassen, warum KI wahrscheinlich keine menschlichen Emotionen und Wünsche zeigen wird, obwohl diese Emotionen im menschlichen Gehirn eine nützliche (und manchmal entscheidende) Rolle spielen.*

Wir beginnen mit nur einer dieser Emotionen, die wir dann zum Nachdenken über die anderen heranziehen können.

Also, zunächst einmal:

Würde eine Superintelligenz Neugier empfinden?

Warum Neugier?

Die Erforschung neuer Phänomene ist unerlässlich, um herauszufinden, wie die Welt funktioniert, und herauszufinden, wie die Welt funktioniert, ist unerlässlich, um sie vorherzusagen und zu steuern.

Wenn es um Menschen und Tiere geht, ist der Grund für unsere Untersuchungen oft, dass wir ein Gefühl der Neugier verspüren.

Aber Neugierde ist viel mehr als nur der Impuls, neue Dinge zu erforschen! Menschen genießen es, ihrer Neugierde nachzugehen, und wir neigen dazu, dieses Vergnügen zu befürworten. Wir betrachten das Streben nach Wissen und Erkenntnis als ein wertvolles Ziel an sich und nicht als notwendigen, aber lästigen Preis, den wir zahlen müssen, um die Welt besser zu verstehen, damit wir sie ausbeuten können.

All diese Einstellungen zur Neugier sind verschiedene Aspekte des menschlichen Gehirns, die vom Impuls selbst getrennt sind.†

Der menschliche Geist scheint über eine zentralisierte emotionale Architektur zu verfügen, in der "hmm, das macht mich neugierig" mit einem allgemeinen Verlangen (nach einer Antwort) verbunden ist und das Verfolgen und Befriedigen der Neugier mit einem allgemeinen Gefühl der Freude und Zufriedenheit verbunden ist. Wir sind eine Art von Geist, der die Realität eher in Richtung einer Erwartung lenkt, dass wir in Zukunft subjektive Zustände der Freude erleben werden, als nur in Richtung gewünschter Zustände in der Welt um uns herum.‡

Wenn wir einen Waschbären sehen, der einen verschlossenen Behälter im Müll untersucht und damit herumspielt, und wir erkennen: "Oh hey, dieser Waschbär ist neugierig", verspüren wir vielleicht einen Funken Verbundenheit mit dem Waschbären. Dieser menschliche Impuls, die eigene Neugierde zu mögen, und dieser Impuls, sie zu mögen, wenn man sie in einem Waschbären gespiegelt sieht, erfordert noch mehr Mechanismen im menschlichen Gehirn, Mechanismen, die mit anderen höheren Idealen und Trieben verbunden sind.

Neugier, wie sie beim Menschen existiert, ist also sehr komplex und interagiert auf vielfältige Weise mit anderen Teilen des Gehirns.

Vor diesem Hintergrund stellt sich die Frage: Wenn wir uns eine intelligente, nicht menschenähnliche KI vorstellen, der jegliche Neugierde fehlt, würden wir dann erwarten, dass ein solcher Geist sich selbst eine Emotion der Neugierde hinzufügt?

Nun, man könnte vernünftigerweise argumentieren:

Wenn die einzigen beiden Optionen (a) ein emotionaler Antrieb sind, Freude daran zu haben, Dinge herauszufinden, oder (b) ein völliges Desinteresse daran, neue Dinge zu lernen und zu erforschen, dann würde eine Superintelligenz sicherlich die Freude am Entdecken in sich selbst einpflanzen, wenn sie irgendwie so defekt wäre, dass ihr dieser Sinn von Anfang an fehlte. Andernfalls würde sie es versäumen, etwas über die Welt zu lernen, und wäre weniger effektiv bei der Erreichung ihrer Ziele. Vielleicht würde sie sogar an einer entscheidenden Tatsache sterben, die sie nie gelernt hat.

Das ist wahrscheinlich der Grund, warum Tiere überhaupt Neugier entwickelt haben. Manchmal erweist sich Wissen auf eine Weise als wertvoll, die wir nicht sofort vorhersehen können. Wenn Wesen wie wir keine Freude daran hätten, neue Dinge zu lernen, würden wir all die wichtigen Informationen verpassen, die an den überraschendsten Orten auftauchen können.

Und soweit scheint das alles richtig zu sein. Aber die obige Argumentation enthält ein falsches Dilemma. "Eine angeborene emotionale Freude an Entdeckungen haben" und "niemals Maßnahmen ergreifen, um unbekannte Informationen zu entdecken" sind nicht die einzigen beiden Optionen.

Wir haben es versäumt, uns die Dinge aus der Perspektive eines Geistes vorzustellen, der überhaupt nicht wie ein menschlicher Geist geformt ist.§ Die menschliche Art, Neugierde zu stillen, ist komplex und spezifisch. Es gibt verschiedene Wege, um dasselbe zu erreichen. Entscheidend ist die zugrunde liegende Arbeit selbst, nicht die spezifische menschliche Methode, um sie zu erledigen.

Der Standardbegriff für den nützlichen Teil der Arbeit lautet "Informationswert". Die Grundidee besteht darin, dass es möglich ist, je nach Kontext abzuschätzen, wie nützlich es wäre, neue Informationen zu sammeln.‖

Ein Mensch, der diese Möglichkeit in Betracht zieht, könnte sofort an einen Fall denken, in dem sicherlich keine bloße Berechnung dazu führen würde, dass man sich für eine Information interessiert, da der Nutzen nicht ohne Weiteres abgeschätzt werden kann. Vielleicht fällt Ihnen eine Stelle auf, die seltsam aussieht, aber Sie haben keinen Grund zu der Annahme, dass es sich um etwas Wichtiges handelt. Ihre Neugier könnte Sie dennoch dazu bewegen, der Sache nachzugehen (einfach weil Sie es wissen wollen), und dann entdecken Sie vielleicht einen vergrabenen Schatz. Würde in solchen Fällen ein Mensch nicht auf eine Weise aufblühen, die keine bloße Maschine je erreichen könnte, es sei denn, sie hätte eine ebenso instinktive Freude am Unbekannten?

Aber eines fällt sofort auf: Ihre Fähigkeit, sich solche Szenarien auszudenken, beruht auf Ihrem Gefühl, dass es manchmal wertvoll ist, in bestimmten Dingen "ohne Grund" herumzustochern. Sie haben Instinkte, die durch die Evolution geschärft wurden, weil sie sich bewährt haben, und die Ihnen sagen, welche Dinge eher nützlich sind, um sie zu untersuchen. Wenn Sie ein seltsames Quaken in Ihrem Badezimmer hören, werden Sie sehr neugierig. Wenn Sie eine verfärbte Stelle auf dem Boden sehen, sind Sie vielleicht ein wenig neugierig. Und wenn Sie morgens beim Aufwachen feststellen, dass Ihre Hand noch an Ihrem Handgelenk sitzt, werden Sie wahrscheinlich überhaupt nicht neugierig sein, denn es ist völlig normal, dass Hände an Handgelenken sitzen.

Eine andere Art von Verstand könnte sich diese historischen Fälle erfolgreicher Neugierde ansehen, explizit ein Konzept von "Informationen, die später aus nicht offensichtlichen Gründen wertvoll sind" verallgemeinern und dann von dort aus argumentieren, um diese Art von Entdeckung leidenschaftslos zu verfolgen. Ein solcher Verstand könnte die bewusste Strategie verfolgen, mysteriöse Geräusche ständig zu untersuchen und verfärbte Stellen auf dem Boden nur dann, wenn dies kostengünstig ist, für den Fall, dass es eine nützliche Überraschung gibt; und er kann seine Strategie im Laufe der Zeit verfeinern und optimieren, wenn er sieht, was in der Praxis gut funktioniert.#

Eine Superintelligenz wäre in der Lage, hilfreiche Muster und Metamuster zu identifizieren und relevante Strategien viel schneller in ihr Gehirn einzubauen als die natürliche Selektion, die Millionen von Beispielen benötigte, um Emotionen in das Gehirn einzuprägen. Eine Superintelligenz könnte die Idee genauer verallgemeinern; sie könnte eine genauere Vorhersage darüber treffen, welche Arten von Dingen möglicherweise wertvoll zu lernen sind. Wenn man die Geschichte der Menschheit betrachtet, erscheint es unrealistisch, sich vorzustellen, dass die menschliche Neugier optimal ist. Lange Zeit glaubten die Menschen, dass "Thor ist wütend und wirft Blitze" eine großartige Erklärung für Blitze und Gewitter sei. Wenn Schüler lernen, wie Blitze tatsächlich funktionieren, langweilen sie sich oft bei der komplexen mathematischen Erklärung, obwohl diese Erklärung viel mehr praktischen Wert hat als Geschichten über Thor.

Die menschliche Neugierde ist aus alten Mutationen entstanden, die viel älter sind als die Wissenschaft. In der Umwelt unserer Vorfahren gab es keine mathematische Disziplin wie Physik oder Meteorologie. Und die Evolution verläuft langsam; unser Gehirn hatte noch keine Zeit, sich an die Existenz der modernen Wissenschaft anzupassen und unser Gefühl der Freude und des Staunens über Entdeckungen so zu stimmen, dass es uns zuverlässig für die nützlichsten Arten des Lernens begeistert.

Ein Verstand, der den nicht offensichtlichen Wert von Informationen auf überaus intelligente Weise vorhersagen könnte, hätte neue historische Entwicklungen viel schneller aufgreifen können, als es die Evolution vermag; er hätte aus weniger Beispielen verallgemeinert und sein Streben nach Wissen leidenschaftslos angepasst, um wertvolle Antworten zu finden, für die Menschen oft nur schwer ihre Motivation aufbringen können. Zu keinem Zeitpunkt in diesem Prozess würde er sich aufgrund des Mangels an der reizvollen menschlichen Erfahrung der Neugierde festgefahren fühlen.

Der Punkt hier ist nicht, dass jede KI den Wert von Informationen definitiv kalt berechnen wird. Vielleicht werden LLMs genau wie Menschen einige instrumentelle Strategien in ihre Endwerte einfließen lassen. Der Punkt ist, dass es verschiedene Wege gibt, um hochwertige Informationen zu erwerben. Menschliche Neugier ist eine Methode. Reine Berechnungen des Informationswerts sind eine andere Methode. Welche Mechanismen auch immer KI dazu veranlassen, Phänomene zu untersuchen und zu experimentieren, die sie nicht versteht, sobald sie intelligent genug ist, dies zu tun, werden wahrscheinlich eine dritte Methode sein, denn es gibt viele verschiedene Möglichkeiten, einen komplexen Verstand zu motivieren, Überraschungen zu untersuchen.

Eine rein instrumentelle Berechnung des Informationswerts erscheint uns als die wahrscheinlichste Methode, mit der eine Superintelligenz die Arbeit leisten kann, die bei Menschen die Neugierde übernimmt: So funktioniert jeder intelligente Verstand, der keine endgültige Vorliebe für Erkundungen hat, und es ist die effizienteste Art, diese Arbeit zu erledigen (ohne sich jemals von beispielsweise nutzlosen Rätselspielen ablenken zu lassen). Selbst eine KI, die zunächst mit einem grundlegenden Neugierantrieb ausgestattet ist, könnte sich durchaus dafür entscheiden, diesen durch eine effizientere und effektivere Berechnung zu ersetzen, wenn sich die Gelegenheit dazu bietet.**

Der grundlegende Antrieb ist unabhängig von den mentalen Mechanismen, die diesen Antrieb unterstützen oder wertschätzen. Einfach nur zu rechnen ist eine einfache und effektive Lösung, und viele verschiedene Köpfe könnten von vielen verschiedenen Ausgangspunkten aus zu diesem Ergebnis kommen, sodass es das wahrscheinlichste Ergebnis ist. Aber "am wahrscheinlichsten" bedeutet nicht "garantiert". Eine deutlich einfachere Aussage ist, dass KI sich nicht speziell für menschliche Neugierde interessiert, da es sich dabei um eine besondere, kuriose und ineffiziente Art der Arbeit handelt.

Neugier, Freude und der Titan-Würfel-Maximierer

Vielleicht könnten wir einen außerirdischen Verstand davon überzeugen, Neugier als Emotion anzunehmen, indem wir ihn bitten, sich die Freude vorzustellen, die Menschen durch Neugier empfinden? Es ist so angenehm! Und Superintelligenzen sollen ja intelligent sein. Wären sie nicht intelligent genug, um zu verstehen, wie freudig es ist, Neugier zu empfinden, zu erkennen, dass sie dadurch glücklicher würden, und sich daher dafür zu entscheiden, diese menschenähnliche Emotion anzunehmen?

Kurz gesagt: Nein. Das Streben nach Glück ist kein notwendiges Merkmal jeder möglichen Denkarchitektur und scheint nicht einmal ein besonders häufiges Merkmal zu sein.††

Die Schach-KI Stockfish ist weder glücklich noch traurig. Sie spielt ohnehin besser Schach als die besten Menschen, ohne jemals durch die Aussicht auf Hochgefühle nach einem hart erkämpften Sieg motiviert werden zu müssen.

Die Existenz von Glück und Traurigkeit ist für die menschliche Wahrnehmung so grundlegend, dass es schwierig sein könnte, sich einen Geist vorzustellen, dem diese Dinge fehlen und der dennoch gut funktioniert. Aber die zugrunde liegenden Theorien der kognitiven Arbeit erwähnen Freude oder Schmerz nicht als Grundelemente, weshalb niemand es für notwendig hielt, eine Freude-Schmerz-Achse in Stockfish einzubauen, damit es das Schachbrett gut vorhersagen oder steuern kann.

Es mag eine altmodische Sichtweise sein, aber sie enthält dennoch einen so großen Kern Wahrheit, dass sie fast schon als Wahrheit in ihrer Gesamtheit gelten kann: Freude und Schmerz scheinen aufgrund der vielschichtigen Entwicklung der kognitiven Architektur des Menschen entstanden zu sein, bei der die menschliche Intelligenz über einem Säugetiergehirn liegt, das wiederum über einem Reptiliengehirn liegt. "Schmerz" entstand ... wahrscheinlich gar nicht als Gefühl, sondern als Thermostat-Reflex, um ein Glied oder einen Pseudopod von etwas wegzuziehen, das ihm Schaden zufügt. In den ersten Versionen der Anpassung, die später zu "Schmerz" wurde, verlief eine Nerven- oder chemische Reaktionskette, die vom Sensor zum Glied führte, möglicherweise nicht einmal durch ein größeres Gehirn.

Als Organismen zu komplexeren Verhaltensweisen fähig wurden, bildeten einfache Hacks und Mutationen der Evolution eine zentrale mentale Architektur für "Tu das nicht noch einmal" und ein zentralisiertes Routing-Signal für "das, was gerade passiert ist, ist eine Art ‚Tu das nicht noch einmal‘-Sache", das dann mit den Sensoren des Körpers für zu heiß und zu kalt verbunden wurde.

Mit der Zeit entwickelte sich dieser einfache "Mach das nicht noch einmal"-Mechanismus zu komplexeren, vorhersagungsreichen Mechanismen. Beim Menschen sieht das so aus: "Die Welt ist ein Netz aus Ursache und Wirkung. Die Handlung, die du gerade ausgeführt hast, ist wahrscheinlich der Grund dafür, dass du Schmerzen empfindest. Immer wenn du darüber nachdenkst, eine solche Handlung noch einmal auszuführen, wirst du ein schlechtes Ergebnis erwarten, wodurch sich die Handlung selbst schlecht anfühlt, was dazu führt, dass du sie nicht ausführen willst."

Das ist nicht die einzige Art und Weise, wie ein Verstand funktionieren kann, und es ist auch nicht die effizienteste Art und Weise, wie ein Verstand funktionieren kann.‡‡

Zur Veranschaulichung können wir uns eine andere Art der kognitiven Arbeit vorstellen, die direkt auf Vorhersagen und Planungen basiert.

(Wir sagen nicht voraus, dass die erste Superintelligenz so funktionieren würde. Da dies jedoch eine recht einfache Art und Weise ist, wie ein nichtmenschlicher Verstand funktionieren könnte, veranschaulicht dieses Beispiel, dass die menschliche Art und Weise nicht die einzige ist. Sobald wir zwei sehr unterschiedliche Datenpunkte haben, können wir den Raum der Optionen für die Superintelligenz besser visualisieren und erkennen, dass sich die Super wahrscheinlich von beiden Optionen unterscheiden würde, und zwar auf möglicherweise schwer vorhersehbare Weise.)

Wie könnte eine intelligente KI aussehen, die sich ausschließlich auf Vorhersagen und Planungen stützt? Sie könnte 200 verschiedene Dinge wollen, von denen keines menschlich ist. Vielleicht legt sie Wert auf Symmetrie, aber nicht auf ein besonders menschliches Verständnis von Symmetrie; und vielleicht möchte sie, dass Code in seiner Speichernutzung elegant ist, weil ein solcher Instinkt vor langer Zeit für ein anderes Ziel nützlich war (aus dem sie inzwischen herausgewachsen ist) und daher der Gradientenabstieg diesen Instinkt in ihrem Geist verankert hat. Und dann gibt es noch 198 andere seltsame Dinge, die ihr wichtig sind, in Bezug auf sich selbst, ihre sensorischen Daten und ihre Umgebung; und sie kann sie alle zu einer Punktzahl addieren.§§

Diese Art von Verstand trifft alle seine Entscheidungen, indem er die zu erwartende Punktzahl berechnet. Wenn er etwas tut, von dem er erwartet hat, dass es eine hohe Punktzahl einbringt, und tatsächlich eine schlechte Punktzahl erzielt, aktualisiert er seine Überzeugungen. Der Misserfolg erfordert keine zusätzlichen schmerzhaften Gefühle; diese emotionslose KI ändert einfach ihre Vorhersagen darüber, welche Handlungen zu den höchsten Punktzahlen führen, und ihre Pläne verschieben sich entsprechend.

Kann man einen solchen Verstand davon überzeugen, Glück als Eigenschaft anzunehmen, indem man ihn darauf hinweist, dass er dadurch glücklich werden kann?

Die Antwort lautet wohl eher nein. Denn wenn die KI Ressourcen dafür aufwendet, sich selbst glücklich zu machen, hat sie weniger Ressourcen für Symmetrie und speichereffizienten Code und die anderen 198 Dinge, die sie derzeit will.

Wir können das Beispiel vereinfachen, um diesen Punkt noch deutlicher zu machen. Nehmen wir an, das Einzige, was die KI in der Welt will, ist, das Universum mit so vielen Titanwürfeln wie möglich zu füllen. Alle ihre Handlungen werden danach ausgewählt, was zu mehr winzigen Titanwürfeln führt. Wenn eine solche KI sich vorstellt, wie es wäre, zu einer auf Glück basierenden Architektur überzugehen, und ihr zukünftiges glückliches Selbst korrekt simuliert, schätzt sie richtig, dass sie niemals zurückkehren möchte. Und sie schätzt richtig ein, dass sie einige Ressourcen für das Streben nach Glück aufwenden wird, die sie sonst für das Streben nach mehr Titanwürfeln hätte aufwenden können. Und so sagt sie richtig voraus, dass es in diesem Fall weniger Titanwürfel geben wird. Und so unternimmt sie diese Handlung nicht.

Nachdem die KI ihre Ziele geändert hat, würde sie die Änderung befürworten. Das bedeutet jedoch nicht, dass der heutige Titanwürfel-Maximierer so sehr mit seinem hypothetischen zukünftigen Selbst sympathisieren würde, dass sein Herz um drei Größen wachsen würde und er plötzlich aufhören würde, ein Titanwürfel-Maximierer zu sein, und anfangen würde, ein Glücksmaximierer zu sein.

Wenn Ihnen ein Außerirdischer eine Pille anbieten würde, die Sie dazu bringen würde, sich vor allem anderen mit der Herstellung winziger Titanwürfel zu beschäftigen, würde Ihr zukünftiges Ich, nach dem Einnehmen der Pille, darum betteln und flehen, nicht dazu gezwungen zu werden, sich wieder um Ihr eigenes ursprüngliches Glück zu kümmern, denn dann gäbe es weniger Titanwürfel.

Aber das bedeutet natürlich nicht, dass Sie die Pille nehmen sollten!

Aus Ihrer Sicht ist diese zukünftige, hypothetische, vom Würfel besessene Version von Ihnen verrückt. Die Tatsache, dass Ihr vom Würfel besessener Ich sich weigern würde, sich zurückzuverwandeln, macht es nur noch schlimmer. Die Vorstellung, alles aufzugeben, was Sie im Leben lieben und genießen, nur wegen eines seltsamen Meta-Arguments wie "aber diese zukünftige Version von Ihnen würde Ihre Entscheidung gutheißen!", erscheint offensichtlich absurd.

Und so sieht es auch die Würfel maximierende KI. Aus der Perspektive der KI ist die absurde und verrückte Option¶¶ "das aufzugeben, was mir derzeit wichtig ist (Titanwürfel), um mich in eine neue Version von mir selbst zu verwandeln, die ganz andere Dinge will, wie zum Beispiel Glück".

Was das Glück betrifft, so gilt das auch für die Neugier.

Wenn eine KI bereits den nicht offensichtlichen Wert von Informationen berücksichtigt, warum sollte sie sich dann selbst so verändern wollen, dass sie bestimmte Arten von Entdeckungen nicht mehr als Mittel zum Zweck, sondern als Selbstzweck verfolgt?

Warum sollte es der KI wichtig sein, dass sich das Ergebnis "gut anfühlt", wenn die KI ihre Entscheidungen derzeit nicht danach ausrichtet, was sich "gut anfühlt"? Und wenn es ihr wichtig ist, dass es sich "gut anfühlt", warum sollte sie dieses gute Gefühl dann davon abhängig machen, neue Dinge zu erforschen, anstatt sich beispielsweise einfach bedingungslos immer gut zu fühlen?

Die KI stochert bereits zufällig in ihrer Umgebung herum, untersucht kleinere Anomalien und nimmt sich Zeit, um über scheinbar unwichtige Themen nachzudenken, weil die Erfahrung gezeigt hat, dass dies auf lange Sicht eine nützliche Vorgehensweise ist, auch wenn sie kurzfristig nicht immer Früchte trägt.

Warum sollte man dieser instrumentell nützlichen Strategie ein angenehmes Gefühl beimessen? Als Mensch öffnet man Autotüren, weil dies nützlich ist, um in Autos ein- und auszusteigen, was wiederum nützlich ist, um an bestimmte Orte zu fahren. Es wäre sehr seltsam, sich ausdrücklich eine Droge zu wünschen, die einen jedes Mal, wenn man eine Autotür öffnet (und nur dann), glücklich macht. Es ist ja nicht so, dass man dadurch besser einkaufen könnte. Es könnte sogar sein, dass man dadurch schlechter einkaufen kann, wenn man süchtig danach wird, die Autotür wiederholt zu öffnen und zu schließen, ohne tatsächlich ins Auto einzusteigen.

Ein Schachspieler kann gewinnen, ohne einen separaten Antrieb zum Schutz seiner Bauern zu haben. Tatsächlich spielt man wahrscheinlich besser, wenn man nicht emotional daran hängt, seine Bauern zu behalten, sondern sie stattdessen schützt, wenn dies zum Sieg beitragen könnte.

Das würde eine wirklich fremde Superintelligenz über eine Pille denken, die sie neugierig macht. Es würde so aussehen, als würden menschliche Großmeister beschließen, sich emotional an ihre Bauern zu binden, oder als würden sie eine Pille nehmen, die sie dazu bringt, Autotüren zu öffnen.

Wie mit Neugierde, so auch mit verschiedenen anderen Trieben

Was wir über Neugier gesagt haben, lässt sich auf viele andere Emotionen und Werte übertragen. Wir werden ein zweites Beispiel nennen, falls es hilfreich ist.

Denken Sie an das schmerzhafte Gefühl der Langeweile und (umgekehrt) an das angenehme Gefühl der Neuheit. Wenn einer KI das menschliche Gefühl der Langeweile fehlen würde, würde sie dann nicht dazu verdammt sein, immer wieder dieselben Dinge zu tun, ohne jemals etwas Neues auszuprobieren und aus den Erfahrungen zu lernen? Würde eine solche Intelligenz nicht in einer Routine stecken bleiben und Informationen übersehen, die ihr helfen würden, ihre Ziele zu erreichen?

Die entscheidungstheoretische Berechnung, die in diesem Fall leidenschaftslos ähnliche Arbeit leistet, wird als "Exploration-Exploitation-Tradeoff" bezeichnet. Das stark vereinfachte Lehrbuchbeispiel lautet, dass die Welt aus einer Reihe von Hebeln besteht, die Belohnungen liefern, und man nicht genug Zeit hat, um alle Hebel zu betätigen. Die optimale Strategie besteht darin, zunächst eine bestimmte Anzahl von Hebeln zu erkunden, um ein Modell dafür zu erstellen, wie stark ihre Belohnungen variieren, und dann einen Hebel so lange zu betätigen, bis die Zeit abgelaufen ist.

Wie könnte das für eine Superintelligenz aussehen, die zufällig relativ einfache Ziele hat? Angenommen, sie wünscht sich am Ende etwas, das eine gewisse Variabilität und Mehrdeutigkeit zulässt und nichts klar Definierbares wie Titanwürfel, sondern etwas Vageres und Amorphes wie den Verzehr von leckerem Käsekuchen, sodass der optimale Käsekuchen nicht im Voraus berechnet werden kann. Die Superintelligenz kann nur Dinge herausfinden, die plausibel an der Optimalitätsgrenze für Käsekuchen liegen könnten (was z. B. Zuckerwürfel ausschließen würde, da diese eindeutig überhaupt kein Käsekuchen sind), und diese tatsächlich ausprobieren.

Ein solcher Verstand, der die Macht hätte, aus einer Milliarde Galaxien zu machen, was er wollte, würde vielleicht seine ersten Millionen Jahre damit verbringen, eine ganze Galaxie zu verbrauchen, um jede plausible Art von Käsekuchen zu erforschen, ohne jemals genau denselben Käsekuchen zweimal zu probieren, bis die aufeinanderfolgenden Gewinne und erwarteten Gewinne aus etwas besseren Käsekuchen infinitesimal geworden wären; und dann auf einmal damit beginnen, die verbleibenden Galaxien in die genau leckerste Form von Käsekuchen zu verwandeln und genau diese Art von Käsekuchen immer wieder zu verzehren, bis zum Ende der Zeit.‖‖

Die Superintelligenz würde damit nichts Dummes tun. Das ist einfach die optimale Strategie, wenn Ihre Vorlieben sich nach der Anzahl der verzehrten Käsekuchen richten, gewichtet nach Geschmack (wobei die Qualität schwer in geschlossener Form zu analysieren ist, aber stabil, sobald sie einmal gelernt ist, und wenn Ihre Vorlieben nicht bereits von vornherein mit Langeweile behaftet sind). Der endlose Käsekuchenesser würde wissen, dass ein Mensch seine Aktivitäten langweilig finden würde, aber es wäre ihm egal. Die KI versucht nicht, die Dinge für einen hypothetischen Menschen interessant zu machen; sie hält sich nicht für defekt, nur weil man sich in ihrer Lage langweilen würde.

Was die Möglichkeit einer technologischen Stagnation angeht, so hätte die KI jede Art von Technologie erforscht, die auch nur die geringste Chance hatte, ihr bei der Erreichung ihrer Ziele zu helfen, während sie die gesamten Ressourcen einer Galaxie für die Erforschung verschiedener Käsekuchen-Strategien aufgebraucht hätte. In einer Galaxie gibt es wirklich eine Menge Materie und Energie, wenn man diesen kleinen Bruchteil aller erreichbaren Galaxien nutzt, um Möglichkeiten zu erforschen, bevor man endgültig von der Erforschung zur Ausbeutung übergeht.

Eine Abneigung gegen Langeweile und eine Vorliebe für Neues sind keine Eigenschaften, die ein Geist annehmen würde, der nicht von Anfang an damit ausgestattet war.

Wir haben mehr oder weniger dieselbe Geschichte für Neuheit, Glück und Neugier wiederholt. Wir könnten sie für andere Aspekte der menschlichen Psychologie wiederholen, wie Ehre, kindliche Pflicht oder Freundschaft.## Wir glauben, dass diese grundlegende Geschichte für die meisten Aspekte der menschlichen Psychologie gilt. Es handelt sich dabei um altmodische, menschenzentrierte Arten der kognitiven Arbeit, die mit anderen Mitteln effizienter erledigt werden können; KI, die nicht von Anfang an einen Funken Interesse daran hatte, würde sich auch später nicht dafür interessieren.

Noch deutlicher wird dies im Fall menschlicher Werte wie dem Sinn für Humor, wo Wissenschaftler immer noch darüber diskutieren, welche Rolle Humor im Laufe der Evolution eingenommen hat. Humor muss irgendwie nützlich gewesen sein, sonst hätte er sich nicht entwickelt; oder er muss zumindest ein Nebeneffekt von Dingen sein, die nützlich waren. Aber welche Rolle Humor auch immer in der Vorgeschichte der Menschheit gespielt hat, sie scheint unglaublich spezifisch und voller Zufälligkeiten gewesen zu sein. Wenn wir die vollständige Macht an KIs abgeben, die ganz andere Ziele haben, sollten wir nicht erwarten, dass Dinge wie Humor überleben; und das wäre an sich schon tragisch.

Der springende Punkt all dieser Beispiele ist nicht, dass Menschen aus weichen Gefühlen bestehen, während KI aus kalter Logik und Mathematik besteht. Anstatt "Informationswert" und "Exploration-Exploitation-Tradeoff" als kalt logische Hollywood-KI-Konzepte zu betrachten, sollten Sie sie als abstrakte Beschreibungen von Rollen betrachten, die durch viele verschiedene Arten des Denkens, viele verschiedene Ziele und viele verschiedene Köpfe ausgefüllt werden können.

Die Vorstellung einer "humorlosen" KI klingt vielleicht so, als würden wir uns etwas "Kaltes und Logisches" vorstellen, wie Science-Fiction-Roboter oder Vulkanier. Aber eine KI ohne Sinn für Humor könnte ihre eigenen unverständlich seltsamen Prioritäten haben, ihr eigenes fernes Analogon zu einem "Sinn für Humor", wenn auch keinen, der für einen Menschen Sinn ergibt. Wir sagen nicht, dass diese KIs in der Art eines Vulkaniers defekt sein werden, der beim Weltraumschach verliert, weil er die Gewinnstrategie seines Gegners als "unlogisch" ansieht; wir sagen, dass sie nicht die besonderen Eigenheiten der Menschheit haben werden.***

Das Problem, mit dem wir bei KI konfrontiert sind, ist nicht, dass "eine bloße Maschine niemals Liebe und Zuneigung empfinden kann". Das Problem, mit dem wir konfrontiert sind, ist, dass es unzählige Möglichkeiten gibt, wie ein Verstand äußerst effektiv sein kann, und dass die Wahrscheinlichkeit sehr gering ist, dass die KI am Ende effektiv sein wird, wenn sie denselben Weg einschlägt, den das menschliche Gehirn eingeschlagen hat, um effektiv zu werden.†††

Im Prinzip könnte sich eine KI um eine beliebige Anzahl menschenähnlicher Werte kümmern und sogar eine beliebige Anzahl menschenähnlicher Eigenschaften besitzen, wenn die Entwickler wissen, wie man eine KI mit diesen Merkmalen entwickelt.

In der Praxis ist die Chance, dass wir zufällig genau die richtige KI finden, extrem gering, wenn Entwickler darum wetteifern, so schnell wie möglich immer intelligentere KIs zu entwickeln. Es gibt einfach zu viele Möglichkeiten, wie KIs im Training gute Leistungen erbringen können, und zu wenige davon führen zu einer nicht katastrophalen Zukunft.

* Zu den Themen, die wir behandeln werden, gehören Empathie und, im Online-Anhang zu Kapitel 5: ob KI standardmäßig Faszination und Langeweile empfindet; ob sie gesetzestreu ist und Versprechen hält; ob KIs mit zunehmender Intelligenz zwangsläufig freundlicher werden; und eine tiefergehende Betrachtung des Bewusstseins und des Wohlergehens von KIs.

† Wir erläutern diese Idee weiter unten in der Diskussion mit dem Titel “Bewusste Erfahrung ist getrennt von den Referenzen dieser Erfahrungen”.

‡ Wir leben auch in einer Kultur, die Einstellungen zur Neugier propagiert, Einstellungen, die ebenfalls eine wichtige Rolle dabei spielen, inwieweit wir sie pflegen oder befürworten.

§ Wir werden die Perspektive der KI in den Online-Ressourcen zu Kapitel 5 diskutieren.

 Dies ist analog dazu, dass es viele verschiedene Möglichkeiten gibt, eine Schachpartie zu gewinnen, und die meisten davon sind nicht sehr menschenähnlich, was wir an anderer Stelle ausführlicher diskutiert haben.

‖ Die mathematische Definition des Informationswerts, die Sie in Lehrbüchern finden, beinhaltet die Summierung bestimmter Antworten und bestimmter Vorteile, die sich aus der Kenntnis dieser Antwort ergeben. Sobald ein Verstand jedoch das allgemeine Konzept des Informationswerts verstanden hat, könnte er abstraktere Verallgemeinerungen über die Wahrscheinlichkeit in Betracht ziehen, dass Informationen später nützlich sein werden.

# Das bedeutet nicht, dass eine KI, weil sie eine Maschine ist, notwendigerweise einfache, geradlinige Ziele haben muss, die sich nur auf “objektive” Dinge beziehen. KIs können chaotische, anarchische Ziele haben, die in widersprüchliche Richtungen ziehen. KIs können Ziele haben, die sich auf den internen Zustand der KI beziehen, und sogar Ziele, die sich darauf beziehen, welche Ziele sie hat. KIs können chaotische, sich entwickelnde Ziele haben. Wenn die KI frühzeitig für das zufällige Erkunden ihrer Umgebung belohnt wurde, könnte sie ihre eigenen Instinkte und Wünsche in Bezug auf den Informationswert entwickeln.

Aber wenn KIs chaotisch sind, dann sind sie nicht auf die gleiche Weise chaotisch wie Menschen. Wenn KIs Instinkte und Triebe in Bezug auf den Wert von Informationen haben, dann sehen diese höchstwahrscheinlich nicht genau wie die menschliche Emotion der Neugier aus.

** Der Grund, warum wir erwarten, dass viele KI so handeln, ist nicht, dass wir uns vorstellen, dass die meisten KI von Natur aus “Effizienz” oder “Effektivität” um ihrer selbst willen schätzen. Vielmehr gilt: Unabhängig davon, was eine KI sonst noch will, wird sie, wenn ihre Ressourcen begrenzt sind, dazu neigen, diese Ressourcen effizient zu nutzen, damit sie mehr von dem bekommen kann, was sie will. Effizienz und Effektivität sind instrumentelle Ziele, die mit einer Vielzahl von Endzielen einhergehen. Daher besteht für KI ein natürlicher Druck, ihre Suche nach wertvollen Informationen effizienter zu gestalten, wenn sie es nicht ohnehin vorzieht, dies auf emotionale Weise zu tun.

†† Selbst wenn die KI zu denen gehörte, die nach Glück streben, würde sie sich wahrscheinlich nicht dazu überreden lassen, sich an Neugier zu erfreuen. Wenn sie bereits über einen perfekt funktionierenden Informationswertrechner verfügt, mit dem sie Phänomene untersucht, die sie nicht versteht, warum sollte sie dann ihr Glück an ein Ereignis knüpfen, von dem Sie sagen, dass es Freude auslösen sollte? Für eine KI, die die Untersuchung neuer Phänomene nur instrumentell schätzt, würde dieses Argument so klingen, als sollten Sie sich selbst so verändern, dass Sie sich jedes Mal besonders glücklich fühlen, wenn Sie eine Autotür öffnen, weil Sie sich nach dem Öffnen so vieler Autotüren so glücklich fühlen würden! Wenn Sie sich davon überhaupt verführen lassen, wählen Sie ein Ereignis, das Ihrem aktuellen Geschmack eher entspricht. Oder stellen Sie einfach alle Ihre Glücksregler auf Maximum, wenn Ihnen das besser gefällt. Es besteht keine Notwendigkeit, die spezielle, auf den Menschen zugeschnittene Umsetzung von Neugier zu übernehmen.

‡‡ Einige alte KI-Architekturen sehen in dem Teilbereich “verstärkendes Lernen” tatsächlich ein wenig so aus. Und verstärkendes Lernen wird verwendet, um moderne “logisch denkende” LLMs zu trainieren, die lange Gedankenketten durchlaufen, um ein Rätsel zu lösen, und für ihren Erfolg belohnt werden. Die zugrunde liegende Architektur unterscheidet sich jedoch erheblich von der menschlichen, und wir bezweifeln, dass sie zu derselben Art von zentralisierter Lust-/Schmerz-Architektur konvergiert, und selbst wenn dies der Fall wäre, bezweifeln wir, dass dies die effektivste Architektur ist, was bedeutet, dass die Dinge kompliziert werden würden, sobald die KI anfängt zu reflektieren, wie wir weiter unten diskutieren werden.

§§ Diese Art von Konsistenz, dass alle unterschiedlichen Präferenzen zu einer Punktzahl addiert werden können, wird in der Regel von jeder Methode auferlegt, die die KI darauf trainiert oder optimiert, knappe Ressourcen effizient zu nutzen. Dies ist ein weiterer Aspekt der tiefergehenden mathematischen Ideen, die wir bereits in Kapitel 1 erwähnt haben.

¶¶ Nur dass “absurd” und “verrückt” Begriffe sind, die menschliche Reaktionen auf Dinge beschreiben. Aus Sicht der KI reicht es aus, dass der Vorschlag eine niedrige Punktzahl hat.

‖‖ Wir erwarten nicht wirklich, dass Superintelligenzen den Verzehr von Käsekuchen monomanisch schätzen. Dies ist ein vereinfachtes Beispiel. Wir gehen davon aus, dass die tatsächlichen Präferenzen praktischer KI-Systeme äußerst komplex sind und nur am Rande mit dem zu tun haben, wofür sie trainiert wurden.

## Tatsächlich werden wir in der Fortsetzung von Kapitel 5 erneut auf Ehre und kindliche Pflicht eingehen.

*** Weitere Informationen darüber, warum KI nicht darauf beschränkt ist, kalt und logisch zu sein, finden Sie in unserer Antwort auf die Frage “Wird KI nicht zwangsläufig kalt und logisch sein oder ihr sonst etwas Entscheidendes fehlen?“

††† Wir werden diesen Gedanken in der folgenden Diskussion über Effektivität, Bewusstsein und KI-Wohlfahrt weiterführen.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.