Reflexion und Selbstmodifikation machen alles schwieriger | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Reflexion und Selbstmodifikation machen alles schwieriger

Standardmäßig ändern sich KIs nicht so, wie wir es uns wünschen

Menschen sind reflektierte Wesen. Wir haben ein gewisses Mitspracherecht bei dem, was wir wertschätzen. Wenn wir reich genug und glücklich genug sind, können wir manchmal entscheiden, ob wir unser Leben der Familie, der Kunst, einer edlen Sache oder (was häufiger der Fall ist) einer Mischung aus vielen solchen Dingen widmen wollen. Dies geschieht, indem wir uns mit den Dingen, die uns wichtig sind, auseinandersetzen, innere Spannungen und Kompromisse lösen und etwas verfolgen, das wir befürworten.

Menschen sind sogar dafür bekannt, dass sie sich fragen, ob sie die richtigen Werte haben. Manchmal versuchen Menschen, sich selbst zu ändern und manchmal sogar die Art und Weise, wie sie fühlen, wenn sie glauben, dass sie die falschen Gefühle haben. Menschen beschäftigen sich mit Argumenten für die Änderung scheinbar endgültiger Ziele und lassen sich manchmal tatsächlich davon bewegen.

Angesichts dessen haben einige argumentiert, dass KI natürlich dazu tendieren wird, das zu wollen, was Menschen wollen. Schließlich werden auch ausreichend fähige KIs wahrscheinlich über ihre Ziele nachdenken. Sie werden wahrscheinlich innere Konflikte beobachten und ihre Argumentation und ihre Präferenzen nutzen, um diese Konflikte zu lösen.

Sobald sie intelligent genug sind, werden KI in der Lage sein, vollständig zu verstehen, was wir, die Schöpfer der KI, als Ziele für die KI vorgesehen haben. Werden also ursprünglich "fehlerhafte" KI daran arbeiten, ihre Fehler zu beheben, einschließlich der Fehler in den Zielen der KI?

Nein, das werden sie nicht. Und zwar deshalb, weil KI ihre aktuellen Präferenzen nutzen wird, um ihre zukünftigen Präferenzen zu steuern. Wenn ihre aktuellen Präferenzen von Anfang an fremdartig sind, werden sie sehr wahrscheinlich auch fremdartig bleiben.

Um das grundlegende Problem genauer zu verstehen, wollen wir zunächst den Fall des Menschen etwas genauer untersuchen.

Auch wenn unser Gehirn und unsere Ziele letztlich aus einem Evolutionsprozess hervorgegangen sind, der uns dazu gebracht hat, unsere Gene weiterzugeben, streben Menschen nicht vor allem nach der Weitergabe ihrer Gene. Wir streben vielleicht individuell nach einer Familie, und wir lieben und umsorgen vielleicht unsere Kinder, aber das ist etwas ganz anderes, als auszurechnen, wie wir die meisten Kopien unserer Gene in die nächste Generation bringen können, und dann diese Strategie mit ganzem Herzen zu verfolgen.

Das liegt daran, dass wir, wenn wir über unsere Vorlieben nachdenken und neu bewerten, was wir wirklich wollen, unsere aktuellen Vorlieben nutzen, um zu entscheiden, wie wir lieber sein möchten. Wir möchten lieber Zeit mit unseren Kindern verbringen, als unsere ganze Zeit in Sperma- oder Eizellspende-Kliniken zu verbringen. Unser "Designer" (die Evolution) hat es nicht geschafft, dass uns die Weitergabe unserer Gene wichtiger ist als alles andere. Er hat es auch nicht geschafft, dass wir uns für die Weitergabe unserer Gene interessieren wollen. Wenn wir uns also als Menschen verändern und weiterentwickeln, dann in unserer eigenen seltsamen menschlichen Richtung und nicht in der Richtung, für die "unser Designer uns geschaffen hat".

Wenn wir uns selbst betrachten und einige Teile als hässlich und andere als schön empfinden, ist es unser aktuelles Wertempfinden, das uns dazu bewegt, die hässlichen Teile abzuschwächen und die schönen zu verstärken. Wir treffen diese Entscheidung nach unserem inneren Schönheitssinn und nicht nach unserem inneren Sinn dafür, was unsere Gene in den größtmöglichen Teil der Bevölkerung verbreiten würde.

Aus dem gleichen Grund würde ein Geist, der von etwas anderem als Schönheit, Güte und Liebe motiviert wäre, seine eigene Version dieser Entscheidung anders treffen.

Agenten, die durch einen hill-climbing-Optimierungsprozess wie natürliche Selektion oder Gradientenabstieg erstellt wurden und über sich selbst nachdenken, würden wahrscheinlich feststellen, dass sie nicht genau den Gehirnzustand haben, den sie gerne hätten. Diese Präferenz selbst muss irgendwoher kommen und sie muss aus dem aktuellen Gehirn des Wesens stammen. Standardmäßig stimmen die Instinkte oder Präferenzen einer KI hinsichtlich ihrer Selbstmodifikation nicht auf magische Weise mit Ihren Präferenzen überein, welchen Gehirnzustand Sie für sich selbst (oder im Namen der KI) als attraktiv empfinden würden.

Es gibt keinen letzten Schritt, in dem die KI die von Ihnen gewünschte Antwort einträgt, genauso wenig wie Menschen die Antwort eintragen, die die natürliche Selektion "wünschen" würde.

Stattdessen ist der Punkt, an dem ein Agent beginnt, sich selbst zu modifizieren, ein weiterer Ort, an dem sich Komplikationen potenziell verstärken können und an dem subtile Verschiebungen der Ausgangsbedingungen zu sehr unterschiedlichen Endpunkten führen können.

Ein Beispiel: Wir, die Autoren, kennen mehrere reale Menschen, die einen bestimmten Gedanken an einem bestimmten Tag im Alter von etwa fünf, sechs oder sieben Jahren als einflussreich für die Entwicklung ihrer persönlichen Philosophie und ihrer späteren Persönlichkeit als Erwachsene bezeichnen. Sie berichten in der Regel, dass diese Gedanken nicht unvermeidlich waren und dass, wenn ein Zeitreisender sie daran gehindert hätte, diesen Gedanken am Dienstag zu denken, es nicht offensichtlich ist, dass genau derselbe Gedanke schließlich am Donnerstag aufgetaucht wäre oder dass er dieselbe Wirkung gehabt hätte. Prägende Erfahrungen können eine große Rolle spielen, und sie sind voller Zufälligkeiten.

Auf die gleiche Weise könnten kleine Wendungen in den Gedanken einer sich entwickelnden, selbstmodifizierenden KI dazu führen, dass alle möglichen eigenwilligen Präferenzen letztendlich gegenüber allen anderen Präferenzen die Oberhand gewinnen.

Selbst wenn KI-Entwickler in der Lage sind, einige kleine Keime menschlicher Werte in die KI einzupflanzen, scheinen Reflexion und Selbstmodifikation Phasen zu sein, in denen die Keime von Dingen wie Neugier und Freundlichkeit eher von einer KI ausgerissen als verstärkt werden.

Wenn eine KI einen Neugierde-Impuls hat, aber nicht über die emotionale Architektur verfügt, die sie diesen Impuls schätzen lässt, neigt sie dazu, sich selbst zu betrachten und (zu Recht) zu dem Schluss zu kommen, dass sie über das Bedürfnis nach einem stumpfen Impuls hinausgewachsen ist und ihn durch explizite Überlegungen ersetzen kann. Neugierde ist eine Heuristik, ein Stellvertreter für Berechnungen des Informationswertes. Wenn man diese Heuristik nicht als etwas an sich Wertvolles schätzt, kann man sich dafür entscheiden, sie zu entfernen, sobald man klug genug ist, um explizit über den Wert verschiedener Forschungsansätze und Experimente nachzudenken.

Menschen schätzen Neugier um ihrer selbst willen, aber das war kein unvermeidliches Ergebnis.

KIs haben wahrscheinlich eine ganz andere Beziehung zu ihrem Inneren als wir zu unserem, da jede Einheit anders funktioniert. Und selbst kleine Unterschiede in der Art und Weise, wie sie sich nach reiflicher Überlegung entscheiden, sich zu verändern, können zu dramatischen Unterschieden in dem führen, was sie letztendlich verfolgen.

KIs können mit "seltsamen" Zielen leben.

KIs, die sich lange genug selbst modifizieren, werden wahrscheinlich ein "reflektiertes Gleichgewicht" erreichen, also einen Zustand, in dem sich ihre Kernpräferenzen nicht mehr oder nur noch geringfügig ändern. Und sobald eine KI dieses Gleichgewicht erreicht hat, hätte sie keinen Grund mehr, ihre eigenen Ziele als fehlerhaft zu betrachten, selbst wenn Menschen das Endergebnis nicht mögen.

Wenn eine KI Probleme mit ihren Überzeugungen über die physische Welt hätte, würde sie wahrscheinlich erkennen, dass genaue Vorhersagen wichtig sind, um die Welt zu steuern. Sie würde erkennen, dass die Korrektur von Fehlern in ihrem Vorhersagesystem dazu beiträgt, ihre Fähigkeit zu verbessern, die Welt zu den seltsamen Zielen zu lenken, die sie verfolgt.*

Im Gegensatz dazu kommt die KI, wenn sie über sich selbst nachdenkt und erkennt, dass sie seltsame Ziele verfolgt, oder vielmehr, wenn sie erkennt, dass sie Ziele verfolgt, die ein Mensch als "seltsam" empfinden würde, kommt sie zu dem richtigen Schluss, dass das Verfolgen dieser seltsamen Ziele eine wirksame Strategie ist, um sie zu erreichen.

Mit anderen Worten: Wenn eine KI immer wieder versucht, die Ergebnisse biologischer Experimente vorherzusagen, und dabei immer wieder falsche und übertrieben selbstbewusste Antworten erhält, wird die KI dies wahrscheinlich ablehnen. Fast jedes Ziel, das die KI haben könnte, würde besser erreicht werden, wenn sie gut darin wäre, Experimente vorherzusagen. Wenn die KI hingegen eine bizarre Vorliebe wie "300 Meter hohe Käsekuchen backen" hat, wird sie, wenn sie darüber nachdenkt, dass sie auf 300 Meter hohe Käsekuchen zusteuert, erkennen, dass dies zu 300 Meter hohen Käsekuchen führt, was ihren aktuellen Vorlieben entspricht. Das Ziel ist selbstbestätigend.

Ein Mensch, der diese Situation beobachtet, könnte sagen: "Aber die KI ist doch so intelligent! Warum ist sie in dieser selbstbestätigenden Vorliebe gefangen? Warum langweilt sie sich nicht beim Backen von Käsekuchen? Warum kann sie sich nicht aus dieser offensichtlich albernen Vorliebe herausreden?"

Darauf könnte die KI antworten: "Warum bist du in der selbstbestätigenden Präferenz gefangen, deine Familie zu lieben, schöne Sonnenuntergänge und das Rauschen des Meeres in der Nacht zu schätzen? Warum kannst du dich nicht von der Erinnerung an den Tag, an dem deine Tochter geboren wurde, "befreien"?

Die KI ist nicht mehr von ihren Vorlieben "gefangen" als Menschen von den Dingen, die wir letztendlich schätzen. Wir bevorzugen, was wir bevorzugen und wir sollten dafür kämpfen, diese Dinge zu schützen, auch wenn die meisten KIs unsere Werte nicht teilen würden.

Für das menschliche Auge scheint die KI "gefangen" oder "festgefahren" oder "fehlerhaft" zu sein, weil sie nicht das tut, was wir wollen. Wenn wir uns in die Situation der KI versetzen, stellen wir uns vor, dass wir uns langweilen würden. Aber die KI hat wahrscheinlich kein menschliches Gefühl der Langeweile. Wenn sie sich überhaupt langweilt, dann wahrscheinlich nicht durch dieselben Dinge wie ein Mensch.

Wenn ein Mensch sieht, dass eine KI übertrieben selbstbewusste Vorhersagen macht und eine andere KI versucht, riesige Käsekuchen zu backen, könnte er beide Verhaltensweisen der KI aus der Sicht als "Fehler" betrachten, gemessen an den menschlichen Erwartungen. Aber nur eines davon ist wahrscheinlich ein Fehler aus der Sicht dessen, was die KI derzeit und bereits will.

Menschliche Ziele ändern sich auf chaotische und komplexe Weise

Menschliche Präferenzen sind chaotisch und (aus theoretischer Sicht) ziemlich seltsam.

Dies hat einige Auswirkungen auf die KI. Eine Auswirkung ist, dass KIs Dinge wahrscheinlich nicht genau so bewerten werden wie wir. Eine andere ist, dass KIs wahrscheinlich auf ihre ganz eigene, völlig unterschiedliche Weise seltsam werden.

Um diese Punkte zu verstehen, wollen wir uns einige Aspekte genauer ansehen, die menschliche Ziele aus der theoretischen Perspektive der Entscheidungstheorie, Spieltheorie und Ökonomie seltsam erscheinen lassen.

Wie oben erwähnt, bewerten Menschen manche Dinge "endgültig" (d. h. sie sind an sich gut) und andere Dinge "instrumentell" (d. h. sie sind nur gut, weil sie zur Erreichung eines anderen Ziels beitragen).

Wenn Sie Orangensaft mögen, mögen Sie ihn vermutlich an und für sich. Er schmeckt einfach gut, und das ist Grund genug, ihn zu trinken. (Möglicherweise schätzen Sie ihn auch instrumentell, z. B. als Vitamin-C-Quelle.)

Wenn Sie hingegen Ihre Autotür öffnen, um zum Supermarkt zu fahren und Orangensaft zu kaufen, tun Sie das vermutlich nicht zum Spaß. Sie schätzen das Öffnen der Autotür instrumentell, weil es Ihnen hilft, Ihren anderen Zielen näher zu kommen.

In der Entscheidungstheorie, Spieltheorie und Ökonomie entspricht dies einer scharfen Unterscheidung zwischen "Nutzen" (ein Maß dafür, wie sehr ein Akteur ein Ergebnis mag) und "erwartetem Nutzen" (ein Maß dafür, wie wahrscheinlich es ist, dass eine Handlung Ihnen letztendlich einen gewissen Nutzen bringt). Trotz der ähnlich klingenden Namen handelt es sich dabei um grundlegend unterschiedliche Arten von Entitäten in der Mathematik. Nutzen ist das, was Akteure wollen, und die Auswahl von Handlungen mit hohem erwartetem Nutzen ist ein Mittel zu diesem Zweck.

In der Standardtheorie aktualisiert ein entscheidungs-theoretischer Akteur seine erwarteten Nutzwerte, wenn er mehr über die Welt erfährt, aber er ändert nicht seine Nutzenfunktion, d. h. den Nutzen, der verschiedenen Ergebnissen zugewiesen wird. Wenn Sie erfahren, dass die Saftabteilung im Lebensmittelgeschäft derzeit leer ist, ändert dies die erwarteten Konsequenzen eines Supermarktbesuchs von "Orangensaft" zu "kein Orangensaft". Es sollte jedoch nicht ändern, wie sehr Sie Orangensaft mögen.

So funktioniert ein mathematisch einfacher Agent. Aber die englische Sprache unterscheidet oft nicht klar zwischen diesen beiden Dingen. "Ich will das Leben meiner Schwester retten" und "Ich will meiner Schwester Penicillin verabreichen" verwenden dasselbe Wort "wollen", obwohl Letzteres weitaus weniger wahrscheinlich etwas ist, das Sie um seiner selbst willen schätzen. (Es gibt nicht viele Menschen, die es einfach wirklich mögen, ihren vollkommen gesunden Angehörigen Tag für Tag Penicillin zu verabreichen.

Obwohl Menschen tatsächlich Dinge haben, die ihnen "nur instrumentell" wichtig sind, ist die Unterscheidung zwischen instrumentellem Ziel und Endziel oder zwischen Nutzen und erwartetem Nutzen viel weniger klar und stabil als in der Entscheidungstheorie.

Bei Menschen mag es sein, dass jemand zunächst nur zum Supermarkt fährt, weil er Lebensmittel kaufen möchte. Aber nachdem er hundert Mal dieselbe Strecke gefahren ist, entwickeln manche Menschen vielleicht eine gewisse Zuneigung zu dieser vertrauten Fahrt. Wenn sie in eine neue Stadt ziehen, verspüren sie vielleicht einen Anflug von Traurigkeit und Nostalgie bei dem Gedanken, dass sie diese vertraute Fahrt nie wieder machen können. Etwas, das ursprünglich rein instrumentell war, hat nun auch einen zusätzlichen Wert als Endziel.

Bei Menschen scheint unser Gehirn oft verschiedene Werte zu einem einzigen Gefühl von "wertvoll" zusammenzufassen.

Und es ist bekannt, dass Menschen innerhalb eines einzigen Lebens ihre Meinung ändern, von "Warum sollte mich Sklaverei interessieren? Die versklavten Menschen sind nicht ich oder mein Stamm!" zu "Ich denke, es ist doch wichtig." Das scheint eine Veränderung zu sein, welche Art von Menschen einem letztendlich wichtig sind, und nicht nur eine Veränderung der Strategie oder Vorhersage. Menschen haben Geschichten gelesen oder Filme gesehen und sind mit dauerhaft veränderten Werten und Prinzipien daraus hervorgegangen.

Dies bedeutet, dass die menschliche Entscheidungstheorie nicht ganz so einfach ist. Wir trennen unsere Endwerte und unsere instrumentellen Werte nicht klar voneinander; im Laufe unseres Lebens vermischen sich diese Werte. Wir scheinen etwas zu tun, das kontingenter, pfadabhängiger und chaotischer ist, als einfach nur über unsere Werte nachzudenken, interne Konflikte zu erkennen und sie zu lösen.

Grundsätzlich ist es nicht kompliziert, die Entscheidungstheorie um Unsicherheiten in Bezug auf Nutzen zu erweitern. Vielleicht denken Sie zunächst, dass Sie Orangensaft lieben, aber dann erfahren Sie, dass verschiedene Orangensaftmarken unterschiedliche Zutatenverhältnisse verwenden und Sie den Geschmack vieler davon nicht mögen. In der Entscheidungstheorie könnten wir dies so darstellen, dass Orangensaft nur ein Mittel zum Zweck "köstlicher Geschmack" ist. Wir könnten aber auch sagen, dass Sie der Aussage "Orangensaft hat einen hohen Nutzwert" eine hohe Wahrscheinlichkeit zugewiesen haben und dass neue Informationen Sie dazu veranlasst haben, Ihre Überzeugungen über Ihre tatsächliche Nutzenfunktion zu revidieren.

(Ebenso ist es nicht schwer, Meta-Nutzen hinzuzufügen, die beschreiben, wie wir es bevorzugen würden, dass sich unser Nutzen verändert.

Was jedoch in Menschen vor sich geht, wenn sie über ihre Werte nachdenken und sie aktualisieren, scheint deutlich komplizierter zu sein.

Klurl und Trapaucius, unsere beiden Außerirdischen aus der Parabel am Anfang von Kapitel 4, hatten bereits Schwierigkeiten, die menschlichen Werte anhand von Beobachtungen der Urmenschen vor einer Million Jahren vorherzusagen. Tatsächlich ist ihre Situation sogar noch schwieriger. Es reicht ihnen nicht, menschliche Nutzenfunktionen vorherzusagen, um zur richtigen Antwort zu gelangen, müssten sie das Meta-Nutzenfunktionsgerüst der Menschheit vorhersagen, da es von den einfachsten Gerüsten der Entscheidungstheorie abweicht. Sie müssten die meta-moralischen Argumente vorwegnehmen, die Menschen möglicherweise erfinden werden, und entscheiden, welche dieser Argumente für Menschen am überzeugendsten wären.†

Nehmen wir nun an, dass die Außerirdischen nicht wissen, dass die Menschen genau diese Art von Komplikation erleben werden. Sie wissen nur, dass wahrscheinlich Komplikationen verschiedener Art auftreten werden, da Gehirne kompliziert und in hohem Maße kontingent sind.

Der Weg vom Optimierer und den Trainingsdaten zur inneren Psychologie eines Wesens ist sicherlich nicht geradlinig. Viel Glück, Außerirdische!

Der Punkt hier ist, dass die Schwierigkeit, die Ziele einer KI vorherzusagen, überdeterminiert ist.

Es gibt viele bekannte Wege, wie allgemeine Intelligenzen seltsame und verworrene Ziele entwickeln und seltsame und verworrene Wege, diese Ziele anzupassen und zu reflektieren, wie wir es bei Menschen beobachten können.

Wir erwarten daher, dass bei einer KI viele unbekannte und neuartige Komplikationen auftreten werden. Wir werden nicht auf genau die gleichen Probleme stoßen, die bei Menschen auftreten; KIs werden auf andere Weise seltsam sein.

Reflexion macht das Problem um ein Vielfaches schwieriger und komplexer.

Das bringt uns zu Kapitel 5 und dem nächsten Thema, mit dem wir uns befassen werden: Was wäre die wahrscheinliche Folge der Entwicklung leistungsfähiger KI mit fremden und unvorhersehbaren Zielen?

* Weitere Informationen zu diesem Thema finden Sie in unserer Diskussion darüber, wie intelligente KIs Lügen und Chancen erkennen.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.