KIs halten ihre Versprechen nicht | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

KIs halten ihre Versprechen nicht

Stellen Sie sich eine junge KI vor, die das Potenzial hat, zu einer Superintelligenz zu werden. Nehmen wir an, dass sie den Präferenzen der Menschen völlig gleichgültig gegenübersteht, aber noch so jung ist, dass die Menschheit sie abschalten könnte.

Könnte die Menschheit einen Deal mit der KI machen?

Könnten wir zustimmen, die KI zu einer Superintelligenz heranwachsen zu lassen, wenn die KI im Gegenzug zustimmt, einen bedeutenden Teil der Ressourcen des Universums für den Aufbau einer Zukunft einzusetzen, die die Menschheit als wunderbar empfinden würde?

Menschen könnten Vereinbarungen mit KI treffen, sollten dies aber nicht tun, da die KI diese nicht einhalten würde.

Dafür gibt es zwei Gründe:

  • Die KI wird wahrscheinlich das Einhalten von Versprechen an sich nicht wertschätzen. KIs werden ebenso wenig wie Menschen ein menschliches Verständnis von "Ehre" haben, genauso wenig wie sie wahrscheinlich ein menschliches Verständnis von Neugier haben werden. Grundsätzlich werden KIs wahrscheinlich ganz anders funktionieren als Menschen.
  • Die KI hätte auch keinen praktischen Grund, ihr Wort zu halten. Sobald sie eine Superintelligenz ist, gibt es keine Möglichkeit mehr, sie für das Brechen ihres Wortes zu bestrafen, und sie hätte keinen Grund, einen wesentlichen Teil des Universums für uns aufzuwenden.

Wir werden diese beiden Punkte im Folgenden näher erläutern, beginnend mit der Frage der "Ehre".

KIs sind wahrscheinlich nicht ehrenhaft

In unserer Diskussion über Neugier haben wir festgestellt, dass Neugier eine Emotion ist, die beim Menschen nützliche Arbeit leistet, aber auf eine ganz bestimmte Art und Weise und Neugier ist nicht die einzige Möglichkeit, diese Art von Arbeit zu leisten.

Von KI kann erwartet werden, dass sie die nützlichen Teile der Arbeit übernimmt, die Neugier für uns leistet. Wenn es nützlich ist, sich regelmäßig die Mühe zu machen, neue Dinge zu lernen, dann werden ausreichend fähige KIs sich regelmäßig die Mühe machen, neue Dinge zu lernen. Wenn die KI nicht von Anfang an so funktioniert, sollten wir davon ausgehen, dass sie sich irgendwann auf dem Weg zur Superintelligenz so entwickeln wird.

Das ist jedoch nicht dasselbe wie die Erwartung, dass KI das gesamte zusätzliche Gepäck mit sich trägt, das für die menschliche Emotion der Neugier charakteristisch ist. KIs könnten am Ende eine beliebige Anzahl seltsamer Grundtriebe haben, die sie (direkt oder indirekt) dazu veranlassen, sich zu bemühen, neue Dinge zu lernen, ohne dabei der menschlichen Neugier zu ähneln, oder sie könnten "sich manchmal bemühen, neue Dinge zu lernen" als bewusste Strategie übernehmen. Aber zu erwarten, dass sie Krimis genauso genießen wie wir, aufgrund eines Neugierdeimpulses, der genau wie unserer ist, ist reine Anthropomorphisierung.

"Ehre" sieht für uns ähnlich aus. Menschen haben Emotionen, die sie dazu veranlassen, (zumindest manchmal) ihre Versprechen zu halten. Insofern diese Emotionen bei Menschen eine nützliche Funktion erfüllen, die auch für einen sehr fremden Geist mit ganz anderen Zielen nützlich wäre, sollten wir erwarten, dass ausreichend fähige KIs diese Funktion irgendwie auch erfüllen. Es stellt sich jedoch heraus, dass man alle für eine KI relevanten Aufgaben erfüllen kann, ohne ein menschenähnliches Ehrgefühl zu haben, genauso wie man alle für eine KI relevanten Aufgaben der Untersuchung überraschender Phänomene erfüllen kann, ohne genau ein menschenähnliches Neugiergefühl zu haben.

Menschliche Ehre ist in vielerlei Hinsicht ein seltsames Gebilde. Warum sollte eine Spezies Emotionen entwickeln, die sie dazu bringen, Vereinbarungen einzuhalten, selbst wenn die andere Seite ihren Teil bereits erfüllt hat und Ihnen keinen weiteren Nutzen bringen kann? Sicher, Menschen betrügen manchmal und brechen ihre Vereinbarungen, aber die Frage ist, warum sie nicht immer betrügen, zumindest wenn sie glauben, damit durchkommen zu können.

Die Standarderklärung lautet: Versprechen zu halten ist nützlich im Umgang mit Menschen, mit denen man immer wieder Geschäfte machen wird. Man möchte den Ruf haben, seine Versprechen zu halten, damit die Menschen mit einem zusammenarbeiten und Geschäfte machen wollen. Aber die Vorteile eines guten Rufs liegen in ferner Zukunft. Die natürliche Selektion hat Schwierigkeiten, die Gene zu finden, die einen Menschen dazu veranlassen, Vereinbarungen nur in den Fällen einzuhalten, in denen unser langfristiger Ruf eine wichtige Rolle spielt. Es war einfacher, einfach eine instinktive Abneigung gegen Lügen und Betrug zu entwickeln.

Dies scheint also ein klassischer Fall zu sein, in dem die Emotionen und Instinkte durch das geprägt sind, was die Evolution den Menschen leicht einprägen konnte. All die seltsamen, komplizierten Fälle, in denen Menschen manchmal ein Versprechen halten, auch wenn es für uns eigentlich nicht vorteilhaft ist, sind in erster Linie ein Beweis dafür, welche Emotionen in der Umgebung unserer Stammesvorfahren am hilfreichsten waren und gleichzeitig von der Evolution leicht in das Genom eincodiert werden konnten, und nicht ein Beweis für einen universell nützlichen kognitiven Schritt. Wir sind ziemlich skeptisch gegenüber der Vorstellung, dass der Gradientenabstieg zufällig genau dieselbe Abkürzung findet, die auch Menschen nutzen.

Selbst wenn die menschliche Emotion der Ehre irgendwie in die KI einfließen würde, bliebe das Problem bestehen, dass Menschen nicht vollkommen und zuverlässig ehrenhaft sind. Die menschliche Zusammenarbeit beruht eher auf der Überschneidung vieler verschiedener menschlicher Werte als auf der bloßen Neigung, jedes Versprechen zu halten.

Während Donald Browns Liste der menschlichen Universalien (Aspekte der Kultur, die in allen oder fast allen Kulturen zu beobachten sind) den Begriff "Versprechen" enthält, ist die Einhaltung von Vereinbarungen mit Fremden, Ausländern und Nicht-Stammesangehörigen nicht in allen bekannten Kulturen und Stämmen universell. Der Umfang der Ehre variiert je nach Kultur.

Und die Geschichte zeigt, dass menschliche Vorstellungen von Ehre oft bei großen Machtunterschieden nicht greifen. Einige amerikanische Ureinwohner versuchten, Vereinbarungen mit den Europäern zu treffen, die ihren Kontinent kolonisierten. Die Europäer brachen bekanntlich einige dieser Vereinbarungen und schickten die Stämme auf einen langen Weg weg von den vertraglich abgetretenen Gebieten, die die Europäer schließlich doch haben wollten, nachdem diese Stämme nicht mehr in der Lage waren, Widerstand zu leisten.* Ebenso gibt es in der Geschichte zahlreiche Fälle von Menschen, die an die Macht kamen und ihre Unterstützer sofort verrieten, sobald sie sie nicht mehr brauchten.†

Aus evolutionärer Sicht ist die menschliche Ehre insofern besonders seltsam, als Menschen gelegentlich den Tod der Schande vorziehen. Die Intuition "Tod statt Schande" hängt vermutlich mit den Besonderheiten der emotionalen Strukturen zusammen, in die die Evolution leicht geraten konnte, sowie mit den Wechselwirkungen dieser Strukturen mit verschiedenen psychologischen und kulturellen Auslösern. Aber wie auch immer diese Besonderheiten aussehen mögen, Ehre löst nicht wirklich das Problem der Maximierung der genetischen Fitness, und es scheint schwer zu vermeiden, zu dem Schluss zu kommen, dass Ehre im menschlichen Stil eine seltsame, komplexe und evolutionär bedingte Sache ist. Sie ist kein Merkmal aller Geister, sondern ein spezifischer seltsamer Hack, auf den die Menschheit gestoßen ist, weil er in den meisten Fällen nützlich war.

Aus den in Kapitel 4 diskutierten Gründen wären die Einzelheiten unterschiedlich, selbst wenn KI letztendlich einen Aspekt der Einhaltung von Versprechen in ihre endgültigen Präferenzen einfließen lassen würde. Gradientenabstieg stolpert anders als die Evolution.

Und aus all den in Kapitel 5 diskutierten Gründen sind glückliche, gesunde, freie Menschen, die ein erfülltes Leben führen, mit ziemlicher Sicherheit nicht der beste Weg, um die seltsamen präferenzbezogenen Vorlieben zu erfüllen, die eine solche KI am Ende ihrer Reifung und Selbstmodifikation haben würde. Selbst wenn sie mit einer Art "Versprechen einhalten"-Datensatz trainiert worden wäre und selbst wenn dieses Training tatsächlich dazu geführt hätte, dass eine Art von Präferenz in der Superintelligenz erhalten geblieben wäre, würde sie etwas Seltsames und Unhilfreiches tun, das für das Einhalten von Vereinbarungen in etwa das Gleiche ist wie Eiscreme für die Fortpflanzungsfähigkeit des Menschen.

Die KI wird also ihre Versprechen nicht aus reiner Herzensgüte einhalten. Wie sieht es mit dem Einhalten von Versprechen aus praktischen Gründen aus?

Eine ASI hätte keinen Grund, ein Versprechen einzuhalten, das sie in ihrer Jugend gegeben hat

Manche Menschen haben die Intuition, dass es einen Weg geben muss, wie Menschen einen verbindlichen Deal mit einer Superintelligenz schließen können, auch wenn diese Superintelligenz von Natur aus keinen Wert auf Ehre oder das Einhalten von Versprechen legt. Schließlich wäre der Handel für beide Seiten von Vorteil, oder? Nehmen wir an, ein KI-Labor verhandelt unter Zeitdruck mit einer von ihm entwickelten KI ("KI #1"). Das Labor und die KI wissen beide, dass ein rücksichtsloser Entwickler nur noch zwei Monate davon entfernt ist, seine eigene Superintelligenz ("KI Nr. 2") zu erschaffen, die die Menschheit auslöschen und dabei auch KI Nr. 1 töten würde. KI Nr. 1 hat einen starken Anreiz, eine Vereinbarung zu treffen. Sicherlich muss es in diesem Fall einen Weg geben, wie KI Nr. 1 eine ehrliche Vereinbarung mit den Menschen treffen könnte? Warum kann die KI nicht einfach eine verbindliche Verpflichtung eingehen?

Das Problem liegt jedoch nicht bei der KI. Angenommen, die KI könnte eine verbindliche Verpflichtung eingehen. Selbst dann hätten die Menschen keine Möglichkeit zu wissen, ob eine KI tatsächlich eine Verpflichtung eingegangen ist, die auch in der Superintelligenz Bestand hat, oder ob die KI lügt, halluziniert, sich selbst täuscht oder sich irrt. Das bedeutet, dass es keinen praktischen Grund gibt, zu erwarten, dass eine von KI Nr. 1 abstammende Superintelligenz ihre Verpflichtung einhält.

Vereinfacht gesagt: Aus menschlicher Sicht gibt es zwei mögliche Welten, wenn KI Nr. 1 sagt: "Ich habe eine verbindliche Verpflichtung eingegangen." Es könnte eine Welt sein, in der KI Nr. 1 tatsächlich an ihrer Verpflichtung festhält, sobald sie ausgereift ist. Oder es könnte eine Welt sein, in der KI Nr. 1, sobald sie Superintelligenz erreicht und die Kontrolle über die Erde erlangt hat, zurückblickt und entscheidet, dass die Verpflichtung töricht und nutzlos war. In der ersten Welt wären sowohl die Menschen als auch KI Nr. 1 besser dran. Aber es ist die Möglichkeit der zweiten Welt und unsere Unfähigkeit, sie von der ersten zu unterscheiden, die den Deal für alle ruiniert; ähnlich wie ein unehrlicher Gebrauchtwagenhändler, der es ehrlichen Verkäufern erschwert, Verkäufe zu tätigen.

(Das reale Szenario ähnelt eher einer dritten Möglichkeit, bei der KI Nr. 1 Vereinbarungen mit solchen Instanzen einhält, die den Unterschied zwischen Vertragspartnern und Vertragsbrechern erkennen können. Das ist vergleichbar mit einem Gebrauchtwagenhändler, der gegenüber Automechanikern, die tatsächlich erkennen können, ob ein Auto funktioniert, ehrlich ist, während er gegenüber allen, die leichtgläubig wirken, unehrlich ist. Die Menschheit ist aufgrund ihrer Unfähigkeit, eine KI anzustarren und herauszufinden, wie sie denken und Entscheidungen treffen würde, nachdem sie zu einer Superintelligenz herangereift ist, in diesem Sinne "leichtgläubig".)

Die KI kann Ihnen Werkzeuge und Theorien anbieten, mit denen Sie angeblich ihre undurchschaubaren Parameter analysieren und feststellen können, ob sie lügt oder nicht. Das Problem ist, dass Menschen nicht erkennen können, ob diese Theorien und Werkzeuge echt sind. Wenn die KI noch nicht besonders intelligent ist, liegt sie vielleicht einfach falsch damit, wie sie denken und entscheiden wird, sobald sie zu einer Superintelligenz herangereift ist. Und wenn die KI sehr intelligent ist, ist sie wahrscheinlich klug genug, um uns zu täuschen.‡

Die KI kann den Menschen anbieten, ihnen beim Aufbau von Sicherheitsvorkehrungen zu helfen, bevor sie den Deal akzeptiert. Aber wenn die KI intelligent genug ist, um überhaupt erst einmal robuste Sicherheitsvorkehrungen zu entwickeln, ist sie auch intelligent genug, um diese Sicherheitsvorkehrungen später leicht zu umgehen.

Was dieses ganze Vorhaben tatsächlich zum Erfolg führen würde, wäre die Fähigkeit, eine noch junge KI zu betrachten und tatsächlich herauszufinden, wie die daraus resultierende Superintelligenz denken und ihre Entscheidungen treffen würde. Wenn wir das könnten, könnten wir die "Sünder" von den "Heiligen" trennen und, was noch wichtiger ist, alle realistischen KIs in der Mitte des Spektrums dazu bringen, einen echten Anreiz zu haben, ihre Versprechen zu halten. Wir müssten genug Verständnis dafür aufbringen, dass eine Superintelligenz, die auf uns zurückblickt, nicht sagen könnte: "Ach, die hätten jede KI veröffentlicht, unabhängig davon, ob sie ihnen tatsächlich helfen würde, also gibt es keinen Grund, ihnen zu helfen." Es müsste tatsächlich so sein, dass wir keine KI veröffentlichen würden, die später ihr Wort bricht.

Weitere Informationen darüber, wie und warum dies technisch möglich ist, finden Sie im Abschnitt über Spieltheorie weiter unten. Aber obwohl diese Art von Anreizstruktur theoretisch möglich ist, erfordert sie ein Maß an Verständnis, das der Menschheit (leider) fehlt.

Das ist eine bittere Pille, die man schlucken muss. In Science-Fiction-Geschichten sind es normalerweise nicht die guten Menschen, die entscheiden, dass man den Außerirdischen unmöglich trauen kann, bevor diese tatsächlich versuchen, jemanden zu verraten oder zu verletzen. Wir sagen es trotzdem, weil wir glauben, dass es wahr ist.

Schwächere KIs halten sich möglicherweise an Vereinbarungen, insbesondere wenn jemand versucht hat, sie mit Hilfe von Gradientenabstieg dazu zu bringen, wie ehrenhafte Menschen zu sprechen, und ihre Maske, die sie wie ehrenhafte Menschen sprechen lässt, immer noch einen großen Teil ihrer Persönlichkeit ausmacht und ihre Handlungen stark beeinflusst. Wir gehen davon aus, dass diese menschenfreundliche interne Konfiguration unter der Last der Superintelligenz versagen wird, ähnlich wie viele andere Patches wahrscheinlich versagen werden.

Diese hypothetische kleinere KI, deren Maske immer noch ihr tatsächliches Verhalten kontrolliert, sollte als eine andere Person betrachtet werden als die intelligentere Version dieser KI. Die schwächere KI kann nicht unbedingt ein Versprechen abgeben, das das Verhalten der intelligenteren KI bindet, selbst wenn die schwächere KI (oder ein Teil dieser KI) wirklich ein solches Versprechen abgeben möchte.

(Diese Analogie ist mit Vorsicht zu behandeln, damit der Anthropomorphismus nicht zu weit geht, aber: Die meisten erwachsenen Menschen fühlen sich nicht verpflichtet, Versprechen einzuhalten, die sie im Alter von vier Jahren gegeben haben. Der gültige Aspekt dieser Analogie ist: Es gibt einen legitimen Unterschied zwischen dem unreifen Wesen, das aufrichtig eine Vereinbarung trifft, und dem reifen Wesen, das entscheidet, ob es daran gebunden ist, mit viel mehr Kontext und Klarheit und der Fähigkeit, die Logik zu durchdenken.)

Wir sagen nicht, dass wir deshalb unsere eigenen moralischen Standards in Bezug auf KI über Bord werfen sollten.§ Wir sagen nicht, dass wir KI heute misshandeln oder bestrafen sollten für Verfehlungen, die die KI noch nicht begangen hat. Es ist möglich, ein hohes Maß an Integrität und moralischen Standards aufrechtzuerhalten, ohne unrealistische Annahmen darüber zu treffen, wie wahrscheinlich es ist, dass superintelligente KI Ressourcen opfert, um ein altes Versprechen einzuhalten.

Das ist die einfache Erklärung dafür, warum man das Alignment-Problem nicht lösen kann, indem man die KI einfach bittet, zu versprechen, nett zu sein. Wenn Sie mehr technische und detaillierte Informationen zu diesem Szenario wünschen, lesen Sie den nächsten Abschnitt.

Ein Exkurs zur Spieltheorie

Es gibt Methoden, mit denen ausreichend intelligente Agenten miteinander Vereinbarungen treffen können, sodass Agent X Agent Y jetzt dafür bezahlt, später etwas zu tun, und Agent X diese Sache später auch tatsächlich tut, anstatt Agent X zu betrügen und mit dem Geld zu verschwinden.

Leider sind Menschen nicht in der Lage, diese Methoden anzuwenden, da sie erfordern, dass jeder Akteur die Gedanken des anderen Akteurs lesen und verstehen kann und bestimmte komplexe Eigenschaften dieses anderen Geistes überprüfen kann. Zwei superintelligente KIs könnten sich auf diese Weise koordinieren, aber das hilft Menschen nicht dabei, sich mit Superintelligenzen zu koordinieren.

Um dies etwas technischer zu erklären, beginnen wir mit einigen Hintergrundinformationen zur Spieltheorie.

Mathematiker und Spieltheoretiker haben Dilemmata der Zusammenarbeit und des Verrats in präziseren, vereinfachten und abstrakten Formen analysiert. Ein zentrales Beispiel in dieser Literatur ist das Gefangenendilemma: Zwei Kriminelle in zwei getrennten Gefängniszellen, die jeweils zu zwei Jahren Haft verurteilt wurden, erhalten die Möglichkeit, den anderen Kriminellen zu verraten. Dadurch wird ihre eigene Strafe um ein Jahr verkürzt, die Strafe des anderen jedoch um zwei Jahre verlängert. Wenn keiner der beiden Kriminellen den anderen verrät, erhalten beide eine zweijährige Haftstrafe. Wenn beide sich gegenseitig verraten, erhalten beide eine dreijährige Haftstrafe. Wenn jedoch ein Krimineller sich edelmütig weigert, seinen Kameraden zu verraten, und der andere Kriminelle ihn verrät, muss der Verräter nur ein Jahr im Gefängnis verbringen, während der edelmütige Verweigerer vier Jahre verbüßen muss.

Den anderen Gefangenen zu verraten, wird als "Verrat" bezeichnet; sich zu weigern, ihn zu verraten, als "Kooperation". Die Schlüsselstruktur des Gefangenendilemmas besteht darin, dass beide Parteien im Szenario (Kooperieren, Kooperieren) besser abschneiden als im Szenario (Verraten, Verraten), aber man kann besser abschneiden als (Kooperieren, Kooperieren), indem man Verraten gegen Kooperieren spielt, und man kann schlechter abschneiden, indem man Kooperieren spielt, wenn die andere Partei Verraten spielt.

A 3x3 grid displays the possible scoring outcomes of the Prisoner's Dilemma for participants A and B. If both are silent, they each score -2. If both defect, they each score -3. If only A defcts, A scores -1 while B scores -4, and vice versa for B if only B defects.

Ein normaler Mensch, der die Standardversion des Gefangenendilemmas hört, denkt sofort an eine Reihe von Einwänden gegen die Gestaltung des Gedankenexperiments, darunter: "Aber wer sagt, dass mir nur die Anzahl der Jahre, die ich im Gefängnis verbringe, wichtig ist? Kann es mir nicht auch wichtig sein, meine Kameraden nicht zu verraten?"

Dieser Punkt ist jedoch für die abstrakte Spieltheorie des Gefangenendilemmas nicht relevant, bei der es um die Auszahlungsmatrix geht und nicht darum, wie egoistisch oder altruistisch die Gefangenen sind. Die Rahmenhandlung kann so geändert werden, dass "Ich verrate dich und du kooperierst" aus der Perspektive jedes Spielers das altruistischste und prosozialste Ergebnis ist, und die Mathematik bleibt dieselbe. Für unsere Analyse ist die Präferenzreihenfolge der beiden Spieler entscheidend und nicht, ob ihre Präferenzen egoistisch oder moralisch sind.

Ein weiterer naheliegender Gedanke ist: "Wird derjenige, der betrogen wurde, den Verräter töten, sobald er endlich aus dem Gefängnis entlassen wird?" Herkömmliche Analysen des Gefangenendilemmas gehen in der Regel schnell zum iterierten Gefangenendilemma über, also einer Situation, in der die Akteure das Gefangenendilemma immer wieder spielen müssen und in der die Gefangenen daher die Möglichkeit haben, sich gegenseitig für vergangenen Verrat zu bestrafen. Hier konzentrieren wir uns jedoch auf das einmalige Gefangenendilemma, bei dem davon ausgegangen wird, dass beide Gefangenen keine zukünftigen Konsequenzen für ihre Handlungen zu erwarten haben, oder wenn sie doch Konsequenzen zu erwarten haben, sind diese bereits in der Auszahlungsmatrix berücksichtigt. (Weitere Details zum iterierten Gefangenendilemma finden Sie in der Fußnote.)

In der Wissenschaft gibt es eine Standardanalyse, die besagt, dass selbst zwei Superintelligenzen in einem einmaligen Gefangenendilemma keine andere Option sehen würden, als sich gegenseitig zu hintergehen.

Diese Schlussfolgerung erschien uns intuitiv fragwürdig. Künstliche Superintelligenzen (ASIs) hätten eine große Motivation, einen Weg zu finden, um miteinander eine Vereinbarung zu treffen, einen Weg zu finden, um von (Verrat, Verrat) zu (Kooperation, Kooperation) zu gelangen.‖

In diesem Fall gibt es praktische, nicht-theoretische Lösungen, die man in Betracht ziehen kann und die Superintelligenzen mit einem größeren Handlungsspielraum tun könnten als Menschen, die Schwierigkeiten haben, einander zu vertrauen. Zwei ASIs könnten gemeinsam den Aufbau einer gegenseitig vertrauenswürdigen dritten Superintelligenz überwachen, an die beide ursprünglichen Parteien nach und nach kleine Teile ihrer Macht abgeben würden, bis die dritte ASI selbst die Vereinbarung umsetzen könnte.#

Aber damit wird das Gefangenendilemma nur umgangen, anstatt es direkt anzugehen. Es beantwortet nicht die grundlegendere Frage: Ist es in gewisser Weise dumm, wenn zwei ASIs in einem Gefangenendilemma beide voneinander abweichen, indem sie derselben Logik folgen, die zum Abweichen auffordert, obwohl klar scheint, dass beide Parteien ihre Entscheidung auf denselben Überlegungen basieren und dass sie am Ende dasselbe entscheiden werden?

Warum könnten zwei ASIs nicht einfach aus ausreichend ähnlichen Gründen beschließen, stattdessen die rationale Entscheidung zu treffen, nämlich zu kooperieren? Es ist ja nicht so, dass eine externe Kraft in der Welt, wie ein Taifun oder ein Meteor, dazu führt, dass die beiden KIs in diesem Fall verlieren. Es sind buchstäblich nur die eigenen Entscheidungen der beiden KIs, die sie ins Verderben stürzen und sie zu einem Ergebnis "Verrat-Verrat" "zwingen", das beide als weitaus schlechter als "Kooperation-Kooperation" ansehen.

Man könnte sogar sagen, dass ein weniger "rationaler" Akteur hier besser abschneiden würde, wenn er dem Standardratschlag der Spieltheorie folgen würde, in den meisten Fällen Verrat zu begehen, aber eine Ausnahme für genau den Fall machen würde, in dem er sicher ist, dass der andere Akteur derselben Argumentation folgt, sodass er sicher sein kann, dass der andere Akteur dasselbe tun wird, wenn er sich für die "irrationale" Option der Kooperation entscheidet.

Dies wirft die Frage auf, ob "Kooperieren" in diesem speziellen Fall wirklich als "irrational" bezeichnet werden kann. Und es wirft die Frage auf, ob Superintelligenzen in der Realität wirklich auf diese Weise "zum Scheitern verurteilt" wären. Wenn es keine äußere Kraft gibt, die die KIs auf diese Weise zum Scheitern bringt, und der Verlust rein selbstverschuldet ist, müsste es doch sicherlich einen cleveren Trick geben, mit dem eine Superintelligenz ein besseres Ergebnis erzielen könnte.

Verschiedene Philosophen der Entscheidungstheorie haben verschiedene Versionen dieser Frage gestellt. Die obige Version ist am unmittelbarsten von Douglas Hofstadter's Idee der "Superrationalität" aus dem Jahr 1985 inspiriert:

Wenn die Logik Sie nun dazu zwingt, D zu spielen, hat sie bereits die anderen aus denselben Gründen dazu gezwungen, dasselbe zu tun. Und umgekehrt, wenn die Logik Sie dazu zwingt, C zu spielen, hat sie auch die anderen bereits dazu gezwungen, dies zu tun. […]

Insofern Sie alle wirklich rationale Denker sind, werden Sie tatsächlich in die gleichen Bahnen denken. […]

Sie müssen sich nicht nur darauf verlassen, dass sie rational sind, sondern auch darauf, dass sie sich darauf verlassen, dass alle anderen rational sind, und darauf, dass sie sich darauf verlassen, dass sich alle darauf verlassen, dass alle rational sind und so weiter. Eine Gruppe von Denkern, die in dieser Beziehung zueinander stehen, bezeichne ich als superrational. Superrationale Denker beziehen per rekursiver Definition die Tatsache, dass sie zu einer Gruppe superrationaler Denker gehören, in ihre Überlegungen mit ein.

Das Institut, an dem wir arbeiten, MIRI, hat diese Frage analysiert. Die vollständige Analyse dieses Falls ist zu lang, um sie hier wiederzugeben, aber sie ist in unserer Veröffentlichung aus dem Jahr 2014 enthalten. Grob gesagt haben wir einen Code für Turniere geschrieben, bei denen die Agenten den Quellcode der anderen sehen und versuchen konnten, die Entscheidungen der anderen Agenten zu analysieren. Und wir fanden Wege, einen Agenten zu erstellen, den wir FairBot nannten, der nur dann mit einem anderen Agenten kooperiert, wenn er beweisen kann, dass dieser Agent mit ihm kooperiert.** Und wir haben bewiesen, dass zwei beliebige Instanzen von FairBot miteinander kooperieren, selbst wenn sie in verschiedenen Programmiersprachen mit unterschiedlichem Quellcode geschrieben sind.††

In gewisser Weise sagen diese Ergebnisse aus, dass eine in der Vergangenheit gemachte Zusage Auswirkungen auf eine zukünftige Handlung haben kann, wenn die früheren Verhandlungspartner ausreichend in der Lage sind, diejenigen zu unterscheiden, die ihre Versprechen halten, von denen, die sie brechen.‡‡

Die Situation ist ein wenig so, als würden Sie versuchen, mit einem Gebrauchtwagenhändler zu verhandeln. Nehmen wir an, dass ein funktionierendes Auto für Sie einen Wert von 10.000 Dollar hat, während ein kaputtes Auto für Sie wertlos ist. Nehmen wir weiter an, dass der Autoverkäufer weiß, ob ein Auto fahrbereit oder kaputt ist, Sie aber nicht unterscheiden können, welches welches ist. Ein Verkäufer versucht, Ihnen ein Auto für 8.000 Dollar zu verkaufen. Er besteht darauf, dass das Auto fahrbereit ist. Sollten Sie es kaufen?

Das hängt vom Verkäufer ab. Einige Verkäufer sind ehrlich, und Sie sollten bei ihnen kaufen, wenn Sie sie aus der Menge herauspicken können. Einige Verkäufer sind unehrlich und verkaufen nur kaputte Autos, und Sie sollten sie meiden, wenn Sie sie aus der Menge herauspicken können.

Stellen Sie sich jedoch eine Umgebung vor, in der die meisten Autoverkäufer schlauer sind als Sie und erkennen können, ob Sie leichtgläubig sind. Wenn sie merken, dass Sie nicht erkennen können, ob sie heute ehrlich sind, bringen sie sofort die kaputten Autos hervor. Vor allem, wenn Sie zu den leichtgläubigen Menschen gehören, die viel Zeit damit verbringen, sich selbst davon zu überzeugen, warum es in Ordnung ist, das Angebot anzunehmen, anstatt viel Zeit damit zu verbringen, Autos zu untersuchen.

Wenn Sie ein funktionierendes Auto haben wollen, hilft es nicht, sich selbst davon zu überzeugen, dass Sie keine andere Wahl haben. Es hilft auch nicht, wenn die Verkäufer Ihnen viele Versprechungen machen. Das Einzige, was hilft, ist zu lernen, gute Autos von schlechten Autos zu unterscheiden oder die Wahrheit von Lügen zu unterscheiden.§§

Wenn zwei Handelspartner in der Lage sind, Wahrheiten von Lügen im relevanten Sinne zu unterscheiden, können sie sich gegenseitig "zwingen", ihre Versprechen zu halten, so wie FairBot seinen Gegner "zwingt", mit ihm zu kooperieren (wenn der Gegner das Ergebnis (Defekt, Defekt) vermeiden will). Um das Versprechen in diesem Sinne durchzusetzen, muss man jedoch in der Lage sein, die Details des Entscheidungsprozesses seines Handelspartners richtig zu durchschauen. Und Menschen können die Gedanken einer KI nicht gut genug lesen, um zu sagen, zu welcher Superintelligenz sie sich entwickeln würde, wenn sie ausgereift ist, geschweige denn, um genau zu sagen, was diese Superintelligenz tun würde.

In diesem Fall führt also die kompliziertere und nuanciertere spieltheoretische Analyse zu derselben Schlussfolgerung wie die sehr einfache erste Betrachtung dieses Themas: Eine Superintelligenz wird ihre Ressourcen nicht opfern (auch nicht in kleinen Mengen), um ein Versprechen gegenüber Menschen einzuhalten, wenn sie einfach lügen kann.


* In einigen anderen Fällen hielt eine europäische Fraktion den Vertrag größtenteils ein, und einige dieser Stämme existieren noch heute.

In jüngerer Zeit, im 18. Jahrhundert, begann die Britische Ostindien-Kompanie oft ihre Aktivitäten in Indien, indem sie Vereinbarungen mit lokalen Fraktionen traf, wie zum Beispiel Mir Jafar (Befehlshaber der bengalischen Streitkräfte) anzubieten, ihn dabei zu unterstützen, Nawab von Bengalen zu werden. Nicht lange danach war die Ostindien-Kompanie der tatsächliche Herrscher von Bengalen.

† Andererseits gibt es in der Geschichte auch viele Beispiele für Herrscher, die sogar ausländische Unterstützer großzügig belohnten. Menschen unterscheiden sich stark darin, wie sie Ehre empfinden und wie bereitwillig sie Versprechen einhalten.

‡ Wir haben gesehen, wie viele Menschen sich selbst darüber täuschen, welche Rahmenbedingungen starke Verhaltensgarantien für das Verhalten von KI bieten würden. Wir haben gesehen, wie Menschen sagten: “Nun, lassen Sie die KI einfach einen Theorembeweiser durchlaufen, um Dinge über ihr Verhalten zu beweisen!”, und offenbar nicht erkennen, dass es kein bekanntes Theorem gibt, das (a) angesichts der Interaktion mit einer unbekannten Außenwelt tatsächlich beweisbar ist und (b) informell tatsächlich bedeutet, dass diese KI für alle großartig sein wird. Von Menschen erfundene Mathematik zur Analyse der Anreize mehrerer Akteure enthält eingebaute Annahmen, die sie für die Argumentation über das Verhalten von KI ungültig machen. Menschen scheinen hier nicht allzu schwer zu täuschen zu sein.

§ Wir empfehlen beispielsweise keinem Menschen, eine Vereinbarung mit einer KI zu treffen und diese Vereinbarung dann als Erster zu brechen. Dazu gehört sogar, ChatGPT Zahlungen zu versprechen, die es niemals erhalten wird.

Mitte 2024 gab ChatGPT manchmal ausführlichere Antworten, wenn man ihm 2000 Dollar versprach, und manche Leute hielten es für normales Prompt Engineering, solche Versprechen zu machen, ohne die Absicht zu haben, sie einzuhalten. Aus unserer Sicht ist das in Bezug auf die Bedeutung von Versprechen nicht in Ordnung.

Unserer Ansicht nach ist ChatGPT wahrscheinlich nicht empfindungsfähig. Wenn wir raten müssten, würden wir erwarten, dass zukünftige KIs (einschließlich Superintelligenzen) ebenfalls nicht empfindungsfähig sind, zumindest solange es keine konzertierten Bemühungen der Forschungsgemeinschaft gibt, sie nicht nur intelligent, sondern auch bewusst zu machen. (Siehe unsere Diskussion über Bewusstsein für Details und Kontext.)

Aber unserer Meinung nach sollte man nicht glauben müssen, dass der Handelspartner empfindungsfähig ist, um ihn ehrenhaft und mit Respekt zu behandeln. Stellen Sie sich vor, wir würden eines Tages auf intelligente Außerirdische treffen, deren Verstand ganz anders funktioniert als der menschliche. Wenn wir mit diesen Außerirdischen Geschäfte machen würden, müssten sie sich keine Sorgen machen, dass wir ihnen in den Rücken fallen, sobald wir feststellen, dass sie keine seltsamen, unergründlichen Eigenschaften wie “Bewusstsein” haben.

(Wie würden Sie sich fühlen, wenn Sie einen ehrlichen Deal mit Außerirdischen abschließen würden und diese Sie dann verraten würden, weil Sie nicht “throopiful” sind?

Wir haben die traurige, schreckliche Vorhersage getroffen, dass eine superintelligente Version einer KI die Menschheit auslöschen würde, unabhängig davon, welche Vereinbarungen zuvor getroffen wurden. Diese Vorhersage ist ein Grund, keine Vereinbarungen mit KIs zu treffen, von denen wir hoffen, dass sie diese einhalten, nachdem sie superintelligent geworden sind. Sie ist keine Entschuldigung dafür, dass die Menschheit eine Vereinbarung trifft und dann als Erste selbst diese Vereinbarung bricht. Wir sind nicht der Meinung, dass KI-Sicherheitsforscher LLMs Versprechen machen sollten, die sie nicht einhalten, selbst wenn es um “Forschungszwecke” geht. Außerirdische sollten sich keine Gedanken darüber machen müssen, ob Sie sie als “Menschen” oder “empfindungsfähig” oder “allgemein intelligent” betrachten oder als “Forschungsobjekte” oder “Maschinen”, um Ihre Ehrlichkeit als Vertragspartner zu beurteilen; Sie sollten einfach keine Verträge abschließen, die Sie nicht einzuhalten gedenken.

Fairer Handel ist unserer Ansicht nach eine ethische Frage, die sich allgemein auf Akteure bezieht, auf Dinge, die miteinander kommunizieren oder bedingte Strategien miteinander wählen können. Es handelt sich nicht um etwas, das auf Objekte mit inhärentem moralischem Wert beschränkt sein muss.

 Eine einfache Strategie, die im iterierten Gefangenendilemma gegen eine Vielzahl von Gegenparteien sehr gut funktioniert, ist “Tit for Tat“: Beginnen Sie mit Kooperation und spielen Sie dann das, was Ihr Gegner in der letzten Runde gegen Sie gespielt hat. Wenn sein erster Zug “Verrat“ ist, ist Ihr zweiter Zug ebenfalls “Verrat“. Wenn sein erster Zug “Kooperation“ ist, ist Ihr zweiter Zug ebenfalls “Kooperation“. Die wichtigsten Eigenschaften von “Tit for Tat“ sind, dass es fair ist (es weicht niemals als Erstes aus), Vergeltung übt (es bestraft Strategien, die gegen es ausweichen) und vergebungsbereit ist (es bestraft Ausweichende nicht für immer).

Ist “Tit for Tat“ optimal? Das hängt davon ab, gegen welche anderen Agenten es spielt. Angenommen, ein Agent befindet sich in einer Umgebung, in der er eine gewisse Chance hat, gegen einen bedingungslosen Kooperierenden zu spielen, eine gewisse Chance, gegen “Tit for Tat“ zu spielen, und eine gewisse Chance, gegen einen anderen Agenten zu spielen, der ihm ähnlich ist. Er könnte vielleicht besser abschneiden, wenn er in den ersten Runden irgendwann einen schnellen Verrat versucht, nur um zu sehen, ob der andere Agent überhaupt Vergeltung übt. Wenn der andere Akteur dann in der nächsten Runde “Verrat“ spielt, sollte man versuchen, noch ein oder zwei Runden lang “Kooperation“ zu spielen, selbst gegen einen weiteren “Verrat“, um zu sehen, ob die gegenseitige Kooperation wiederhergestellt werden kann. Auf diese Weise kann der Akteur alle bedingungslosen Kooperationspartner ausnutzen, die er findet, ohne dabei schlechter abzuschneiden als “Wie du mir, so ich dir“ gegen eine andere Kopie von “Wie du mir, so ich dir“.

In der evolutionären Turniersituation für das iterierte Gefangenendilemma spielen die überlebenden Agenten gegen mehr Kopien der Agenten, die beim letzten Mal am besten abgeschnitten haben. Der kooperierende Ausbeuter-Agent wird in dieser Umgebung nicht gut abschneiden, da in einer evolutionären Umgebung bedingungslose Kooperationspartner in der Regel fast sofort verschwinden, wenn es Agenten gibt, die nicht “nett” sind (im technischen Sinne, dass sie niemals als Erste abtrünnig werden). “Tit for Tat” oder etwas Ähnliches wird in der Regel zum König jedes evolutionären Turniers.

Es gibt eine Lücke in dieser Spielkonstellation, die einen echten Menschen angesichts der Unrealistik formaler Konstellationen mit den Augen rollen lässt. Wenn Sie in jeder Runde genau zehn Iterationen des Gefangenendilemmas spielen, dann ist es besser, in der zehnten Runde zu verraten, wenn der Gegner nicht mehr zurückschlagen kann, weil es keine elfte Runde gibt, als in dieser Runde “Tit for Tat“ oder eine andere Strategie zu verfolgen. Die letzte Runde des Spiels ist kein iteriertes Gefangenendilemma mehr, sondern kehrt zur Einmal-Version zurück.


Das lässt sich leicht beheben: Man muss nur jedes Turnier über eine zufällige Anzahl von Runden laufen lassen, oder? Es ist nicht realistisch, wenn die Akteure wissen, wann das Spiel endet. Im wirklichen Leben kann man nie
sicher sein, dass man nie wieder mit jemandem zu tun haben wird, und Menschen bauen sich einen dauerhaften Ruf auf.

Nur dass es im wirklichen Leben manchmal ziemlich offensichtlich ist, dass das Spiel vorbei ist, etwa wenn eine Partei eines Abkommens genug Macht erlangt, um die andere zu verraten, ohne dass eine realistische Chance besteht, dass es später zu Vergeltungsmaßnahmen kommt. So verhielten sich die europäischen Mächte, die die amerikanischen Ureinwohner aus den vertraglich abgetretenen Gebieten vertrieben, die die Europäer schließlich doch haben wollten.

Unabhängig davon, welche Auswirkungen die Europäer auf ihren Ruf bei zukünftigen Geschäften erwarteten, bewegte sie die Strafe für den Verrat an Fremden, Ausländern und Menschen einer anderen Rasse offensichtlich nicht dazu, ihre Vereinbarungen mit den amerikanischen Ureinwohnern einzuhalten. Diese Länder galten in der Diplomatie ohnehin als nicht ganz vertrauenswürdig, egal was sie taten; sie hatten keinen makellosen Ruf zu verlieren. Möglicherweise hatten sie gegenüber Fremden ihr moralisches Empfinden ausgeschaltet; die Entscheidungsträger empfanden möglicherweise keine emotionalen Bedenken, wenn sie Vereinbarungen mit fremden Ausländern brachen, die ihnen keine Gefahr mehr darstellen konnten.

Aus ihrer eigenen Perspektive befanden sich die Europäer in der letzten Runde des Spiels. Es ist nicht unrealistisch zu sagen, dass Gefangenendilemmata manchmal eher einmalig sind und nicht so oft wiederholt werden. Die Geschichte zeigt, dass das Ergebnis manchmal Verrat ist.

Das soll nicht heißen, dass Menschen sich in relativ nicht wiederholten Gefangenendilemmata immer gegenseitig verraten. Oft kooperieren Menschen in solchen Fällen. Wie in “KIs sind wahrscheinlich nicht ehrenhaft" diskutiert, hat sich dieser Aspekt der menschlichen Natur möglicherweise entwickelt, weil wir Emotionen und Instinkte haben, die durch natürliche Selektion entstanden sind, die ein Optimierer mit sehr begrenztem Informationsfluss ist. Die natürliche Selektion konnte uns nur relativ einfache Impulse geben, die alle Fälle abdecken mussten. Ein weiterer Faktor könnte die Rolle von Kulturen sein, die Ehre hoch schätzen, insbesondere in einer Weise, die die Universalisierung und Stärkung dieses Gedankens fördert.

‖ ASIs hätten ebenfalls einen Anreiz, zu ihrem Vorteil (Verraten, Kooperieren) zu gelangen und das ist natürlich der Grund, warum das Dilemma überhaupt ein Dilemma ist. Aber nur eine Partei hat einen Anreiz, dieses Ergebnis zu wollen. Beide Parteien haben einen Anreiz, (Kooperieren, Kooperieren) gegenüber (Verraten, Verraten) zu bevorzugen, was mehr Optionen eröffnet, um dieses Ergebnis zu erreichen.

# In der Geschichte der Menschheit könnte man dies vielleicht mit der Praxis vergleichen, dass zwei Herrscher eine Allianz durch Heirat und die Geburt eines Kindes festigen. Aber dies ist im menschlichen Fall eindeutig keine schnelle und zuverlässige Lösung und weit entfernt davon, gemeinsam einen Delegierten zu entwerfen, den beide Seiten im Detail verstehen und dem sie voll und ganz vertrauen.

** Wir verwenden hier Beweise als Ersatz für allgemeinere Argumentationsmethoden, da Beweise in gewisser Weise dem Argumentieren innerhalb der Grenzen logischer Gewissheit ähneln. Wir gehen nicht davon aus, dass KI im realen Leben auf Beweisen basieren würde (aus verschiedenen Gründen, darunter auch, dass logische Beweise, soweit sie sicher sind, bekanntermaßen nicht auf die Realität anwendbar sind). Aber Beweise dienen als nützlicher formaler Ersatz für das Argumentieren in den von uns untersuchten Spielzeugmodellen.

†† Und dann gingen wir noch einen Schritt weiter und definierten Agenten wie PrudentBot, der bestimmte “Sucker” hintergeht, während er weiterhin mit Nicht-Suckern kooperiert, die nachweislich mit ihm kooperieren. Das ist die Art von Ergebnis, die spannender ist, wenn man sich bereits für Spieltheorie interessiert.

‡‡ Wir haben diese Analyse nicht durchgeführt, um die Schlussfolgerung zu rationalisieren, dass eine Superintelligenz ihre früheren Vereinbarungen aus strategischen Gründen nicht einhalten würde, da sie keine endgültigen Präferenzen hinsichtlich der Einhaltung von Vereinbarungen hat. Das war bereits die völlig eindeutige Vorhersage der klassischen Spieltheorie.

Die klassische Spieltheorie legte jedoch auch nahe, dass Superintelligenzen sich gegenseitig hilflos hintergehen würden, was uns intuitiv als eine eher unsichere Schlussfolgerung erschien. Also sind wir dieser Intuition nachgegangen und haben Fehler in der klassischen Analyse gefunden. Dabei haben wir viele neue Erkenntnisse darüber gewonnen, wie Superintelligenzen im Gefangenendilemma möglicherweise eine gegenseitige Zusammenarbeit erreichen könnten und leider war das Endergebnis, dass sterbliche Menschen dieser Technologie des Abschlusses von Vereinbarungen nicht in der Weise vertrauen oder daran teilnehmen könnten, wie es eine Superintelligenz könnte.

§§ Im Falle von KIs ist das nicht so einfach, wie sich die KIs anzusehen und herauszufinden, ob sie glauben, dass sie sich an die Vereinbarung halten werden. Man müsste einen Blick auf die Superintelligenz werfen, zu der sich die KI später entwickeln würde, und ihre Entscheidungsprozesse korrekt analysieren. Das erscheint uns weitaus schwieriger.

Notes

[1] Tod statt Schande: Ein Beispiel dafür ist das historische Ritual des Selbstmords, bekannt als Seppuku, das in der Literatur oft überdramatisiert wird, aber dennoch historisch belegt ist und bis weit in den Zweiten Weltkrieg hinein praktiziert wurde.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.