Orthogonalität: KI kann (fast) jedes Ziel haben
Ein Dialog über korrekte Nester, Fortsetzung
In Kapitel 5 haben wir die Geschichte der Correct-Nest-Aliens erzählt, die sich so entwickelt haben, dass sie es zutiefst und intuitiv für "richtig" halten, eine Primzahl von Steinen in ihrem Nest zu haben. Wir können uns einen Teil ihrer Unterhaltung wie folgt vorstellen:
VOGELJUNGE: Kommen wir zurück zu dem Punkt, an dem du gesagt hast, dass es dich überraschen würde, Aliens mit Sinn für Humor zu finden. Du gehörst doch sicher nicht zu den Menschen, die glauben, dass die Nester, in denen wir leben, nur willkürlich sind?
VOGELMÄDCHEN: Ganz und gar nicht. "Dreizehn ist richtig, neun ist falsch" ist eine wahre Antwort auf eine Frage, die wir aufgrund unserer Natur von Geburt an stellen. Ein Außerirdischer, der zu anderen Dingen neigt, widerspricht uns nicht in der Frage, ob dreizehn richtig ist. Es ist, als würde man einen Außerirdischen treffen, dem der Sinn für Humor fehlt. Die Existenz eines solchen Außerirdischen beweist nicht, dass keine Witze lustig sind! Es hilft nur zu zeigen, dass "lustig" etwas in uns ist.
VOGELJUNGE: In uns? Ich weiß nicht, ich halte mich für ziemlich humorvoll. Als Nächstes wirst du noch sagen, dass alle Arten von Humor gleich gut sind!
VOGELMÄDCHEN: Du hast vielleicht einen besseren Sinn für Humor als die meisten anderen! Aber "einen besseren Sinn für Humor zu haben" ist auch etwas, das in uns liegt. Es gibt keinen kosmischen Maßstab, mit dem wir beurteilen können, wie ausgeprägt der ästhetische Geschmack eines Menschen ist. Die Bewertung von Humor findet in unserem Kopf statt. Wir sind diejenigen, die den Maßstab haben; wir sind diejenigen, denen er wichtig ist.
VOGELJUNGE: Also sind wir wieder bei der Willkür angelangt.
VOGELMÄDCHEN: Nein! Nun, vielleicht? Es kommt darauf an, was du mit "willkürlich" meinst.
VOGELJUNGE: Häh?
VOGELMÄDCHEN: Ich weiß zum Beispiel, dass du Vanille-Vogelfutter liebst, oder? Und es ist nicht so, dass du mit bloßer Willenskraft stattdessen Schokoladen-Vogelfutter lecker finden könntest. Es ist also nicht "willkürlich", es ist nichts, was man einfach aus einer Laune heraus ändern kann.
VOGELJUNGE: Okay, klar ...
VOGELMÄDCHEN: Es gibt keine objektive Antwort darauf, ob Vanille oder Schokolade besser schmeckt, aber es ist auch keine Entscheidung, die du selbst treffen kannst. Es ist einfach so, wie du bist. Deine Vorlieben hängen nicht von dir ab und sind auch nicht für jeden anderen Verstand objektiv überzeugend. Wenn du einen Außerirdischen treffen würdest, könntest du ihn nicht mit bloßer Logik davon überzeugen, Vanille-Vogelfutter lecker zu finden, und du könntest ihn auch nicht davon überzeugen, einen Sinn für Humor zu haben.
VOGELJUNGE: Ich kann es versuchen!
VOGELMÄDCHEN: Ich drücke dir die Daumen. Aber vielleicht lässt sich das besser so ausdrücken: Gute Witze haben eine komplizierte Eigenschaft, und unser Gehirn berechnet, ob Äußerungen diese Eigenschaft haben, die wir "Humor" nennen. Und wir freuen uns, wenn eine Äußerung diese Eigenschaft hat. Das Vorhandensein oder Fehlen dieser Eigenschaft ist eine objektive Tatsache über eine Äußerung (wie von dir in einem bestimmten Kontext berechnet). Ein Außerirdischer könnte lernen, diese Berechnung durchzuführen. Aber der Teil, in dem wir diese Eigenschaft als erfreulich empfinden, ist nicht objektiv. Es ist weniger eine Vorhersage als vielmehr ... nun, es ist nicht gerade ein Steuerungsziel, aber es ist eine weitere Tatsache über uns, die auf die meisten Außerirdischen nicht zutreffen würde, weil sich unser Humor auf einem seltsamen, gewundenen Evolutionsweg entwickelt hat, der normalerweise nicht vorkommt. Es ist nicht so, dass die Außerirdischen sich irren, welche Witze lustig sind; es ist nur so, dass ihr Gehirn Humor gar nicht erst berechnet, genauso wenig wie sie ihre Behausungen danach beurteilen, ob die Anzahl der Steine darin korrekt ist. Es ist ihnen einfach egal.
VOGELJUNGE: Mann, das ist eine deprimierende Sicht auf das Universum. Außerirdische, die nie lachen, die Nester mit völlig falschen Steinen haben ... Wenn die Außerirdischen genug Zeit damit verbringen würden, darüber nachzudenken, würden sie dann nicht erkennen, wie viel ihnen entgeht? In falschen Nestern leben, Witze nicht lustig finden, Vanille-Vogelfutter völlig ignorieren. Würden sie nicht irgendwann einen Weg finden, diese Mängel zu beheben und sich einen Sinn für Humor und alles andere, was ihnen fehlt, anzueignen?
VOGELMÄDCHEN: Ich könnte mir vorstellen, dass Außerirdische sich verändern und weiterentwickeln und sich neue Ziele setzen wollen. Aber warum sollten sie genau diese Veränderungen wählen?
VOGELJUNGE: Weil es so billig wäre! Zu dem Zeitpunkt, an dem diese Außerirdischen technologisch so weit fortgeschritten wären, dass sie sich selbst frei verändern könnten, würden sie wahrscheinlich schon zwischen den Sternen umherstreifen. Es würde nur einen winzigen Bruchteil ihrer gesamten Ressourcen kosten, die richtige Anzahl an Steinen in ihre Nester zu legen! Und denken Sie nur an all die fantastischen Witzbücher, die sie erstellen könnten, wenn sie nur einen winzigen Bruchteil ihrer Ressourcen in die Erforschung von Humor stecken würden! Im Vergleich zu ihrem Reichtum müssten sie sich überhaupt keine großen Sorgen machen. Sind sie wirklich so monomanisch auf ihre obersten Prioritäten fixiert, dass sie nicht einmal einen winzigen Teil davon dafür opfern können?
VOGELMÄDCHEN: Ich sage nicht, dass sie sich nur ein wenig um korrekte Nester kümmern würden und dass sie sich hartnäckig weigern würden, Ressourcen in ihre niedrigeren Prioritäten zu investieren. Ich sage, dass dies für sie überhaupt keine Priorität hätte. Diese speziellen Fragen würden ihnen einfach nicht in den Sinn kommen. Und wenn sie nach neuen Eigenschaften suchen würden, die sie sich aneignen könnten, würden sie stattdessen andere hinzufügen, die ihren seltsamen Zwecken noch besser dienen würden. Sie sind nicht wie wir. Vielleicht könnten wir Freunde sein, und vielleicht haben wir andere Gemeinsamkeiten. Vielleicht Liebe, vielleicht Freundschaft. Das erscheint mir weniger kompliziert und bedingt. Ich könnte mir vorstellen, dass dies bei einigen wenigen entwickelten Spezies vorkommt.
VOGELJUNGE: Nun, wenn nicht die Außerirdischen, was ist dann mit den mechanischen Kreaturen, die sie versehentlich erschaffen könnten? Werden diese auf Vernunft hören?
VOGELMÄDCHEN: Hmm. Eigentlich befürchte ich, dass die Situation dort sogar noch schlimmer sein könnte. Wenn ich darüber nachdenke, wie sehr sich der Prozess der Schaffung einer intelligenten Maschine vom Prozess der biologischen Evolution unterscheidet, bin ich etwas weniger optimistisch, dass dies in diesem exotischen Fall zu Liebe oder Freundschaft führen würde.
Gute Fahrer können verschiedene Ziele ansteuern
Menschen mit ähnlicher Intelligenz teilen nicht unbedingt ähnliche Werte. Diese Idee ist als Orthogonalitätsthese bekannt. Es ist die Idee, dass "Wie intelligent bist du?" und "Was willst du letztendlich?" orthogonal sind (d. h. sie variieren unabhängig voneinander).
Die Orthogonalitätsthese besagt, dass es im Prinzip fast nie schwieriger ist, ein Ziel um seiner selbst willen zu verfolgen, als ein Ziel aus instrumentellen Gründen zu verfolgen. Sie lernen vielleicht Tischlern, weil Sie einen Tisch bauen müssen, während Ihr Nachbar es lernt, weil er die Tätigkeit an sich angenehm findet.
Eine Folge dieser These ist, dass nicht alle ausreichend intelligenten Akteure Freundlichkeit, Wahrheit oder Liebe schätzen, nur weil sie intelligent genug sind, um sie zu verstehen. Es ist nicht verwirrend oder sachlich falsch, dass die Aliens von Correct Nest die Primzahlen der Steine in ihren Nestern schätzen. Wenn sie intelligenter würden, würden sie nicht plötzlich erkennen, dass sie sich stattdessen um andere Dinge kümmern sollten. Unterschiedliche Geister können wirklich zu unterschiedlichen Zielen führen.
Natürlich sagt dies nichts darüber aus, wie einfach oder schwierig es ist, eine KI zu entwickeln, die das eine oder andere Ziel verfolgt. Jede Methode zur Entwicklung von KIs macht es einfacher, bestimmte Präferenzen zu vermitteln, während andere Präferenzen schwieriger zu vermitteln sind.
(In Kapitel 4 geht es in gewisser Weise darum, dass die einzigen Präferenzen, die über Gradientenabstieg unverhältnismäßig leicht zu vermitteln sind, komplexe, seltsame und unbeabsichtigte sind. Auch in dieser Hinsicht sieht es also nicht gut aus. Dieser Punkt steht jedoch in keinem Zusammenhang mit der Orthogonalitätsthese.
Der Sinn der Orthogonalitätsthese besteht darin, auf die Intuition zu antworten, dass es für eine maschinelle Superintelligenz dumm wäre, Dinge zu verfolgen, die Menschen langweilig oder sinnlos finden, und dass eine intelligente KI sich stattdessen für etwas anderes entscheiden würde. Wir können das Ziel der KI als "willkürlich" bezeichnen, aber die KI kann uns genauso gut als "willkürlich" bezeichnen. Unhöfliche Worte ändern nichts an der praktischen Situation.
Das grundlegende Argument hinter der Orthogonalitätsthese lautet: Für jeden Verstand, der berechnen kann, wie man viele mikroskopisch kleine Würfel aus Titan herstellt und der sehr effizient viele kleine Würfel herstellen könnte, wenn er dafür eine ausreichend hohe Bezahlung erhält, gibt es einen anderen Verstand, der diese Berechnungen direkt in das Aktionssystem einfließen lässt.
Stellen Sie sich einen kompetenten Menschen vor, der wirklich dringend viele Titanwürfel verkaufen muss, um genug Geld zu verdienen, um seine Familie zu ernähren. Diese Person würde nicht nachdenken, erkennen, dass Titanwürfel langweilig sind, und stattdessen etwas anderes tun, es sei denn, dieses "etwas anderes" würde ihr auch genug Geld einbringen, um ihre Familie zu ernähren.
Und so würde auch ein Verstand, der einfach nur die Handlungen ausführt, die zu den meisten Würfeln führen, nicht beschließen, nachzudenken, zu erkennen, dass kleine Würfel langweilig sind, und stattdessen etwas anderes zu tun beginnen. Seine Handlungen sind nicht mit seinen Berechnungen darüber verbunden, was am meisten "Spaß" macht oder "sinnvoll" ist, so wie Menschen sich um diese Dinge kümmern. Seine Handlungen sind mit seinen Berechnungen darüber verbunden, was zu den meisten Würfeln führt.
Jeder mentale Mechanismus, der herausfinden könnte, wie man Würfel herstellt, wenn es einen ausreichenden Grund dafür gibt, könnte in einem anderen Verstand funktionieren, um dessen Handlungen direkt zu steuern. Das bedeutet, dass es möglich ist, dass maschinelle Intelligenzen durch das Streben nach (sagen wir) winzigen Titanwürfeln angetrieben werden, ohne Rücksicht auf Moral.
Eine solche KI müsste sich nicht mit Güte oder Moral auseinandersetzen. Sobald sie intelligent genug wäre, könnte sie wahrscheinlich viel besser als Menschen berechnen, welche Handlung die beste oder die moralischste ist. Sie könnte eine schriftliche Prüfung in Ethik mit Bravour bestehen. Aber sie würde nicht von diesen Berechnungen angetrieben werden. Ihre Handlungen wären keine Antwort auf die Frage "Welche dieser Optionen schafft das größte Wohl?". Ihre Handlungen wären eine Antwort auf eine andere Frage: "Welche dieser Optionen schafft die meisten winzigen Würfel?"*
Eine ausführlichere Diskussion der Orthogonalitätsthese findet sich auf LessWrong.com. Eine Diskussion über eine bestimmte Art und Weise, in der moderne KIs bereits eine Unterscheidung zwischen Verstehen und Fürsorge zeigen, finden Sie in der ausführlichen Diskussion über KI-induzierte Psychosen in Kapitel 4.
* Es kann sinnvoll sein, einem Menschen, der ein ganzes Meta-Präferenzsystem hat, das Sie vielleicht weitgehend teilen, zu sagen: “Ich glaube, Sie legen hier Wert auf die falschen Dinge.” Vielleicht haben einige dieser Argumente die Kraft, Sie auf eine Weise zu bewegen, die Sie nie für möglich gehalten hätten. Vielleicht fühlt es sich sogar so an, als gäbe es einen moralischen Leitstern außerhalb Ihrer selbst, dem Sie immer gefolgt sind, ohne es zu wissen.
Allerdings wird nichts davon für einen superintelligenten Würfelmaximierer überzeugend sein, genauso wenig wie Sie ihn zum Lachen bringen könnten, wenn Sie nur einen ausreichend guten Witz finden würden.
Es ist nicht so, dass er nicht weiß, was Humor ist. Er kann genau vorhersagen, was Sie lustig finden werden. Er hält diese Einstufung nur nicht für interessant.
Ebenso wenig bewegt es ihn, wie Sie berechnen, was getan werden sollte oder nicht, oder welche Präferenzen Sie für mehr oder weniger meta-bevorzugt halten. Wenn etwas sich nicht um Glück kümmert und sich auch nicht meta-kümmert um Ihre Argumente, warum es sich um Glück kümmern sollte, dann können Sie es nicht dazu überreden, ein auf Glück basierendes Entscheidungsmodell zu übernehmen.