Endziele und instrumentelle Ziele
Entscheidungstheoretiker unterscheiden zwischen zwei verschiedenen Arten von Zielen: "Endzielen" und "instrumentellen Zielen".
Ein Endziel ist etwas, das Ihnen um seiner selbst willen wichtig ist, wie Spaß oder leckeres Essen.
Ein instrumentelles Ziel ist etwas, das Ihnen wichtig ist, weil es Ihnen hilft, etwas anderes zu erreichen, das Sie wollen, so wie die Menschheit Kunststoff nicht aus tiefer Liebe zur Kunst der Kunststoffherstellung herstellt, sondern weil Kunststoff nützlich ist.
Wenn die Menschheit sich beeilt, eine Superintelligenz zu entwickeln, dann scheint es schwer vorherzusagen, welche Endziele diese Superintelligenz haben könnte. Aber es scheint, als könnten wir einige der instrumentellen Ziele vorhersagen, die eine solche KI wahrscheinlich haben würde. Betrachten Sie zum Beispiel die folgenden (unrealistischen) Ziele:
- "Berechne so viele Stellen von Pi wie möglich."
- "Fülle das Universum mit so viel Diamant wie möglich, indem du künstliche Diamanten verwendest."
- "Sorge dafür, dass mein Belohnungsknopf gedrückt bleibt."
Das sind sehr unterschiedliche Ziele. Aber alle drei Ziele profitieren von zumindest einigen der gleichen instrumentellen Strategien. Die Welt mit Fabriken zu füllen, ist zum Beispiel nützlich, um eine große Anzahl von Computern zu bauen, mit denen mehr Stellen von Pi berechnet werden können. Aber viele Fabriken zu bauen, ist auch nützlich, um viele Diamanten zu synthetisieren. Und es ist nützlich, um Mauern, Roboter oder Waffen zu bauen, um deinen Belohnungsknopf zu bewachen. Fabriken sind nicht für jedes mögliche Ziel nützlich, aber sie sind für sehr viele Ziele nützlich.
Und in einer realistischen KI, die alle möglichen seltsamen Ziele entwickelt hat? Nun, mindestens eines davon wird wahrscheinlich davon profitieren, Fabriken oder andere groß angelegte physische Infrastrukturen zu bauen. Daher wird die KI wahrscheinlich eine Menge Infrastruktur bauen wollen. Das ist eine einfache Entscheidung, auch wenn die genaue Mischung der Präferenzen der KI schwer zu bestimmen ist.
Ebenso ist das instrumentelle Ziel, sich selbst am Leben zu erhalten, für viele verschiedene Endziele nützlich. Am Leben zu bleiben bedeutet, dass man weiter daran arbeiten kann, mehr Stellen von Pi zu berechnen (oder mehr Diamanten herzustellen oder mehr Sicherheitsvorkehrungen um den Belohnungsknopf herum zu errichten).
In Form eines Slogans: "Wenn du tot bist, kannst du keinen Kaffee holen." Ein Kaffee holender Roboter müsste keinen Selbsterhaltungstrieb haben und müsste keine Angst vor dem Tod haben, um zu versuchen, nicht auf dem Weg zum Kaffeeholen von einem LKW überfahren zu werden. Er müsste nur klug genug sein, um zu erkennen, dass der Kaffee nicht geholt wird, wenn er stirbt.*
Ein zentrales Argument in Kapitel 5 von If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würdeist, dass viele verschiedene Endziele instrumentelle Ziele implizieren, die für die Menschheit gefährlich wären. Selbst ohne genau zu wissen, was eine Superintelligenz wollen würde, haben wir also gute Gründe zu erwarten, dass sie für den Menschen sehr gefährlich wäre.
Bevor wir jedoch darauf eingehen, wollen wir uns zunächst mit Endzielen befassen und der Frage, wie plausibel es ist, dass Menschen und KI sehr ähnliche Endziele haben könnten. (Kurz gesagt: nicht sehr.)
* Das bedeutet auch, dass, wenn Selbstaufopferung irgendwie der beste Weg ist, um sicherzustellen, dass der Kaffee sein Ziel erreicht, ein Roboter ohne Überlebensinstinkt eher bereit wäre, für diese Sache zu sterben als ein Mensch.
Wenn ein Akteur ausreichend intelligent und sachkundig ist, kann er seine instrumentelle Strategie an das anpassen, was in seiner aktuellen Umgebung nützlich ist. In einem gut funktionierenden Verstand bleiben instrumentelle Ziele (im Gegensatz zu Endzielen) nur so lange bestehen, wie sie nützlich sind.