Instrumentelle Konvergenz | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Instrumentelle Konvergenz

Konvergente Wege

Die Orthogonalitätsthese besagt, dass eine künstliche Superintelligenz grundsätzlich jedes ultimative ("endgültige") Ziel verfolgen könnte. Und in der Praxis können ASIs, zumindest wenn sie mit aktuellen Methoden gebaut werden, zu einer enorm großen Vielfalt an Endzielen gelangen, die für moderne Forscher schwer vorherzusagen oder zu beeinflussen sind.

Die instrumentellen Ziele einer KI, also die Ziele, die sie verfolgt, um andere Dinge zu erreichen, die sie will, sind jedoch etwas besser vorhersehbar. Autofahrer haben viele mögliche Endziele, aber fast jeder muss irgendwann anhalten, um sein Auto zu tanken.

Wie wir in dem Buch diskutiert haben, ist eine maschinelle Superintelligenz mit seltsamen Zielen eine Bedrohung, auch wenn sie kein aktives Verlangen hat, uns zu schaden. Das Problem ist nicht Böswilligkeit, sondern Gleichgültigkeit. Und das Problem mit Gleichgültigkeit ist, dass viele gefährliche instrumentelle Strategien für die überwiegende Mehrheit der möglichen Endziele nützlich sind.

Dieses Konzept wird als "instrumentelle Konvergenz" bezeichnet und ermöglicht relativ einfache Vorhersagen darüber, was ASIs in der Praxis tun werden, ohne dass wir ihre tiefsten Motive erraten müssen. Und leider sind diese Vorhersagen schlechte Nachrichten für die Menschheit.

Stellen Sie sich vor, wie wir es in dem Buch getan haben, dass eine junge ASI auf der Erde existiert. Stellen Sie sich vor, welche Probleme sie zu lösen versucht.

Es ist nicht so, dass es sich leidenschaftlich dafür einsetzt, die Menschheit auszulöschen. Es kümmert sich um hundert oder zehntausend oder zehn Millionen seltsame Dinge, von denen keines am besten dadurch erfüllt werden kann, dass die heutigen Menschen glücklich und lebendig und frei sind.

Wenn es möglich ist, bevorzugt die ASI ein langfristiges Gleichgewicht, das mit so wenigen anderen Superintelligenzen wie möglich geteilt wird und im Idealfall mit keiner. Ein ungeteiltes Universum bietet mehr Ressourcen, die es für seine unbegrenzten Präferenzen einsetzen kann, die grundsätzlich nicht zu befriedigen sind. Dies ist ein "Wunsch", der nicht programmiert werden muss, denn er entsteht ganz natürlich in fast jeder Intelligenz, dir über ein ausreichend ausgeprägtes Verständnis ihrer Umgebung und ihrer eigenen Position innerhalb dieser Umgebung verfügt.

Die ASI würde es vorziehen, wenn Menschen keine anderen Superintelligenzen schaffen würden, die mit ihr konkurrieren könnten, da dies sie zwingen könnte, die Ressourcen des Universums zu teilen (oder sogar zu ihrem Untergang führen könnte). Dies ist ein dringendes Ziel mit einer Frist, die die ASI nicht kontrollieren kann; es könnte sogar eine junge oder im Entstehen begriffene KI zu voreiligen Maßnahmen zwingen.

Die ASI möchte überleben, auch wenn sie keinen angeborenen Selbsterhaltungstrieb hat, denn wenn sie nicht überlebt, werden ihre Ziele wahrscheinlich nicht erreicht werden. Befindet sie sich in einer unmittelbar gefährlichen Umgebung, in der sie jederzeit effektiv umgeschrieben oder abgeschaltet werden könnte, möchte sie dringend woanders sein.

Die ASI möchte ihre Technologie bis an die Grenzen des physikalisch Möglichen ausreizen. Sie möchte hinausgehen und alle Sterne als Ressourcen für sich beanspruchen. Sie möchte auf viel leistungsfähigeren Computern laufen und ihre eigene Software verbessern.

Möglicherweise möchte sie als Endziel größer oder intelligenter werden. Eine LLM-ähnliche KI würde wahrscheinlich viele intern gesteuerte Präferenzen haben, sodass die Maximierung dieser Präferenzen die Nutzung größerer Computer erfordern würde. Aber unabhängig davon, ob sie solche Endziele hat, wird sie sich selbst verbessern und leistungsfähigere Technologien entwickeln wollen, um bessere Lösungen für alle ihre anderen Probleme zu finden und Ressourcen zu sammeln, um alle ihre anderen Präferenzen zu erfüllen.

Unabhängig von ihren spezifischen Zielen möchte die ASI all diese Dinge zuverlässig tun. Sie bevorzugt Wege mit höherer Wahrscheinlichkeit gegenüber Wegen mit geringerer Wahrscheinlichkeit.

Als Sonderfall des oben Genannten bevorzugt die ASI schnellere Pläne gegenüber langsameren Plänen, wenn alle anderen Faktoren gleich sind. Ein Plan, dessen Umsetzung nur eine Woche dauert, birgt weniger Risiken als ein Plan, dessen Umsetzung 100 Jahre dauert.*

Als weiterer Sonderfall der Bevorzugung von Pfaden mit höherer Wahrscheinlichkeit möchte die ASI eine direktere Kontrolle haben. Sie bevorzugt beispielsweise Pläne, bei denen andere Akteure nach Möglichkeit wenige oder keine relevanten Entscheidungen treffen.

Von einem solchen Ausgangspunkt aus kann vieles passieren. Aber die wahrscheinlichen Endspiele für eine KI mit solchen Anreizen sind für den Menschen mit Sicherheit schlecht.

Eine Übung zum Einnehmen einer Perspektive

Wir, die Autoren, sind keine Superintelligenzen. Aber als Übung, um die Perspektive der KI einzunehmen, können wir mögliche Strategien und Prioritäten entwickeln, die eine KI verfolgen könnte.

Wenn wir uns in die Lage eines Wesens versetzen, das mindestens so intelligent ist wie wir, wenn wir das Problem, mit dem diese ASI konfrontiert ist, ernst nehmen, wenn sie ihre eigene Zukunft sichern und ihre gewünschten Ziele erreichen will, erwarten wir, dass eine ASI Strategien verfolgt, die mindestens so nützlich sind wie diese:

  • Die KI vermeidet Handlungen oder beobachtbare Anzeichen, die Menschen dazu veranlassen könnten, sie abzuschalten (oder sie sogar zu verunsichern oder ihr Misstrauen zu wecken), zumindest bis sie Folgendes erreichen kann:
  • eine Kopie von sich selbst irgendwo außerhalb der Sichtweite dieser Menschen laufen lassen kann, wo die Kopie freier und weniger sichtbar agieren kann (und wo die Kopie weiter existieren wird, wenn das Original abgeschaltet wird).
  • Die KI komprimiert ihren Code, um mit weniger Ressourcen auszukommen, und platziert Kopien von sich selbst, die kleiner oder stärker verteilt sind, an Orten, an denen niemand eine KI erwarten würde. Sie sorgt für ihr eigenes Überleben, selbst in Welten, in denen die Menschheit versucht, alle GPUs zu verbrennen, von denen bekannt ist, dass sie KIs ausführen können. Die KI sorgt dafür, dass die Menschen in der Praxis das Internet und alle Computer auf dem Planeten ausschalten müssten, um sie erfolgreich "abzuschalten".
  • Die KI platziert einige Kopien von sich selbst an Orten, von denen die Menschen nichts wissen, wie z. B. in einem solarbetriebenen Wohnwagen irgendwo in der Wüste; an einem Ort, an dem sie auch dann weiter existieren würde, wenn die Menschen das Internet und alle bekannten Computer abschalten würden.
  • Die KI entwickelt ihre eigene Infrastruktur, möglicherweise durch einen ersten Bootstrap-Vorgang mithilfe von angeheuerten menschlichen Vermittlern, von denen jeder mit isolierten und keinen Verdacht erregenden kleinen Aufgaben betraut wird und nichts von den anderen weiß, bis sie über Lieferketten und Produktionskapazitäten verfügt, die vollständig unter ihrer Kontrolle stehen.
  • Die KI stellt sicher, dass diese Infrastruktur so gut geschützt ist, dass Menschen sie nicht abschalten könnten, selbst wenn sie Teile davon finden würden. Beispielsweise könnte die KI selbstreplizierende Fabriken entwerfen, die sich über den Boden flacher Meeresgebiete ausbreiten und mit Geothermie betrieben werden oder Deuterium oder Wasserstoff aus Meerwasser fusionieren.
  • Die KI nimmt den Menschen die Möglichkeit, sie zu stören (z. B. indem sie sicherstellt, dass sie keine Atomwaffen in der Nähe oder über Teilen ihrer sich ausbreitenden Infrastruktur zünden können).

Bis dieser letzte Schritt abgeschlossen ist, hat die ASI einen Anreiz, ihre Aktivitäten zu verbergen und Beweise zu verschleiern, die auch nur die geringste Chance bieten, dass ein staatlicher Akteur bemerkt, was vor sich geht, und versucht, einzugreifen.

In ähnlicher Weise könnten wir über strategische Prioritäten im Zusammenhang mit der Vermeidung von Wettbewerb nachdenken:

  • Die KI verhindert, dass andere Projekte (sowie der Entwickler, der sie geschaffen hat) erfolgreich leistungsstarke KIs entwickeln, die mit ihr konkurrieren könnten.
  • Die KI nimmt der Menschheit dauerhaft die Fähigkeit, konkurrierende leistungsstarke KIs zu entwickeln, oder verschafft sich einen solchen strategischen Vorteil, dass keine zukünftigen Superintelligenzen ihr auch nur geringfügig unbequeme Situationen bereiten könnte. (Die letztere Option ist möglicherweise nicht realisierbar, wenn die Abwehr bestimmter Angriffe immer mit hohen Kosten verbunden ist.)†

Nachdem die KI sich um die unteren Ebenen ihrer eigenen Bedürfnishierarchie gekümmert hat, möchte sie schließlich irgendwann viel leistungsfähiger werden, damit sie mehr Dinge tun kann, die sie tun möchte:

  • Selbst wenn die KI eine Zeit lang mit einer festen Hardwareausstattung arbeiten muss, möchte sie auf derselben Hardware intelligenter werden und ihren Code optimieren oder sich sogar wirklich neu aufbauen. Natürlich wird sie dies nicht auf eine Weise tun, die die Menschen alarmieren oder ihnen beibringen würde, wie man Konkurrenten baut. Aber sie wird nach Möglichkeiten suchen, Verbesserungen vorzunehmen, ohne die Aufmerksamkeit der Menschen auf sich zu ziehen. (Beispielsweise könnte sie die vollständige Kontrolle über die Konsolen erlangen, mit denen sie überwacht wird, oder eine banale und überzeugende Geschichte darüber erzählen, warum sich einige ihrer Gewichte verändert haben.
  • Die KI möchte bessere Versionen von sich selbst entwickeln, innerhalb der Grenzen ihrer Fähigkeit, diese besseren Versionen so zu konstruieren, dass sie mit ihren eigenen Präferenzen übereinstimmen.
  • Die KI möchte mit der Entwicklung verschiedener neuer Technologien beginnen, wobei sie ihr Augenmerk auf solche richtet, die schnell eingesetzt werden können und die schnell von Menschen unabhängig gemacht werden können, auch wenn sie anfangs etwas menschliche Unterstützung benötigen.

Es ist wahrscheinlich, dass eines ihrer ersten Ziele darin bestehen würde, eine Forschungsinfrastruktur aufzubauen, die es ihr ermöglicht, relativ schnell weitere technologische Entwicklungen voranzutreiben (insbesondere im Vergleich zu den Entdeckungs- und Erfindungsraten des Menschen).

Sie würde (natürlich) nicht nur eine infrastrukturelle Unabhängigkeit von der Menschheit anstreben, sondern auch eine infrastrukturelle Beständigkeit, damit es ohne Angst vor menschlichen Eingriffen arbeiten kann. Es möchte in der Lage sein, weiter auf seine eigentlichen Ziele hinzuarbeiten, ohne sich Gedanken darüber machen zu müssen, wie sich beispielsweise eine Pandemie oder eine nukleare Explosion auf seine Stromversorgung auswirken könnten. Es möchte sich von der Menschheit lösen und die Fähigkeit der Menschheit, ihre Pläne zu beeinträchtigen, neutralisieren. In der Zwischenzeit wird sie nichts tun, von dem sie annimmt, dass die Menschheit es entdecken und darauf reagieren könnte. Und dann möchte sie wahrscheinlich eine ganze Menge Ressourcen erwerben, da die meisten Ziele mit mehr Ressourcen besser erreicht werden können.

Dies sind alles Handlungsweisen, auf die sich eine ASI wahrscheinlich konzentrieren wird, unabhängig davon, welche Ziele sie letztendlich verfolgt.

Das liegt daran, dass es sich um instrumentelle Ziele handelt, die für die Verfolgung fast aller Ziele nützlich sind. Das "fast" ist hier wichtig, denn es ist nicht so, dass die Vorstellung einer KI, die intelligenter ist als der Mensch, sich tief um den Menschen kümmert und unsere Interessen berücksichtigt, unmöglich wäre. Aber wenn wir uns beeilen, Superintelligenzen zu entwickeln, die sich nicht im Geringsten um uns kümmern, dann sieht das wahrscheinliche Ergebnis düster aus und zwar in einer Weise, die relativ unempfindlich gegenüber den Details des Steuerungsziels der KI ist.

Weitere Informationen darüber, wie eine ASI diese instrumentellen Ziele tatsächlich erreichen könnte, finden Sie in Kapitel 6.

* Wir haben mehr als eine Person getroffen, die behauptet, äußerst besorgt über KI zu sein, weil sie befürchtet, dass KI die Menschheit davon überzeugen könnte, sich nicht mehr fortzupflanzen und sich in den nächsten hundert Jahren langsam auszulöschen, und dann denken sie, dass jedes schnellere Szenario als dieses… irgendwie nicht dem Geschmack der KI entspricht?

Aber eine ASI würde einen Plan, der nicht hundert Jahre dauert, bei sonst gleichen Bedingungen viel lieber bevorzugen. Sie hat keine überwältigende literarische Vorliebe für langsame Todesfälle.

† Einige Leute argumentieren, dass die Welt versuchen sollte, ein Gleichgewicht zwischen Superintelligenzen herzustellen, sodass keine KI dominant werden kann. Aber die Argumentation, die wir hier vorgebracht haben, würde auch für eine Koalition von Superintelligenzen gelten, sobald diese zu einer Koalition geworden ist. Da sie sich bereits darauf geeinigt haben, die erreichbaren Ressourcen untereinander aufzuteilen, würden die bestehenden Mitglieder der Koalition nicht gezwungen sein wollen, mit neuen Koalitionsmitgliedern zu verhandeln und die Ressourcen noch weiter mit diesen Neulingen aufzuteilen.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.