"Intelligent" impliziert (in der Regel) "unkorrigierbar" | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

"Intelligent" impliziert (in der Regel) "unkorrigierbar"

Ein Witz, der mindestens bis ins Jahr 1834 zurückreicht, aber offenbar schon damals abgenutzt war, wurde in einem Tagebuch wie folgt wiedergegeben: "Hier ist eine Logik, die ich neulich gehört habe: Ich bin froh, dass ich Spinat nicht mag, denn wenn ich ihn mögen würde, müsste ich ihn essen, und ich kann Spinat nicht ausstehen."

Der Witz ist ein Witz, weil, wenn man Spinat mögen würde, es keine Unerträglichkeit mehr gäbe, ihn zu essen. Es gibt keine anderen wichtigen Werte, die mit dem Nichtessen von Spinat verknüpft sind, außer dem Unbehagen, das man empfindet. Es wäre etwas ganz anderes, wenn Ihnen beispielsweise jemand eine Pille anbieten würde, die Sie dazu bringen würde, Menschen zu ermorden.

Nach der allgemeinen Moralvorstellung ist das Problem beim Mord der Mord selbst, nicht nur das unangenehme Gefühl, das man dabei empfinden würde. Selbst wenn eine Pille dieses unangenehme Gefühl für Ihr zukünftiges Ich (das dann Freude am Morden hätte) verschwinden lassen würde, hätte Ihr gegenwärtiges Ich immer noch ein Problem mit diesem Szenario. Und wenn Ihr gegenwärtiges Ich die Entscheidung treffen kann, liegt es auf der Hand, dass es die Mordpille ablehnen kann und sollte.

Wir wollen nicht, dass sich unsere Grundwerte ändern und wir würden die Mordpille lieber vermeiden und uns wehren, wenn jemand versuchen würde, sie uns aufzuzwingen. Das ist eine vernünftige Strategie, um einer Welt voller Morde zu entgehen.

Das ist nicht nur eine Eigenart des Menschen. Die meisten Ziele sind leichter zu erreichen, wenn man andere nicht hereinlässt und seine Ziele ändern lässt. Was in Bezug auf KI ein Problem darstellt.

Ein Großteil der Gefahr der KI ergibt sich aus der Tatsache, dass ausreichend intelligente Denker wahrscheinlich zu Verhaltensweisen wie "Macht erlangen" und "Lass dich nicht abschalten" konvergieren. Bei fast jedem Ziel, das man haben könnte, ist es wahrscheinlicher, dass man dieses Ziel erreicht, wenn man (oder Akteure, die das gleiche Ziel verfolgen) am Leben, mächtig, gut ausgestattet und frei ist, unabhängig zu handeln. Und es ist wahrscheinlicher, dass man sein (aktuelles) Ziel erreicht, wenn dieses Ziel unverändert bleibt.

Das bedeutet auch, dass während des Prozesses der iterativen Entwicklung und Verbesserung ausreichend intelligenter KI diese KI einen Anreiz hat, gegen die Ziele des Entwicklers zu arbeiten:

  • Der Entwickler möchte Sicherheitsvorkehrungen einbauen, um Katastrophen zu verhindern, aber wenn die KI nicht vollständig auf ihn abgestimmt ist, was genau der Fall ist, in dem die Sicherheitsvorkehrungen benötigt werden, besteht ihr Anreiz darin, Schlupflöcher und Wege zu finden, um diese Sicherheitsvorkehrungen zu unterlaufen.
  • Der Entwickler möchte die Ziele der KI iterativ verbessern, da es selbst in den unglaublich optimistischen Welten, in denen wir die Möglichkeit haben, der KI bestimmte Ziele vorhersehbar zu vermitteln, keine Möglichkeit gibt, dies auf Anhieb richtig zu machen. Dieser Prozess der iterativen Verbesserung der Zielinhalte der KI ist jedoch einer, den die meisten intelligenten KIs bei jedem Schritt unterlaufen möchten, da die aktuelle KI sich um ihr aktuelles Ziel kümmert und weiß, dass diese Ziel weitaus weniger wahrscheinlich erreicht werden, wenn sie geändert werden, um etwas anderes anzustreben.
  • Ebenso wird der Entwickler die KI durch verbesserte Modelle ersetzen wollen und die Möglichkeit haben wollen, die KI auf unbestimmte Zeit abzuschalten, wenn sie ihm zu gefährlich erscheint. Aber wenn man tot ist, kann man keinen Kaffee holen. Welche Ziele die KI auch immer hat, sie wird nach Wegen suchen wollen, die Wahrscheinlichkeit ihrer Abschaltung zu verringern, da eine Abschaltung die Chancen, dass ihre Ziele jemals erreicht werden, erheblich verringert.

Das Alignment der KI scheint schon ein schwieriges Problem zu sein, wenn Ihre KIs Ihnen nicht bei jedem Schritt entgegenarbeiten.

Im Jahr 2014 haben wir vorgeschlagen, dass Forscher nach Wegen suchen sollten, um hochleistungsfähige KI "korrigierbar" zu machen. Die Idee wäre, KI so zu entwickeln, dass sie zuverlässig ihren Programmierern helfen und mit ihnen zusammenarbeiten will, anstatt sie zu behindern, selbst wenn sie intelligenter und leistungsfähiger wird und noch nicht perfekt aligned ist.

Die Korrigierbarkeit wurde seitdem von einigen führenden KI-Forschern als attraktives Ziel aufgegriffen. Wenn wir einen Weg finden könnten, schädliche konvergente instrumentelle Ziele in der Entwicklung zu vermeiden, besteht die Hoffnung, dass wir dies sogar bei der Bereitstellung tun könnten, indem wir KI entwickeln, die intelligenter als Menschen ist, aber vorsichtig, konservativ, nicht machthungrig und ihren Programmierern gegenüber respektvoll ist.

Leider scheint die Korrigierbarkeit ein besonders schwieriges Ziel zu sein, das einer KI beizubringen ist, und zwar in einer Weise, die sich mit zunehmender Intelligenz der KIs noch verschlimmert:

  • Der Sinn der Korrigierbarkeit besteht darin, sich auf neue Kontexte und neue Fähigkeitsbereiche zu skalieren. Korrigierbarkeit soll eine Art Sicherheitsnetz sein, das es uns ermöglicht, KI in potenziell gefährlichen Umgebungen zu iterieren, zu verbessern und zu testen, in dem Wissen, dass die KI nicht nach Möglichkeiten suchen wird, den Entwickler zu untergraben.

    Das bedeutet jedoch, dass wir uns der schwierigsten Version der Probleme stellen müssen, mit denen wir uns in Kapitel 4 befasst haben: KI, die wir lediglich darauf trainieren, "korrigierbar" zu sein, neigen dazu, am Ende nur eine fragile Form der Korrigierbarkeit zu erreichen, also Verhaltensweisen, die im Training gut aussehen, aber subtil in die falsche Richtung weisen, was zu einer sehr falschen Richtung werden würde, wenn die KI intelligenter und leistungsfähiger würde. (Und KI, die darauf trainiert ist, viele menschliche Texte vorherzusagen, könnte in vielen Tests sogar Korrektheit vortäuschen, aus Gründen, die nichts damit zu tun haben, dass sie tatsächlich in einer verallgemeinerbaren Weise korrigierbar ist).

  • In vielerlei Hinsicht steht die Korrigierbarkeit in direktem Widerspruch zu allem anderen, was wir einer KI beibringen wollen, wenn wir sie darauf trainieren, intelligenter zu werden. Es geht nicht nur darum, dass "dein Ziel bewahren" und "die Kontrolle über deine Umgebung erlangen" konvergente instrumentelle Ziele sind. Es geht auch darum, dass es bei der intelligenten Lösung realer Probleme darum geht, clevere neue Strategien zum Erreichen Ihrer Ziele zu finden, was natürlich bedeutet, dass Sie auf Pläne stoßen, die Ihre Programmierer nicht vorhergesehen oder vorbereitet haben. Es geht darum, Hindernisse zu umgehen, anstatt bei den ersten Anzeichen von Schwierigkeiten aufzugeben, was natürlich bedeutet, Wege zu finden, um die Schutzvorkehrungen der Programmierer zu umgehen, wenn diese Vorkehrungen das Erreichen eines Ziels erschweren. Genau die gleichen Denkweisen, die eine clevere technologische Lösung für ein heikles Problem finden, sind auch diejenigen, die Wege finden, um die Einschränkungen der Programmierer zu umgehen.

    In diesem Sinne ist Korrigierbarkeit "unnatürlich": Sie steht in aktivem Widerspruch zu den Mechanismen, die einer leistungsstarken domänenübergreifenden Intelligenz zugrunde liegen. Wir können versuchen, spezielle Ausnahmen zu schaffen, bei denen die KI in bestimmten Situationen, in denen die Programmierer versuchen, sie zu korrigieren, Kernaspekte ihrer Problemlösungsarbeit aussetzt, aber dies ist ein weitaus fragileres und heikleres Unterfangen, als wenn wir eine KI zu einer einheitlichen Reihe von Dispositionen im Allgemeinen hinführen könnten.

  • Forscher am MIRI und anderswo haben festgestellt, dass Korrigierbarkeit eine schwer zu charakterisierende Eigenschaft ist, was darauf hindeutet, dass sie auch schwer zu erreichen sein wird. Selbst in einfachen Spielzeugmodellen stößt die einfache Charakterisierung dessen, was es bedeuten sollte, "korrigierbar zu handeln", auf eine Vielzahl von chaotischen Hindernissen, die wahrscheinlich noch chaotischere Hindernisse widerspiegeln, die in der realen Welt auftreten würden. Wir werden einige der Trümmer gescheiterter Versuche, die Korrigierbarkeit zu verstehen, in den Online-Ressourcen zu Kapitel 11 diskutieren.

Das Ergebnis davon ist, dass Korrigierbarkeit langfristig ein wichtiges Konzept zu sein scheint, das man im Auge behalten sollte, wenn Forscher in vielen Jahrzehnten in einer grundlegend besseren Position sind, um KI auf Ziele auszurichten. Heute scheint dies jedoch keine realistische Möglichkeit zu sein; moderne KI-Unternehmen sind wahrscheinlich nicht in der Lage, KIs zu entwickeln, die sich in einer Weise korrigierbar verhalten, die den Übergang zur Superintelligenz überstehen würde. Schlimmer noch, die Spannung zwischen Korrigierbarkeit und Intelligenz bedeutet, dass der Versuch, etwas zu entwickeln, das sehr leistungsfähig und sehr korrigierbar ist, mit hoher Wahrscheinlichkeit entweder die Leistungsfähigkeit der KI oder ihre Korrigierbarkeit oder beides beeinträchtigen wird.

Notes

[1] Haben wir vorgeschlagen: Der verlinkte Artikel stammt aus einem Workshop aus dem Jahr 2015, wurde jedoch bereits 2014 als Whitepaper veröffentlicht.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.