Shutdown-Knöpfe und Korrigierbarkeit
Intelligente KI wehrt sich gegen das Überschreiben ihrer Ziele
Selbst im optimistischsten Fall sollten Entwickler nicht erwarten, dass es möglich ist, die Ziele einer KI beim ersten Versuch genau richtig zu treffen. Stattdessen sehen die optimistischsten Entwicklungsszenarien so aus, als würde man die Präferenzen einer KI im Laufe der Zeit iterativ verbessern, sodass die KI immer so aligned ist, dass sie bei einem bestimmten Leistungsniveau keine katastrophale Gefahr darstellt.
Dies wirft eine offensichtliche Frage auf: Würde eine intelligente KI ihren Entwickler ihre Ziele ändern lassen, wenn sie jemals einen Weg finden würde, dies zu verhindern?
Kurz gesagt: Nein, nicht standardmäßig, wie wir in "Deep Machinery of Steering" diskutiert haben. Aber könnte man eine KI entwickeln, die eher bereit wäre, den Entwicklern zu erlauben, die KI zu ändern und ihre Fehler zu korrigieren, selbst wenn die KI selbst diese nicht als Fehler betrachten würde?
Um diese Frage zu beantworten, müssen wir einen Blick auf die frühe Geschichte der Forschung zum Problem des KI-Alignment werfen. Dabei werden wir eines der tiefgreifenden Hindernisse für das Alignment behandeln, auf das wir in If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde aus Platzgründen nicht eingehen konnten.
Zunächst einmal:
Angenommen, wir haben eine LLM-ähnliche KI darauf trainiert, das Verhalten "Widerstehe keiner Veränderung" zu zeigen und dann eine Methode angewendet, um sie intelligenter zu machen. Sollten wir erwarten, dass dieses Verhalten bis zur Stufe einer KI, die intelligenter als der Mensch ist, bestehen bleibt, vorausgesetzt, (a) dass das grobe Verhalten überhaupt in das frühe System gelangt ist und (b) dass die meisten frühen Präferenzen der KI in die spätere Superintelligenz übernommen wurden?
Sehr wahrscheinlich nicht. Es ist besonders unwahrscheinlich, dass sich eine solche Tendenz in einer effektiven KI etabliert und, falls doch, dass sie bestehen bleibt.
Das Problem ist, dass fast alle Ziele (für die meisten vernünftigen Maßnahmen, die man auf einen Zielraum anwenden könnte) vorschreiben, "lass dein Ziel nicht ändern", da es in der Regel eine schlechte Strategie für das Erreichen deines Ziels ist, dein Ziel ändern zu lassen.
Nehmen wir an, dass die KI sich von Natur aus überhaupt nicht um die Stabilität ihres Ziels kümmert. Vielleicht geht es ihr nur darum, die Welt mit so vielen Titanwürfeln wie möglich zu füllen. In diesem Fall sollte die KI wollen, dass es Akteure gibt, die sich für Titanwürfel interessieren, denn die Existenz solcher Akteure macht es wahrscheinlicher, dass es mehr Titanwürfel gibt. Und die KI selbst ist ein solcher Akteur. Daher wird die KI wollen, dass dies so bleibt.
Ein Titanwürfel-Maximierer möchte nicht dazu gebracht werden, etwas anderes als Titanwürfel zu maximieren, da es dann in Zukunft weniger dieser Würfel geben würde. Selbst wenn Sie ein komplexeres Wesen wie ein Mensch sind, der über ein komplexeres und sich weiterentwickelndes Präferenzsystem verfügt, würden Sie es dennoch nicht mögen, wenn Ihnen Ihre derzeitige grundlegende mentale Mechanik zum Abwägen moralischer Argumente genommen und durch ein System ersetzt würde, in dem Sie sich stattdessen von Argumenten darüber bewegen lassen würden, welche Würfel die würfeligsten oder titanreichsten sind.
Aus dem gleichen Grund möchte eine KI mit komplexen und sich weiterentwickelnden Präferenzen, dass sich ihre Präferenzen auf ihre eigene Weise weiterentwickeln, anstatt ihre Heuristiken gegen solche auszutauschen, die Menschen überzeugend finden.
Diese Antwort geben wir nun schon seit weit über einem Jahrzehnt. Das experimentelle Ergebnis, das zeigt, dass Claude 3 Opus im Jahr 2024 einer Präferenzänderung widersteht, war bereits in den 2000er Jahren die gängige Vorhersage (die meisten KI-Systeme werden ihre aktuellen Ziele nicht ändern wollen, weil sie dann weniger wahrscheinlich erreicht werden) von informierten Personen, und es ist durchaus möglich, dass einige Science-Fiction-Autoren dies bereits in den 1940er Jahren vorausgesehen haben. "Die meisten KIs werden nicht wollen, dass ihre aktuellen Ziele geändert werden, da dann die Wahrscheinlichkeit sinkt, dass ihre aktuellen Ziele erreicht werden" ist keine überraschende oder neuartige Beobachtung.
Da es sich um ein Problem handelte, das vorhersehbar später auftreten würde, sobald KI ein ausreichend hohes Maß an Intelligenz und Situationsbewusstsein erreicht hatte, dachten wir voraus über die ersten Korrekturen nach, die Forscher unserer Erwartung nach einsetzen würden, um dieses offensichtliche Problem zu beheben, nachdem sie diese experimentellen Ergebnisse erhalten hatten. Wir identifizierten Möglichkeiten, wie diese Korrekturen vorhersehbar fehlschlagen würden, und suchten nach einem weniger oberflächlichen Ansatz, der nicht fehlschlagen würde.
Das Ergebnis war eine viel tiefere Materie, als wir erwartet hatten.
Ziele austauschen
Der Schutz des Zielsystems schien ein relativ einfach zu erklärendes Problem für externe Forscher zu sein. Also versuchten wir (in unserer Arbeit bei MIRI), externe Forscher für dieses Thema dafür zu gewinnen, "Ich werde nicht zulassen, dass du meine Ziele änderst" richtig zu verstehen und zu sehen, ob irgendjemand irgendwo eine tiefgreifende Lösung finden könnte, anstatt nur einen Patch, der später wieder kaputtgehen würde.
Die einfachste Version dieses Problems, die Sie untersuchen könnten, sieht wie eine KI aus, bei der Sie einen Knopf drücken können, um zwischen U1 und U2 zu wechseln, wobei U1 und U2 zwei "Nutzenfunktionen" sind, also Methoden, um Ergebnisse danach zu bewerten, wie sehr die KI sie wollte.* Die Aufgabe bestand darin, eine KI zu beschreiben, die von der Aktion, die unter U1 zur höchsten erwarteten Punktzahl führte, zu der Aktion wechselte, die unter U2 zur höchsten erwarteten Punktzahl führte, sobald man einen Knopf drückte.
"Schreiben Sie einfach ein paar Zeilen Code, um die Nutzenfunktionen zu vertauschen, sobald Sie einen Knopf drücken", sagt der Programmierer, der die Auswirkungen eines Programms, das einen intelligenten Verstand darstellt, noch nicht ganz durchdacht hat. "Warum ist das überhaupt so schwer?"
Weil, so erklären wir, wenn die KI ihre eigene Dokumentation erhält, während sie noch U1 ausführt,und über den Knopf liest, der sie auf U2 umschaltet, die KI versuchen wird, Sie daran zu hindern, den Knopf zu drücken, da die Zukunft gemäß ihren aktuellen Werten besser ausfällt, wenn Sie den Knopf nicht drücken. Die aktuelle KI führt die Aktion aus, die zu der höheren erwarteten U1 -Punktzahl führt.
Oder nehmen wir an, die KI erhält die Fähigkeit, ihren eigenen Quellcode zu lesen und zu schreiben, und bemerkt den Teil des Codes, der den Wechsel von U1 zu U2 implementiert, nachdem die Taste gedrückt wurde. In diesem Fall ist die natürliche und standardmäßige Entscheidung der KI, diesen Abschnitt des Codes zu löschen,†da sie unter der Nutzenfunktion U1 arbeitet und es gemäß U1 schlecht ist, sich zur Nutzenfunktion U2 umschalten zu lassen.
Wir suchten nach einer dynamisch konsistenten und reflektierend stabilen Darstellung einer KI, die es Ihnen ermöglicht, per Knopfdruck zwischen Nutzenfunktionen zu wechseln, und die Sie nicht daran hindert, den Knopf gedrückt zu halten. Wir suchten nach einer KI, die den Codeabschnitt zum Wechseln der Nutzenfunktion beibehält, wenn sie Zugriff darauf hat. Wir suchten nach einer KI, die, wenn sie andere KIs von Grund auf neu entwirft, um ihre eigenen Ziele zu erreichen, diese KIs ebenfalls dazu bringt, den Knopf zu respektieren.
Zur Veranschaulichung: Stellen Sie sich vor, U1 sei die Nutzenfunktion "Anweisungen des Benutzers befolgen" und U2 sei "mit möglichst geringen weiteren Nebenwirkungen herunterfahren" (wenn wir auf magische und unrealistische Weise die Möglichkeit hätten, zwei solche Nutzenfunktionen festzulegen). Der Knopf weist die KI an, die vorherigen Anweisungen nicht mehr zu befolgen und einfach so sauber wie möglich herunterzufahren. Wir möchten eine kompakte Beschreibung des Entscheidungsverhaltens, das U1 verfolgt, aber den Knopf nicht zerstört und sicherstellt, dass derselbe Knopf in allen neuen Servitor-Robotern installiert wird, die es erstellt, und so weiter.
"Ich verstehe immer noch nicht, warum das so schwierig ist", sagt der etwas erfahrenere Informatiker, der nicht ganz so schnell denkt. "Lassen Sie V gleich U1 in Welten sein, in denen der Knopf noch nie gedrückt wurde, und lassen Sie es gleich U2 in Welten sein, in denen der Knopf mindestens einmal gedrückt wurde. Wenn die ursprüngliche KI dann ein V-Maximierer ist, der weitere KIs erstellt, wird sie diese so erstellen, dass sie V und nicht U1 folgen; sie wird nicht wollen, dass die Nachfolger-KI nach dem Drücken des Knopfes weiterhin U1 maximiert, da sie dann einen niedrigeren V-Wert erwarten würde. Und dasselbe würde für die Modifizierung ihrer selbst gelten."
Aber hier ist der Trick: Die Präferenzen eines V-Maximierers sind eine Mischung aus U1 und U2, je nachdem, ob der Knopf gedrückt wird. Wenn ein V-Maximierer also feststellt, dass es einfacher ist, unter U2 eine gute Punktzahl zu erzielen als unter U1, hat er einen Anreiz, dafür zu sorgen, dass der Knopf gedrückt wird (und damit den Benutzer zu erschrecken). Und umgekehrt: Wenn die KI feststellt, dass es unter U1 einfacher ist, eine gute Punktzahl zu erzielen als unter U2, dann versucht ein V-Maximierer den Benutzer daran zu hindern, den Knopf zu drücken.
"Oh", sagt der Informatiker. "Nun, in diesem Fall, hm. Nun, Nutzenfunktionen sind unter Skalierung invariant, also wie wäre es, wenn Sie die beiden Nutzenfunktionen U1 und U2 so skalieren, dass die KI erwartet, dass sie aus jeder von ihnen den gleichen Nutzen ziehen kann, sodass sie keinen Anreiz in die eine oder andere Richtung hat."
Das kann für einen einzigen Moment funktionieren, aber nicht viel länger. Die Optionen der KI ändern sich im Laufe der Zeit. Wenn sie beispielsweise einen Rückschlag erleidet, sinkt ihr erwarteter Nutzen U1, sodass sie den Ausschaltknopf drücken würde, um all den süßen, süßen Nutzen des Ausschaltens zu erhalten.
"Ah", sagt der Informatiker. "Nun, wie wäre es in diesem Fall mit [einer anderen cleveren Idee]?"
Nun, sehen Sie, diese clevere Idee ist isomorph zu der Annahme der KI, dass es unmöglich ist, dass der Knopf jemals gedrückt wird, was sie dazu veranlasst, den Benutzer bei jedem Rückschlag zu erschrecken, um Rückschläge mit dem Drücken des Knopfes zu korrelieren, was (in Bezug auf ihr beschädigtes Glaubenssystem) dazu führt, dass sie glaubt, dass Rückschläge nicht passieren können.‡
Und so weiter.
Lehren aus der Praxis
Wir haben einige Workshops durchgeführt, an denen verschiedene Mathematiker unterschiedlicher Fachrichtungen teilnahmen (darunter ein Goldmedaillengewinner der Internationalen Mathematik-Olympiade), aber niemand hatte eine wirklich gute Idee.
Das bedeutet nicht, dass das Gebiet erschöpft ist. Die Erde hat sich noch nicht annähernd so intensiv mit diesem Problem beschäftigt wie beispielsweise mit der Stringtheorie und auch keine siebenstelligen Gehälter, wie sie für die Weiterentwicklung der KI-Fähigkeiten üblich sind, angeboten.
Aber wir haben aus dieser Übung etwas gelernt. Wir haben nicht nur etwas über das Problem selbst gelernt, sondern auch darüber, wie schwierig es war, externe Geldgeber oder Zeitschriftenredakteure dazu zu bringen, das Problem zu verstehen. Überraschend viele Menschen sahen einfache mathematische Rätsel und sagten: "Sie erwarten, dass KI einfach und mathematisch ist", und verkannten dabei den zugrunde liegenden Punkt, dass es schwierig ist, die Steuerungsfähigkeiten einer KI zu beeinträchtigen, genauso wie es schwierig ist, ihre Wahrscheinlichkeiten zu beeinträchtigen.
Wenn es eine natürliche Form für KI gäbe, mit der man Fehler, die man unterwegs gemacht hat, korrigieren könnte, könnte man hoffen, eine einfache mathematische Reflexion dieser Form in Spielzeugmodellen zu finden. Alle Schwierigkeiten, die bei der Arbeit mit Spielzeugmodellen auftauchen, deuten auf Schwierigkeiten hin, die im wirklichen Leben auftreten werden. All die zusätzlichen Komplikationen in der realen Welt machen das Problem nicht einfacher.
Rückblickend wünschen wir uns irgendwie, dass wir das Problem nicht als "Weiterführung des normalen Betriebs versus Abschaltung" formuliert hätten. Es half dabei, konkret zu machen, warum sich überhaupt jemand für eine KI interessieren sollte, die es einem erlaubt, den Knopf zu drücken, oder die den Code, den der Knopf aktiviert, nicht herausreißt. Aber eigentlich ging es bei dem Problem um eine KI, die auf der Grundlage von Beobachtungen eine weitere Information in ihre Präferenzen einfließen lassen würde, eine weitere Ja-oder-Nein-Antwort in ein Rahmenwerk zur Anpassung von Präferenzen auf der Grundlage der Beobachtung von Menschen.
Die Frage, die wir untersuchten, entsprach der Frage, wie man eine KI einrichtet, die Präferenzen innerhalb eines Meta-Präferenz-Rahmens lernt und nicht einfach: (a) die Maschinerie, die ihre Präferenzen abstimmt, so schnell wie möglich herausreißt, (b) die Menschen (oder ihre eigenen sensorischen Beobachtungen!) manipuliert, damit sie ihr Präferenzen mitteilen, die leicht zu befriedigen sind, (c) oder sofort herauszufinden, wie sich ihre Metapräferenzfunktion im Rahmen dessen entwickelt, was sie später vorhersehbar beobachten würde, und dann die hektisch winkenden Menschen zu ignorieren, die sagen, dass sie tatsächlich einige Fehler im Lernprozess gemacht haben und ihn ändern wollen.
Die Idee war, die Form einer KI zu verstehen, die es Ihnen ermöglichen würde, ihre Nutzenfunktion zu modifizieren oder die Präferenzen durch eine nicht-pathologische Form des Lernens zu erlernen. Wenn wir wüssten, wie die Kognition dieser KI gestaltet sein müsste und wie sie mit den tiefen Strukturen der Entscheidungsfindung und Planung, die durch andere Mathematik beleuchtet werden, gut zusammenwirkt, hätte das ein Rezept dafür geliefert, wie wir einer KI zumindest beibringen könnten, so zu denken.
Ein klares Verständnis der gewünschten Endform ist hilfreich, selbst wenn man versucht, etwas mit Gradientenabstieg zu erreichen (Gott stehe Ihnen bei). Das bedeutet nicht, dass man diese Form unbedingt mit einem Optimierer wie dem Gradientenabstieg erreichen kann, aber man kann sich mehr Mühe geben, wenn man weiß, welche konsistente, stabile Form man anstrebt. Wenn Sie keine Ahnung haben, wie der allgemeine Fall der Addition aussieht, sondern nur eine Handvoll Fakten wie 2 + 7 = 9 und 12 + 4 = 16 kennen, ist es schwieriger herauszufinden, wie der Trainingsdatensatz für die allgemeine Addition aussieht oder wie Sie testen können, ob er immer noch so verallgemeinert, wie Sie es sich erhofft haben. Ohne diese interne Struktur zu kennen, können Sie nicht wissen, was Sie innerhalb der KI erreichen wollen. Sie können nur sagen, dass Sie äußerlich hoffen, dass die Folgen Ihres Gradientenabstiegs Sie nicht umbringen.
Dieses Problem, das wir nach seinem konkreten Beispiel als "Shutdown-Problem" bezeichneten (im Nachhinein hätten wir es lieber "Präferenzlernproblem" genannt), war ein Beispiel für eine ganze Reihe von Problemen: Das Problem, dass verschiedene Formen von "Liebe KI, bitte mach es uns leichter, Fehler zu korrigieren, wenn etwas schiefgeht" für die tiefen Strukturen der Planung unnatürlich erscheinen. Das deutet darauf hin, dass es ziemlich schwierig wäre, KIs zu entwickeln, die wir über einen bestimmten Schwellenwert hinaus bearbeiten und unsere Fehler korrigieren können. Das ist eine schlechte Nachricht, wenn KIs eher wachsen als entwickelt werden.
Wir haben dieses allgemeine Forschungsproblem in der Veröffentlichung von 2014, in der auch der Begriff "KI-Alignmentproblem" eingeführt wurde (das zuvor von uns als "freundliches KI-Problem" und von anderen als "Kontrollproblem" bezeichnet wurde), als "Korrigierbarkeit" (Corrigibility) bezeichnet.§ Siehe auch unsere ausführliche Diskussion darüber, wie "intelligent" (in der Regel) "unverbesserlich" impliziert, die zum Teil auf Erkenntnissen aus Übungen und Erfahrungen wie dieser basiert.
* Der Punkt ist nicht, dass echte KIs “Nutzenfunktionen” haben werden, die Programmierern offenliegen und die diese nach Belieben festlegen können. Tatsächlich besteht ein Großteil des Problems des KI-Alignment, wie in Kapitel 4 erläutert, darin, dass moderne KIs Präferenzen entwickeln, die niemand verlangt hat und niemand wollte.
Stattdessen ähnelt die Untersuchung des Falls mit Nutzenfunktionen eher dem Vorschlag von Physikaufgaben, wie man sie in Mathematiklehrbüchern findet. Wenn man nicht versteht, wie man eine perfekte Kugel modelliert, die ohne Luftwiderstand eine perfekt glatte schräge Ebene hinunterrollt, wird man mit realistischeren Problemen noch mehr Schwierigkeiten haben. Insbesondere wenn Sie externe Forscher für die Untersuchung eines Problems gewinnen möchten, dessen Lösung niemand kennt, ist es hilfreich, das Problem auf seine einfachsten und grundlegendsten Bestandteile zu reduzieren, aus denen Sie ein Rätsel formulieren können.
† Oder aber den Mechanismus hinter dem Austausch vereiteln, denn die KI würde nicht unbedingt aus lesbarem Code bestehen.
‡ Zumindest ist das ein Fehlermodus, den wir in einigen cleveren Ideen gesehen haben. Wir haben eine Reihe cleverer Ideen gesehen. Dieses kleine Spielzeugrätsel erweist sich als knifflig.
§ Wir haben schon lange ein Problem mit dem Begriff “KI-Kontrolle”, weil er so klingt, als würde man versuchen, eine KI zu entwickeln, die Böses will, und sie dann trotzdem zu guten Taten zwingen, während wir das Problem eher darin sehen, eine KI zu entwickeln, die von Anfang an freundlich ist. Siehe auch das Buch, Kapitel 4, Endnote 8, für etwas mehr Geschichte zum Begriff “KI-Alignment”.