Ein genauerer Blick auf vorher und nachher | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Ein genauerer Blick auf vorher und nachher

Wie in diesem Kapitel erwähnt, besteht die grundlegende Schwierigkeit, mit der Forscher im Bereich der KI konfrontiert sind, darin, dass

Eine KI muss aligned sein, bevor sie mächtig und fähig genug ist, einen zu töten (oder sich dem Alignment zu widersetzen). Dieses Alignment muss dann auf verschiedene Bedingungen übertragen werden, die Bedingungen, die nach dem Entstehen einer Superintelligenz oder einer Gruppe von Superintelligenzen* bestehen, könnten einen töten, wenn sie es wollten.

Mit anderen Worten: Wenn Sie eine Superintelligenz entwickeln, muss Ihnen das Alignment gelingen, ohne dass sie jemals in der Lage wären, Ihre Alignment-Techniken unter den wirklich wichtigen realen Bedingungen gründlich zu testen, unabhängig davon, wie "empirisch" sich Ihre Arbeit anfühlt, wenn Sie mit Systemen arbeiten, die nicht leistungsfähig genug sind, um Sie zu töten.

Dies ist kein Standard, an den KI-Forscher oder Ingenieure in fast allen Bereichen gewöhnt sind.

Wir hören oft Beschwerden, dass wir etwas Unwissenschaftliches verlangen, das losgelöst von empirischen Beobachtungen ist. Als Antwort darauf könnten wir vorschlagen, mit den Konstrukteuren der Weltraumsonden zu sprechen, über die wir in Kapitel 10 gesprochen haben.

Die Natur ist unfair und manchmal gibt es Fälle, in denen die Umgebung, die zählt, nicht die Umgebung ist, in der wir testen können. Dennoch stellen sich Ingenieure gelegentlich der Herausforderung und schaffen es auf Anhieb, wenn sie über ein solides Verständnis ihrer Arbeit verfügen, wie robuste Werkzeuge und starke Vorhersagetheorien, was im Bereich der KI eindeutig fehlt.

Das ganze Problem besteht darin, dass die KI, die Sie sicher testen können, ohne dass fehlgeschlagene Tests jemals tödlich enden würden, unter anderen Bedingungen arbeitet als die KI (oder das KI-Ökosystem), die bereits getestet worden sein muss, denn wenn sie falsch aligned ist, sterben alle. Die erstgenannte KI oder das System von KIs nimmt sich selbst nicht richtig als eine realistische Option wahr, alle zu töten, wenn sie es will. Die letztgenannte KI oder das System von KIs sieht diese Option sehr wohl.†

Angenommen, Sie erwägen, Ihren Kollegen Bob zum Diktator Ihres Landes zu machen. Sie könnten versuchen, ihn zunächst zum Scheindiktator Ihrer Stadt zu machen, um zu sehen, ob er seine Macht missbraucht. Aber das ist leider kein sehr guter Test. "Befiehl der Armee, das Parlament einzuschüchtern und die nächsten Wahlen zu ‚überwachen‘" ist eine ganz andere Option als "missbrauche meine Scheinmacht, während ich von den Bürgern der Stadt beobachtet werde (die mich immer noch verprügeln und mir den Job verweigern können)".

Mit einer ausreichend gut entwickelten Kognitionstheorie könnten Sie versuchen, die Gedanken der KI zu lesen und vorherzusagen, in welchen kognitiven Zustand sie geraten würde, wenn sie wirklich glauben würde, die Möglichkeit zu haben, die Macht zu übernehmen.

Und man könnte Simulationen erstellen (und versuchen, die inneren Empfindungen der KI zu manipulieren usw.), die laut Ihrer Kognitionstheorie dem kognitiven Zustand sehr ähnlich wären, in den die KI eintreten würde, wenn sie tatsächlich die Möglichkeit hätte, Sie zu verraten.‡

Aber die Verbindung zwischen diesen Zuständen, die Sie im Labor induzieren und beobachten, und dem Zustand, in dem die KI tatsächlich die Möglichkeit hat, Sie zu verraten, hängt grundlegend von Ihrer ungetesteten Theorie der Kognition ab. Der Verstand einer KI kann sich im Laufe ihrer Entwicklung zu einer Superintelligenz erheblich verändern!

Wenn die KI neue Nachfolge-KIs schafft, die intelligenter sind als sie selbst, unterscheiden sich die inneren Vorgänge dieser KIs wahrscheinlich von denen der KI, die Sie zuvor untersucht haben. Wenn Sie nur aus einem Verstand "vorher" lernen, basiert jede Anwendung dieses Wissens auf einen möglichen Verstand "nachher" auf einer ungetesteten Theorie darüber, wie sich ein Verstand zwischen "vorher" und "nachher" verändert.

Die KI so lange laufen zu lassen, bis sie die Gelegenheit hat, Sie auf eine Weise zu verraten, die schwer zu fälschen ist, ist ein empirischer Test dieser Theorien in einer Umgebung, die sich grundlegend von jeder Laborumgebung unterscheidet.

Viele Wissenschaftler (und viele Programmierer) wissen, dass ihre Theorien darüber, wie ein kompliziertes System in einer grundlegend neuen Betriebsumgebung funktionieren wird, oft nicht beim ersten Versuch gut funktionieren.§ Dies ist ein Forschungsproblem, das ein "unfaires" Maß an Vorhersagbarkeit, Kontrolle und theoretischer Einsicht in einem Bereich erfordert, in dem das Verständnis ungewöhnlich gering ist – wobei unser aller Leben auf dem Spiel steht, wenn das Ergebnis des Experiments die Hoffnungen der Ingenieure widerlegt.

Aus unserer Sicht erscheint es daher überdeterminiert, dass Forscher nicht voreilig versuchen sollten, die Grenzen der KI so weit wie möglich zu verschieben. Dies ist ein legitimerweise wahnsinniges Unterfangen und es ist legitimerweise wahnsinnig, wenn eine Regierung dies zulässt.

* Manchmal hören wir Leute sagen, dass es keinen Grund zur Sorge gibt, weil wir mehrere Superintelligenzen einrichten können, die sich gegenseitig kontrollieren. Es gibt viele Gründe, warum uns diese Vorschläge völlig unglaubwürdig erscheinen, aber es ist wichtig zu betonen, dass Ideen wie diese mit dem gleichen Kernproblem konfrontiert sind, das wir bereits mehrfach angesprochen haben: Wir haben nur einen Versuch, um diesen cleveren Plan zum Erfolg zu führen.

Man kann zwar vorher einige Tests und Beobachtungen durchführen, ohne dabei das Leben aller Menschen auf dem Planeten zu riskieren, aber der entscheidende Fall wird nicht ganz derselbe sein. (Und ein solcher Plan müsste sehr clever sein, da wir keine Ahnung haben, wie wir die KI in diesem System dazu bringen könnten, sich um uns zu kümmern.

† Man könnte versuchen, eine schwächere KI fälschlicherweise glauben zu machen, dass sie sich in einer Position befindet, in der sie einen entscheidenden Vorteil erlangen kann, und sie darauf trainieren, sich nicht so zu verhalten, selbst wenn sie diese Option sieht. Aber man würde ein KI-System trainieren, das dumm genug ist, sich täuschen zu lassen, und das falsche Waffen anstelle von echten Waffen sieht. Die potenziell tödliche Verteilung würde sich also immer noch deutlich von der Trainingsverteilung unterscheiden, denn es besteht ein deutlicher Unterschied zwischen der Aussage, dass man eine Waffe hat, mit der man seine Bediener töten könnte, und dem tatsächlichen Bau einer Waffe oder Fluchtroute und dem detaillierten Verständnis davon. Die KI, die sich von falschen Optionen täuschen lässt, ist nicht dieselbe wie die KI, die echte Optionen sieht.

Ein Abgleichmechanismus, der bei KI funktioniert, die dumm genug ist, sich täuschen zu lassen, ist ein Abgleichmechanismus, der bisher nur getestet wurde, aber dennoch danach funktionieren muss.

‡ Weitere Informationen darüber, warum dies keine sehr hoffnungsvolle Idee ist, finden Sie in unserer Antwort auf die Frage “Was wäre, wenn wir sie glauben lassen, sie befinde sich in einer Simulation?“

§ Ein Beispiel: Die Newtonsche Mechanik lieferte alle möglichen erstaunlich guten empirischen Vorhersagen. Es handelte sich um eine einfache, prägnante mathematische Theorie mit enormer Erklärungskraft, die alle bisherigen Theorien in den Schatten stellte. Aber wenn man versuchen würde, sie zu nutzen, um Nutzlasten mit relativistischer Geschwindigkeit zu fernen Planeten zu schicken, wäre man immer noch aufgeschmissen, da die Newtonsche Mechanik relativistische Effekte nicht berücksichtigt.

Die einzigen Vorwarnungen, die man erhalten würde, wären kleine Hinweise darauf, dass sich das Licht zu jeder Jahreszeit in alle Richtungen mit derselben Geschwindigkeit zu bewegen scheint, dass sich das Licht während einer Sonnenfinsternis um die Sonne herum krümmt und dass das Perihel des Merkur etwas von den Vorhersagen der Newtonschen Mechanik abweicht. Kleine Anomalien, abgewogen gegen eine enorme Anzahl erfolgreicher Vorhersagen in tausend empirischen Bereichen.

Stellen Sie sich vor, dass vor der Entdeckung der Newtonschen Mechanik seltsame Außerirdische der Erde ein Geschäft angeboten hätten, bei dem wir großen Reichtum erhalten würden, wenn wir eine interstellare Lieferung abschließen könnten, aber wenn wir scheitern würden, würden wir vernichtet werden. Stellen Sie sich vor, Wissenschaftler hätten die Newtonsche Mechanik entdeckt und argumentiert, dass sie nun sicherlich die Lieferung abschicken dürften. Sie hätten jede Menge empirische Beweise auf ihrer Seite, die mit den neuen wissenschaftlichen Erkenntnissen übereinstimmen, die gerade dabei waren, mächtige neue Technologien zu erschließen.

Stellen Sie sich vor, wie viel Rückgrat ein Regulierer brauchen würde, um zu sagen: “Und doch können Sie die Vorverlegung des Perihels des Merkur nicht erklären, also lautet die Antwort ‚nein‘.“

Das würde sich für die Wissenschaftler so unfair anfühlen! Sie hätten so viele Beweise vorzulegen!

(Tatsächlich könnte ein realistischer Regulierer wahrscheinlich nicht sagen, dass die Antwort immer noch “Nein“ lauten müsste, was mit ein Grund dafür ist, dass wir keine Hoffnung auf eine internationale Koalition haben und denken, dass die Erde sich einfach ganz aus dem Problem zurückziehen muss.

Die Natur kümmert sich nicht um die Berge von Beweisen und Vorhersagen, die die Newtonsche Physik angesammelt hat. Die Theorie bricht immer noch zusammen, wenn wir uns Energien und Größenordnungen zuwenden, die weit außerhalb dessen liegen, was wir bisher beobachten konnten. Bei hohen Energien und großen Entfernungen funktioniert sie einfach nicht.

Es ist schwierig, wissenschaftliche Theorien beim ersten kritischen Versuch zum Funktionieren zu bringen.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.