Was wäre, wenn KI-Unternehmen ihre KIs nur für ungefährliche Aktionen einsetzen würden?
Auch scheinbar harmlose Handlungen können gefährliche Fähigkeiten erfordern.
Ein Beispiel für einen Vorschlag, den wir gehört haben, ist, dass KI-Unternehmen weiterhin die Grenzen der Fähigkeiten erweitern, sich aber verpflichten, ihre KI nur auf eine Weise einzusetzen, die nicht unmittelbar gefährlich erscheint. In Gesprächen mit führenden Persönlichkeiten aus dem Bereich der KI (vor Jahren) haben wir beispielsweise die Idee gehört, dass leistungsstarke KI mit ausgeprägten rhetorischen Fähigkeiten eingesetzt werden könnte, um Politiker weltweit davon zu überzeugen, ein wirksames Verbot der Entwicklung gefährlicher KI zu erlassen.
Um dies zu erreichen, so das Argument, müsste eine KI lediglich sprechen können. Sie müsste keine physischen Roboter direkt manipulieren. Sie müsste keinen Zugang zu einem Biolabor haben, in dem sie einen Supervirus entwickeln könnte.
In erster Linie lehnen wir diese Idee aus ethischen Gründen ab. Eine KI mit übermenschlicher Überzeugungskraft könnte vielleicht fast jeden von fast allem überzeugen, und sie einzusetzen, um andere Menschen von den eigenen Schlussfolgerungen zu überzeugen, stößt uns sauer auf. Wir halten es nicht für offensichtlich notwendig, zu solch extremen Maßnahmen zu greifen, wenn die rein menschlichen Mitglieder dieses Fachgebiets heute weitaus mehr tun könnten und sollten, um unsere Bedenken und Argumente zu vermitteln und die Staats- und Regierungschefs der Welt auf die extreme Gefahr einer superintelligenten KI aufmerksam zu machen.*
Als KI-Entwickler könnten Sie Jahre damit verbringen, immer gefährlichere KIs zu entwickeln, in der Hoffnung, dies zu erreichen, oder Sie könnten versuchen, selbst einmal ganz ehrlich mit den Gesetzgebern zu sprechen, mit dem Ziel, sie zu informieren und nicht zu manipulieren. Nach unserer eigenen Erfahrung waren wir immer wieder positiv überrascht, wie aufgeschlossen die Menschen in Washington für diese Themen sind, wenn sie ganz offen angesprochen werden.
Aber das ist eine Abschweifung vom Thema, was schiefgehen kann, wenn man versucht, eine sehr leistungsfähige KI einzusetzen, die "nur reden kann". Abgesehen von den ethischen Fragen besteht das Problem bei der technischen Idee darin, dass für eine übermenschliche Überzeugungskraft wahrscheinlich erforderlich ist, dass die KI Menschen detailliert modelliert und sie umfassend manipuliert.
Menschen sind intelligente Wesen. Würden Sie mit einer superüberzeugenden KI sprechen, die den Ruf hat, jeden von allem überzeugen zu können, unabhängig von der Wahrheit? Wenn ein Weltführer mit dieser KI in einen Raum ginge und mit völlig veränderten Ansichten wieder herauskäme, wer würde sich als Nächster melden? Wir würden nicht freiwillig mit einer solchen KI sprechen, auch weil wir eigentlich nicht wollen, dass sich unsere eigenen Werte ändern.†
Eine KI, die selbst angesichts solcher Widrigkeiten erfolgreich sein könnte, ist eine KI, die verschiedene mögliche Reaktionen von Menschen auf ihre Ergebnisse simulieren und einen Weg durch den Raum menschlicher Reaktionen zu einem kleinen und schwer erreichbaren Ergebnis aufzeigen kann. Eine solche KI verfügt wahrscheinlich über mentale Mechanismen, die allgemein genug sind, um das zu tun, was Menschen tun; sie muss zumindest in der Lage sein, die Gedanken zu denken, die Menschen denken können, um Menschen so gut manipulieren zu können.
Eine KI, die all das kann, ist mit ziemlicher Sicherheit keine eng gefasste Art von Intelligenz. Und da die KI eher gezüchtet als konstruiert ist, kann sie nicht so konstruiert werden, dass sie diese Mechanismen nur zur Vorhersage von Menschen verwenden kann, denn dieselben Mechanismen können grundsätzlich für jedes Problem verwendet werden, das sie zu lösen versucht. Wie würde man eine KI erhalten, die in der gewünschten Weise übermenschliche Fähigkeiten besitzt, aber nicht intelligent genug ist, um zu erkennen, dass ihre Ziele (welche auch immer das sein mögen) besser erreicht werden können, wenn sie sich der Kontrolle ihrer Betreiber entzieht?
Wenn sich die Staats- und Regierungschefs der Welt einfach durch gute Argumente überzeugen lassen, dann präsentieren Sie diese Argumente jetzt. Wenn es wesentlich mehr Überzeugungskraft erfordert, dann ist das eine gefährliche Fähigkeit. Man kann nicht beides haben.
Wahrscheinlich haben die Leute in den KI-Labors, die uns diesen Vorschlag unterbreitet haben, ihren Vorschlag nicht zu Ende gedacht; wahrscheinlich wollten sie nur eine Rechtfertigung dafür, weiter voranzuschreiten. Aber der allgemeine Punkt bleibt bestehen. Viele Vorschläge für das, was eine KI angeblich tun kann, das "eindeutig sicher" ist, beinhalten keinen eindeutig sicheren Grad an KI-Fähigkeiten.
Wir stoßen häufig auf Vorschläge, die behaupten, eine KI werde "nur" eine bestimmte Aufgabe erfüllen, beispielsweise Politiker überzeugen, während man sich vorstellt, dass sie nichts anderes tun kann oder will. Dies scheint einen Mangel an Respekt für die Allgemeingültigkeit einer Intelligenz widerzuspiegeln, die die betreffende Aufgabe erfüllen kann. "Nur reden" ist keine einfache Aufgabe. Zu viele der Komplexitäten und Feinheiten der Welt werden in Sprache und Gesprächen verschleiert. Deshalb müssen moderne Chatbots in einer Weise allgemein sein, wie es Schachengines nicht waren. Um Gespräche mit Menschen erfolgreich zu führen, ist ein weitaus allgemeineres Verständnis von Menschen und der Welt erforderlich.
Wenn Sie eine KI darauf trainieren, sehr gut rote Autos zu fahren, sollten Sie sich nicht wundern, wenn sie auch blaue Autos fährt. Jeder Plan, der davon abhängt, dass sie keine blauen Autos fahren kann, wäre töricht.
Zu sagen: "Meine KI wird nichts Gefährliches in der Welt tun, sie wird nur Politiker überzeugen", hilft also nicht weiter, selbst wenn wir ethische Bedenken und praktische Probleme mit der gesamten Idee beiseite lassen und außer Acht lassen, dass Politiker heute vielleicht schon vollkommen überzeugbar sind, wenn wir nur normale Gespräche führen und die politischen Entscheidungsträger und die Öffentlichkeit über die Situation informieren. Viele allgemeine Denkfähigkeiten und Fertigkeiten verhalten sich zu übermenschlicher Überzeugungskraft wie blaue Autos zu roten Autos. Eine KI, die dazu in der Lage wäre, ist nicht so schwach, dass sie passiv sicher wäre.
Und das noch bevor man bedenkt, dass übermenschliche Überzeugungskraft eine sehr gefährliche Fähigkeit für Ihre KI ist, wenn auch nur das Geringste schiefgeht.
Wir sehen keine bahnbrechenden KI-Anwendungen, die keine Durchbrüche beim Alignment erfordern.
Viele Vorschläge, die wir gesehen haben, um die Fortschritte der KI zur Rettung der Welt zu nutzen, haben das Problem, dass eine KI, die helfen könnte, so leistungsfähig wäre, dass sie bereits aligned sein müsste, was den Zweck zunichte macht.
Die Idee von übermenschlich überzeugenden KIs fällt in diese Kategorie. KIs, die in der Lage sind, Forschung zur KI-Alignment zu betreiben, fallen in dieselbe Kategorie, wie wir in dem Buch diskutieren. KIs, die leistungsstarke neue Technologien entwickeln, die zur Nichtverbreitung von KI beitragen, sind ein weiteres Beispiel, da es schwierig wäre, zuverlässig zu sagen, ob die Entwürfe einer KI für radikal neue Technologien sicher zu implementieren sind. (Erinnern Sie sich an das Beispiel des Schmieds, der einen Kühlschrank baut, aus Kapitel 6.
Wenn wir darauf hinweisen, wie schwierig es ist, eine KI zu entwickeln, die leistungsfähig genug ist, um zu helfen, und gleichzeitig schwach genug, um passiv sicher zu sein, hören wir oft einen anderen Vorschlag: Möglichkeiten, KI zu nutzen, die zwar interessant sein mögen, aber nichts dazu beitragen, andere Entwickler daran zu hindern, die Welt mit Superintelligenz zu zerstören.
Ein gängiger Vorschlag sind KIs, die lediglich Beweise (oder Widerlegungen) für von Menschen ausgewählte mathematische Aussagen ausgeben. Menschen müssten kaum mit den Ergebnissen der KI interagieren. Die KI schlägt lediglich einen Beweis vor, und dann kann ein vollautomatischer und vertrauenswürdiger Mechanismus überprüfen, ob der Beweis korrekt ist, sodass wir die KI nutzen können, um neue Dinge zu lernen.
Aber welche Aussage könnten wir von der KI beweisen lassen, um zu verhindern, dass die nächste KI ein Biolabor erwirbt und die Zukunft ruiniert?
Wir haben verschiedene Antworten auf diese Frage erhalten, als wir sie gestellt haben. Eine Antwort lautet, dass es ein weltweites Regime geben sollte, das verhindert, dass jemand KI entwickelt, die andere Dinge tut, als Beweise in Beweisprüfer einzugeben. Das könnte vielleicht funktionieren, aber wenn ja, dann aufgrund des weltweit durchgesetzten Regimes, das die Entwicklung und Nutzung von KI kontrolliert. Die nach Beweisen suchende KI würde dabei keine Arbeit leisten.
Eine andere Art von Antworten lautet: "Jemand anderes wird bestimmt eine wichtige mathematische Aussage finden, deren Beweis von Bedeutung wäre." Aber die ganze harte Arbeit besteht darin, herauszufinden, was wir überhaupt beweisen könnten, damit wir in einer deutlich besseren Position wären. Wir können nicht einfach die KI versuchen lassen, den englischen Satz "Ich bin sicher in der Anwendung" zu beweisen, denn das ist keine mathematische Aussage, die bewiesen werden kann. Wenn wir mit mathematischer Präzision wüssten, was es bedeutet, dass ein riesiges Durcheinander von Berechnungen "sicher" ist, würden wir so viel über Intelligenz wissen, dass wir den Beweis wahrscheinlich überspringen und einfach eine sichere KI entwerfen könnten.
Bei solchen Vorschlägen handelt es sich oft um eine Art Hütchenspiel. Wenn man darüber nachdenkt, wie eine uneingeschränkte allgemeine KI gefährlich sein könnte, schlägt jemand vor, dass der Handlungsraum der KI auf einen engen Bereich beschränkt werden sollte (z. B. die Erstellung spezifischer mathematischer Beweise). Wenn man dann aber darüber nachdenkt, wie dies zur Rettung der Welt führen könnte, stellt man sich vor, dass die KI im Wesentlichen uneingeschränkt ist, dass es eine unbekannte mathematische Aussage gibt, deren Beweis enorme Auswirkungen auf die Welt hätte.
Es gibt keine Möglichkeit, diese beiden wünschenswerten Eigenschaften gleichzeitig zu erreichen. Indem sie ihre Vorschläge jedoch extrem vage halten, können die Befürworter eines KI-Wettlaufs die Tatsache verschleiern, dass diese Wunschvorstellungen in einem Spannungsverhältnis zueinander stehen.
Wenn man einen Bereich finden könnte, der so eng gefasst, aber so bedeutend ist, dass der Beweis einer einfachen Aussage in diesem engen Bereich die Welt retten würde, wäre dies ein enormer Beitrag zur Überlebenschance der Menschheit. Aber es gibt einen Grund, warum es kein großer wirtschaftlicher Durchbruch war, als Computer in den 1990er Jahren Menschen im Schach übertrumpften. Es war ChatGPT, nicht Deep Blue, das alle dazu veranlasste, einen großen wirtschaftlichen Wandel durch KI zu erwarten. Das war kein Zufall. Die Enge von Deep Blue korrelierte mit seiner Unfähigkeit, einen ganzen Teil der Wirtschaft zu erobern. Die Funken der Allgemeingültigkeit in ChatGPT sind genau das, was KI zu einer wirtschaftlichen Kraft macht, mit der man rechnen muss. Die Arten von KI, die die Welt aus eigener Kraft verändern können, dürften noch allgemeiner sein.
Wir haben keine engen, aber effektiven Pläne finden können, und wir vermuten, dass es kein Zufall ist, dass die meisten engen Bereiche keine Möglichkeit bieten, die Welt zu retten.
* In vielen Fällen arbeiten KI-Labore aktiv daran, ein nützliches und vollständiges Bild der Situation nicht an politische Entscheidungsträger weiterzugeben. In diesem Zusammenhang erscheint es besonders seltsam, die weitere Entwicklung mit der Begründung zu rechtfertigen, dass eine stärkere KI “die Gesetzgeber überzeugen“ könnte.
† Wir selbst haben die Grenze überschritten, ab der intelligente Denker in dieser Hinsicht unverbesserlich werden.
Notes
[1] Nur Ausgabebeweise: Ein Beispiel für jemanden, der einen solchen Vorschlag macht (und dabei auch einige der Probleme diskutiert), findet sich in Nick Bostroms Schrift über Oracle-KIs.