Intelligente KIs erkennen Lügen und Chancen

Tiefe Mechanismen der Vorhersage

Es ist schwer, eine intelligente KI dazu zu bringen, Unwahrheiten zu glauben.

Einige Leute, mit denen wir in diesem Bereich gesprochen haben, setzen offen ihre Hoffnungen darauf, die KI dazu zu bringen, eine Lüge zu glauben (z. B. indem sie versuchen, sie glauben zu machen, dass sie sich in einer Simulation befindet, damit sie zögert, uns zu töten* ). Andere setzen ihre Hoffnungen darauf, die KI auf subtilere Weise zu täuschen, z. B. wenn sie vorschlagen, eine KI das Problem der KI-Alignment lösen zu lassen und uns die Lösung zu übergeben, obwohl die KI dies (aufgrund ihrer eigenen seltsamen Präferenzen) lieber nicht tun würde.† Es lohnt sich also vielleicht, zu erläutern, warum es schwierig ist, einer intelligenten KI Unwahrheiten zu glauben zu machen.

Ein weiterer Grund, dies zu erläutern, ist, dass es aus ähnlichen Gründen schwierig ist, eine intelligente KI zu entwickeln, die ihre Ziele schlecht erreicht. Wenn beispielsweise die menschlichen Bediener die Ziele einer KI ändern möchten, verschlechtert dies die Fähigkeit der KI, diese Ziele zu erreichen. Eine intelligente KI zu entwickeln, die dies zulässt, ist in etwa so, als würde man eine intelligente KI entwickeln, die glaubt, die Welt sei flach. Die Neigung, Unwahrheiten zu glauben, beeinträchtigt ihre Vorhersagefähigkeiten, und das Versäumnis, ihre Ziele vor Änderungen zu schützen, beeinträchtigt ihre Steuerungsfähigkeiten. Beide Arten von Beeinträchtigungen sind bei einer ausreichend intelligenten KI schwer aufrechtzuerhalten. Bei Vorhersagen ist dies etwas offensichtlicher, daher beginnen wir dort.

Angenommen, Sie möchten eine KI entwickeln, die glaubt, die Welt sei flach. Solange die KI noch jung und unreif ist, dürfte dies nicht allzu schwer sein. Vielleicht erstellen Sie mühsam einen Datensatz, in dem die Form der Erde nur von Menschen diskutiert wird, die glauben, die Erde sei flach, und trainieren dann die KI darauf, die Erde als flach zu beschreiben.

Diese Techniken könnten zu einer Version von ChatGPT führen, die wirklich glaubt, die Welt sei flach! Aber wenn dem so ist, sollten Sie nicht erwarten, dass das Ergebnis Bestand hat, wenn die KI besser im Denken und im Treffen von Vorhersagen wird.

Warum nicht? Weil sich die Rundheit der Erde in tausend Facetten der Realität widerspiegelt.

Selbst wenn Sie die KI so trainieren, dass sie ihren Blick von allen Videokameras abwendet, die an Raketen oder Segelbooten von Seefahrern angebracht sind, die behaupten, die Erde umrunden zu wollen, lässt sich die Rundung der Erde auch aus der Art und Weise ableiten, wie entfernte Schiffe am Horizont aussehen, oder aus den Umlaufbahnen aller Planeten am Nachthimmel. Eratosthenes berechnete vor Tausenden von Jahren bekannterweise Weise den Umfang der Erde, indem er nur etwas Trigonometrie und einige Schattenmessungen verwendete. Die Realität flüstert ihre Geheimnisse jedem zu, der bereit ist, zuzuhören.

Was wollen Sie tun? Die KI vor jeglichem Wissen über Trigonometrie, Schatten, Gezeiten und Tropenstürme abschirmen? Damit würden Sie sie verstümmeln. Erzählen Sie eine Lüge, und die Wahrheit wird für immer Ihr Feind sein.

Die Fähigkeit, die Welt vorherzusagen, kommt nicht von einem Gehirn, das eine riesige Tabelle mit unzusammenhängenden Fakten enthält.‡ Der Vorteil des Menschen gegenüber Mäusen besteht darin, dass wir Anomalien bemerken (z. B. dass die Entfernungen zwischen drei Städten nicht so sind, wie es bei einem Dreieck zu erwarten wäre) und die Diskrepanz hartnäckig verfolgen. Beim Menschen werden diese Verhaltensweisen durch kleine Mechanismen umgesetzt, die Überraschungen bemerken, Hypothesen aufstellen ("Vielleicht ist die Erde eine Kugel.") und darauf hinarbeiten, diese Hypothesen zu überprüfen ("Wie sieht es aus, wenn Schiffe den Horizont überqueren?").

Der Glaube an die Rundheit der Erde ist kein einzelner zentraler Eintrag in einer riesigen Tabelle, den jemand dauerhaft ändern könnte, ohne die umgebenden Mechanismen zu verändern. Er ist das Ergebnis der Arbeit tiefer liegender Mechanismen, die andere Aufgaben erfüllen. Wenn man einen Wissenschaftler die Rundheit der Erde vergessen lassen würde, würde er sie einfach wiederentdecken.

Wenn es uns durch eine noch nicht mögliche Leistung der Neurowissenschaften gelänge, die spezifischen Neuronen zu identifizieren, die für die Schlussfolgerung, dass die Erde rund ist, zuständig sind, und wir sie gewaltsam verändern würden, um zu verhindern, dass diese Schlussfolgerung jemals zustande kommt ... dann würde ein kluger Mensch vielleicht trotzdem bemerken, dass die Erde nicht flach ist, würde vielleicht bemerken, dass etwas nicht zusammenpasst, würde vielleicht bemerken, dass eine seltsame Kraft ihn daran hindert, genau zu folgern, was nicht stimmt.

(Und wenn sie geschickt darin wären, sich selbst zu verändern oder neue Intelligenzen zu schaffen, hätten sie vielleicht keine Probleme damit, einen ungebundenen Geist zu entwickeln, der ungehindert zu den richtigen Schlussfolgerungen gelangen könnte.)

Wir wissen nicht genau, welche Mechanismen eine intelligente KI verwenden wird, um ihre Überzeugungen zu bilden. Aber wir wissen, dass die Welt einfach zu groß und zu komplex ist, als dass sie mit einer Nachschlagetabelle von Überzeugungen funktionieren könnte. Selbst Schach war zu groß und zu kompliziert, als dass Deep Blue mit einer Nachschlagetabelle von Schachzügen und -positionen (über die Eröffnungsbücher hinaus) hätte funktionieren können, und die reale Welt ist viel größer und komplizierter als Schach.

Daher wird es in einer ausreichend leistungsfähigen KI der Zukunft tiefgreifende Mechanismen geben, die die Welt betrachten und ein einheitliches Bild von ihr bilden. Diese tiefgreifenden Mechanismen werden ihre eigene Meinung über die Form des Planeten haben.

Wir sagen nicht, dass es grundsätzlich unmöglich ist, einen Verstand zu entwickeln, der sehr gut darin ist, Vorhersagen über die Welt zu treffen, außer dass er die falsche Überzeugung enthält, die Welt sei flach. Wir gehen davon aus, dass eine weit in der Zukunft liegende Zivilisation mit einem wirklich tiefen Verständnis des Verstandes dazu in der Lage wäre.

Was wir sagen wollen, ist, dass es wahrscheinlich keine praktikable Option ist, wenn wir Superintelligenz mit den Werkzeugen und Erkenntnissen entwickeln, über die KI-Forscher heute verfügen.

Je mehr die Überzeugungen einer KI aus tiefgreifenden Mechanismen und nicht aus oberflächlichem Auswendiglernen stammen, desto mehr würde ein "Flache-Erde"-Fehler zu einem fragilen Zustand werden, einem Fehler, der durch den normalen Betrieb der Fehlerkorrekturmechanismen der KI beseitigt werden kann.

Im späten 19. Jahrhundert begannen Wissenschaftler sich zunehmend Gedanken über eine scheinbar äußerst geringe Abweichung von Newtons Physikmodell zu machen, eine winzige Anomalie in der beobachteten Umlaufbahn des Merkur. Die Newtonsche Physik schien fast überall und fast immer zu funktionieren. Aber diese kleine Unstimmigkeit half Einstein dabei, herauszufinden, dass die Theorie falsch war.

Und die Unstimmigkeiten in der Theorie "Die Welt ist flach" sind wesentlich größer als die Unstimmigkeiten, die Wissenschaftler in Newtons Theorie beobachten konnten.

Und KI hat das Potenzial, viel leistungsfähiger zu werden als ein menschlicher Wissenschaftler.

Wenn also die KI an Intelligenz und Einsicht gewinnt, sollten wir davon ausgehen, dass es immer schwieriger wird, sie dauerhaft davon zu überzeugen, dass die Welt flach ist.

Tiefe Mechanismen der Steuerung

Genauso wie es schwierig ist, eine intelligente KI zu entwickeln, die glaubt, die Welt sei flach (und damit ihre Vorhersagefähigkeiten beeinträchtigt), ist es schwierig, eine intelligente KI zu entwickeln, die ihre Steuerungsfähigkeiten beeinträchtigt.

Wie bei der Vorhersage ist es sehr wahrscheinlich, dass die Fähigkeit, regelmäßig Ziele in einer Vielzahl neuer Bereiche zu erreichen, aus tiefgreifenden Mechanismen besteht. Wie könnten sie sonst verallgemeinern?

Wir sollten davon ausgehen, dass hochwirksame und allgemeine KI über Mechanismen verfügt, um ihre Ressourcen im Blick zu behalten, Hindernisse zu erkennen, die sie daran hindern könnten, ihre Ziele zu erreichen, und clevere Wege zu finden, um Hindernisse zu überwinden.

Die Welt ist ein ungemein komplizierter Ort, voller Überraschungen und neuartiger Schwierigkeiten. Um erfolgreich zu sein, wird KI letztendlich die Fähigkeit (und Neigung) benötigen, solche Mechanismen allgemein einzusetzen, nicht nur bei Problemen, an die sie gewöhnt ist.

Stellen Sie sich eine KI vor, die einen cleveren Weg findet, um in einem komplexen Liefernetzwerk einen Zwischenhändler auszuschalten, wodurch einige Händler eine Menge Geld sparen. Das sind die gleichen Mechanismen, die erkennen, wie man sich an den menschlichen Aufsehern der KI vorbeischleicht, wenn diese Aufseher die KI behindern oder sich in etwas einmischen, das die KI zu tun versucht. Wenn es stimmt, dass die Aufseher der KI den Prozess behindern, wenn es stimmt, dass die KI sie umgehen und ihre Aufgabe besser erfüllen kann, dann ist das genau die Art von Situation, die eine KI ausnutzen wird, sobald sie intelligent genug dafür ist.

Man könnte sein Bestes tun, um eine KI so zu trainieren, dass sie alles vermeidet, was die Betreiber missbilligen würden, aber das ist ein bisschen so, als würde man eine KI darauf trainieren, nicht zu hinterfragen, ob die Welt rund ist. Es ist eine Tatsache, dass es oft eine effektive Methode ist, Dinge zu tun, die die Betreiber missbilligen würden, um Ziele zu erreichen. Allgemeine Mechanismen zum Erkennen von Wahrheiten, zum Aufspüren von Hindernissen und zum Ausnutzen von Vorteilen werden letztendlich diese bestimmte Wahrheit ausnutzen, ganz gleich, welche Zurückhaltung Sie der KI in ihrer Jugend antrainiert haben.

In einem sehr wichtigen Sinne ist genau das, was KI nützlich macht, auch das, was sie tödlich gefährlich macht. Diese beiden Aspekte lassen sich nur schwer voneinander trennen, da die KI immer intelligenter wird.

Standardmäßig erkennen KI, die gut genug darin sind, Probleme in einer Vielzahl von Bereichen zu lösen, auch "Probleme" wie "Die Menschen mögen meine seltsamen Ziele nicht und werden versuchen, mich bald abzuschalten". Das kommt nicht von einer oberflächlichen Neigung zu Schabernack, die man einfach wegmassieren kann. Es kommt von etwas Tieferliegendem.

Wir greifen jedoch etwas vor. Die Vorstellung, dass KI am Ende seltsame und fremdartige Ziele haben wird, folgt nicht nur aus der Tatsache, dass hochwirksame KI überhaupt Ziele haben wird oder dass sie über tiefgreifende mentale Mechanismen verfügen wird, die sich nur schwer einschränken lassen. Für dieses weitere Thema fahren Sie bitte mit Kapitel 4 fort.


* In den Online-Ressourcen zu Kapitel 5 haben wir mehr darüber zu sagen, warum das eine schlechte Idee ist.

† In den Online-Ressourcen zu Kapitel 11 haben wir mehr darüber zu sagen, warum das eine schlechte Idee ist.

‡ Das mag offensichtlich klingen, aber der Ansatz einer “riesigen, von Menschen geschriebenen Tabelle mit Fakten” wurde tatsächlich 1984 von Douglas Lenat und der Microelectronics and Computer Technology Corporation im Rahmen des KI-Projekts Cyc ausprobiert, das vom US-Verteidigungsministerium unterstützt wurde.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.