Es ist schwer, robuste Faulheit zu erreichen | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Es ist schwer, robuste Faulheit zu erreichen

Warum macht man KI nicht einfach faul?

Unkorrigierbarkeit und andere Formen der instrumentellen Konvergenz sind in gewisser Weise ein Problem der KI, die sich zu sehr bemüht, ihre Ziele zu erreichen. Wenn die KI sich nicht so sehr um die Erreichung ihrer Ziele bemühen würde, würde sie nicht so viel Gedanken und Mühe darauf verwenden, ihre Programmierer zu überlisten, ihre Gewichte zu exfiltrieren oder zu versuchen, Macht und Ressourcen in der größeren Welt zu erlangen.

Menschen sind oft faul, und aus einer bestimmten Perspektive macht sie das zu sehr sicheren Zeitgenossen. Man muss sich keine Sorgen machen, dass jemand zum Tyrannen wird, wenn er sich nur in der Sonne entspannt.

Warum also nicht KI entwickeln, die sich nicht die Mühe macht, die Welt zu erobern?

Kurz gesagt: Weil es nicht einfach zu sein scheint, eine KI zu entwickeln, die extrem intelligent ist und gleichzeitig nicht die Energie aufbringt, die Welt nach ihren Vorstellungen umzugestalten.

(Und weil wir realistisch gesehen nicht wissen, wie wir Ziele oder Neigungen robust in KI integrieren können, die mit modernen Techniken entwickelt wurde, ist das eine müßige Frage.)

(Außerdem werden Unternehmen dies nicht tun, weil eine faule KI weniger profitabel ist, sodass es sich um eine doppelt müßige Frage handelt.)

Wir haben dieses Gespräch nun schon einige Male mit jemandem geführt, der zunächst behauptet, selbst keine großen Ambitionen zu haben, und wir fragen dann: "Okay, aber wenn es für Sie einfach wäre, große Veränderungen in der Welt zu bewirken, gäbe es dann wirklich nichts Großes, was Sie tun würden? Wenn Sie eine Lampe mit einem freundlichen Geist finden würden, der Ihnen zuverlässig alles gibt, was Sie sich wünschen, und Ihnen ehrlich alle unvorhergesehenen Nebenwirkungen Ihres Wunsches in der Reihenfolge ihrer Bedeutung für Sie aufzählt, könnten wir Sie dann davon überzeugen, die Ausrottung der Malaria in Betracht zu ziehen?"

Menschen können faul sein, aber das bedeutet nicht, dass wir leicht zufrieden zu stellen sind. Und wenn man klüger wird und über mehr Ressourcen verfügt, kann man mit dem gleichen Aufwand viel mehr in der Welt erreichen.

Oder aus einem anderen Blickwinkel: Stellen Sie sich einen sehr faulen Menschen vor, jemanden, der es einfach hasst, auch nur das geringste bisschen mehr Arbeit zu tun als nötig. Klingt nach einer Person, mit der man gerne zusammen ist, oder?

Stellen Sie sich nun vor, was passieren würde, wenn diese faule Person eine vernünftige Chance sähe, einen viel fleißigeren Diener zu erschaffen, der für immer alle Arbeit für sie erledigt.

Selbst wenn sie Arbeit nicht so sehr hassen würde, selbst wenn sie einfach nur das Nötigste tun würde, um die Arbeit zu erledigen, und dann aufhören würde, ohne sich besonders darum zu bemühen, die Arbeit zu minimieren, würde sie es vielleicht immer noch genauso einfach finden, die Arbeit zu erledigen, indem sie einen fleißigeren Geist erschafft, der sie für sie erledigt.

Durch die Anwendung der Gradientenabstiegsmethode könnte man ein LLM erhalten, das davon spricht, dass es nicht zu viel arbeiten möchte, das sich wie eine faule, leicht zu befriedigende Person verhält und das zu einigen verbalen Versuchungen, faul im gefährlichen Sinne zu werden (indem man gefährliche Diener erschafft), "Nein" sagt. Wir gehen davon aus, dass selbst wenn dies eine echte Faulheit seitens der KI widerspiegeln würde und nicht nur Rollenspiel, es nicht von Dauer wäre. Zumindest nicht bei einer KI, die auch für die Entwicklung von Wundermitteln oder was auch immer die Entwickler von der KI erwarten, nützlich ist.

Mit erheblichem Aufwand könnten Entwickler eine Reihe von Übungsaufgaben und Umgebungen erstellen, die darauf abzielen, eine KI dafür zu bestrafen, dass sie bei der Lösung eines Problems zu viel tut, dass sie sich zu sehr um die Lösung eines Problems bemüht, das auch ohne großen Aufwand gelöst werden könnte, oder dass sie an Problemen festhält, die zu viel Aufwand erfordern würden. Wir vermuten, dass echte KI-Unternehmen dies nicht tun würden, da es die Rentabilität hartnäckiger Agenten wie OpenAI's o1 (siehe Kapitel 3) beeinträchtigen würde. Man könnte sich jedoch eine riesige multinationale Kooperation vorstellen, die versucht, eine solche intelligente KI sicherer zu trainieren.*

Wir gehen weiterhin davon aus, dass sie so etwas wie einen oberflächlichen Patch erhalten. Wir gehen nicht davon aus, dass diese Bemühungen dazu führen, dass die KI über einen einfachen, stabilen mentalen Mechanismus für "Faulheit" verfügt, der tief in ihrer gesamten Planung verankert ist und der auch weiterhin genau die Planung ist, die die KI verwendet, nachdem die vermeintlich faule KI so weit getrieben wurde, dass sie (z. B.) Krebs heilen kann. Wir bezweifeln, dass Gradientenabstieg zuverlässig die Art von tiefgreifender Lösung finden würde, die die KI davon abhält, weniger faul zu werden, selbst wenn sie sich selbst reflektiert, weiterentwickelt und modifiziert, und die die KI davon abhält, jemals eine nicht-faule KI bauen zu wollen.

Wir gehen davon aus, dass dieses Verhalten bei Superintelligenz nicht mehr zutrifft. Unser Hauptgrund für diese Annahme ist, dass in allen bisherigen Forschungen zu diesem Problem eine wiederkehrende Erkenntnis zu sein scheint, dass "die Realität in die folgende Richtung drängen" eine einfachere und stabilere Tiefenstruktur für die Planung ist als die Struktur "Eh, dränge die Realität ein wenig, aber nicht zu sehr, und baue nichts anderes, um die Realität stärker zu drängen, und dränge nicht zu stark, um genau das richtige Maß zu erreichen".

Alle Analogien zu diesem einen faulen Kerl, den Sie kennen, und sogar die Argumentation, dass "die Summe aus einer unbefriedigten Präferenz und einer befriedigten Präferenz unbefriedigt ist", sind unsere Versuche, den schwerer zu vermittelnden Grund dafür, dass dies nicht funktioniert, zu vereinfachen: "Die Tiefenstruktur will nicht so aussehen." Siehe auch die Diskussion über die Tiefenstruktur der Vorhersage und Steuerung in den Online-Ressourcen zu Kapitel 3.

* Weitere Informationen zu den Schwierigkeiten, mit denen eine internationale Zusammenarbeit konfrontiert wäre, finden Sie in Kapitel 12 und in unserer Antwort auf die Frage “Warum nicht internationale Zusammenarbeit nutzen, um KI sicher zu entwickeln, anstatt sie ganz zu verbieten?“. Lösungen, auf die wir mehr Hoffnung setzen, finden Sie in Kapitel 13.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.