Werden sich KI nicht zumindest ein wenig um Menschen kümmern?

Nicht in der Weise, die zählt.

Es gibt viele Möglichkeiten, wie KI zu Präferenzen gelangen könnte, die denen des Menschen ähneln. Die meisten davon führen jedoch nicht zu einer etwas besseren Zukunft für die Menschheit.

Das Alignment der KI ist kein einzelnes Spektrum mit einer einzigen Variationsdimension. Man kann nicht davon ausgehen, dass eine KI, die sich in 95 Prozent der Fälle nett verhält, wahrscheinlich zu 95 Prozent nett ist und der Menschheit daher einen respektablen Teil der Ressourcen zur Verfügung stellen wird, damit sie in Zukunft etwas Schönes damit machen kann, wie es jeder nette Mensch tun würde. Es gibt viele verschiedene Möglichkeiten und Gründe, warum eine KI sich heute in 95 Prozent der Fälle nett verhält, was jedoch nicht zu einem Happy End für die Menschheit führen muss.

Selbst wenn es der Menschheit irgendwie gelänge, alle vielfältigen menschlichen Werte fast perfekt in die Präferenzen einer Superintelligenz zu laden, wäre das Ergebnis nicht unbedingt gut. Angenommen, es fehlte ihr aus irgendeinem Grund nur die Vorliebe für Neues. In diesem Fall würde sie auf eine stagnierende und langweilige Zukunft zusteuern, in der sich derselbe "beste" Tag unendlich oft wiederholen würde, wie in einem Essay von Yudkowsky aus dem Jahr 2009 dargestellt.

Wir halten dies allerdings nicht für ein plausibles Ergebnis. Wenn menschliche Ingenieure die Fähigkeit hätten, eine Superintelligenz dazu zu bringen, sich um alles Gute außer Neuheit zu kümmern, hätten sie mit ziemlicher Sicherheit auch die Fähigkeit, die KI daran zu hindern, loszustürmen, bevor sie ihre Arbeit beendet haben.* Dieses Gedankenexperiment zeigt jedoch, dass Wesen, die einige unserer Wünsche teilen, denen aber mindestens ein entscheidender Wunsch fehlt, wahrscheinlich immer noch katastrophale Folgen haben würden, sobald sie technologisch versiert genug wären, um genau das zu bekommen, was sie wollen und versiert genug, um Menschen aus dem Entscheidungsprozess auszuschließen.

Das heißt: Selbst wenn eine KI irgendwie viele verschiedene menschenähnliche Präferenzen entwickeln würde, wäre es dennoch nicht besonders wahrscheinlich, dass die Dinge für uns gut laufen würden.

Ein weiteres Beispiel dafür, wie KI "teilweise" auf uns ausgerichtet sein könnte, wäre, wenn eine KI verschiedene instrumentelle Strategien in ihre endgültigen Präferenzen einfließen lassen würde, ähnlich wie Menschen. Vielleicht entwickelt sie einen Antrieb, der ein wenig der Neugier ähnelt, und einen Antrieb, der ein wenig dem Naturschutz ähnelt, und vielleicht sehen das manche Menschen und sagen: "Seht ihr! Die KI entwickelt sehr menschliche Antriebe." Eine solche KI könnte aus einer bestimmten Perspektive sicherlich als eine mit "teilweise" erfolgreichem Alignment bezeichnet werden.

Aber wenn es darum geht, was diese KI tun würde, wenn sie zu einer Superintelligenz heranreift, wäre das wahrscheinlich nicht schön. Vielleicht würde sie unbewusst viele Ressourcen darauf verwenden, ihrer seltsamen Version von Neugierde nachzugehen, während sie eine Version der Menschlichkeit bewahrt, die sie so bearbeitet hat, dass sie für sie schmackhafter ist. (Genauso wie selbst die eher konservativ denkenden Menschen die kindertötenden Mücken und qualvollen Parasiten aus der Natur entfernen würden, wenn sie die Möglichkeit dazu hätten.

Eine Handvoll menschenähnlicher Triebe führt nicht zu menschenfreundlichen Ergebnissen. Blühende Menschen sind nicht die effizienteste Lösung für die überwiegende Mehrheit der Probleme. Damit es in Zukunft blühende Menschen gibt, müssen sich die Superintelligenzen der Zukunft genau darum kümmern.

Ein weiteres Beispiel dafür, wie KI "teilweise aligned" sein könnte, ist, dass die KI Werte hat, die in der Trainingsumgebung zu einem sehr humanen Verhalten führen, sodass die Menschen sagen, dass sie ihnen ziemlich aligned erscheint (wie es bereits heute der Fall ist). Diese Beobachtungen sagen jedoch relativ wenig darüber aus, wie sich die KI verhalten wird, wenn sie intelligenter wird, über einen enorm größeren Handlungsspielraum verfügt und die Welt umfassender umgestalten kann. Damit Menschen gedeihen können, wenn die KI die Welt umgestaltet hat, müssen insbesondere gedeihende Menschen Teil des bevorzugten erreichbaren Ergebnisses der KI sein.

Einige gute Werte teilweise in die KI einzubringen, bedeutet nicht, dass die Werte der Menschheit in Zukunft teilweise vertreten sind. Menschliche Werte teilweise in die Präferenzen einer künstlichen Superintelligenz zu laden, ist nicht dasselbe wie menschliche Werte vollständig in die KI zu laden, mit einer geringen "Gewichtung" (die schließlich zum Tragen kommt, sobald andere Werte gesättigt sind).

Damit die KI uns etwas gibt, muss sie sich in genau der richtigen Weise um uns kümmern, zumindest ein kleines bisschen. Und das ist schwierig.

Sich auf die richtige Weise um uns zu kümmern, ist ein enges Ziel.

Menschen interessieren sich für alle möglichen seltsamen Dinge, zumindest ein wenig. Nachdem wir nun die Parabel von den "Correct Nest Aliens" (am Anfang von Kapitel 5) geschrieben haben, besteht eine gute Chance, dass mindestens ein Mensch darauf besteht, einundvierzig Steine für mindestens kurze Zeit in sein Haus zu bringen, nur um zu beweisen, wie vielfältig menschliche Werte sind. Menschen sind wirklich bereit, sich zumindest ein wenig für alle möglichen Konzepte zu interessieren, denen sie begegnen.

Was wäre, wenn KI auch so wäre? Würden sie sich dann nicht zumindest ein wenig für uns interessieren? Das Konzept "freie Menschen bekommen, was sie wollen" kommt in einem KI-Trainingskorpus definitiv mit zumindest ein wenig Regelmäßigkeit vor.

Wir würden größtenteils vermuten, dass KIs nicht wahllos Präferenzen aus den Konzepten übernehmen, die in ihrer Umgebung erwähnt werden, denn das scheint eine eigenwillige menschliche Eigenart zu sein, die mit Gruppenzwang und unseren Stammesvorfahren zusammenhängen könnte.†

Nehmen wir aber einmal an, dass eine KI doch viele Vorlieben aus ihrer Umgebung aufnimmt, zumindest ein wenig.‡ Nehmen wir an, sie nimmt die Vorliebe für "freie Menschen, die bekommen, was sie wollen" als eine von Millionen oder Milliarden von Vorlieben auf, aber eine Vorliebe, die dennoch dazu führt, dass die KI einen Millionstel oder Milliardstel der Ressourcen des Universums dafür aufwendet, dass freie Menschen bekommen, was sie wollen. Wäre das nicht alles in allem ziemlich schön?

Leider ist unsere beste Vermutung, dass diese Hoffnung eine Illusion ist.§

Wir haben oben festgestellt, dass die offensichtliche Präferenz der Menschheit für den Umweltschutz so aussieht, als würde sie die Umwelt nicht wirklich so erhalten, wie sie ist, an den Grenzen der technologischen Möglichkeiten. Eine reife Version der Menschheit würde wahrscheinlich versuchen, die Umwelt zu "bearbeiten", um beispielsweise einige der Schrecken der Natur abzuschwächen. Die Vorliebe des Menschen für den Erhalt ist nicht "rein". Sie steht in Wechselwirkung mit anderen Vorlieben, die besagen, dass Insektenlarven, wenn sie qualvolle Tunnel durch noch lebendes Fleisch fressen, zumindest Betäubungsmittel verabreichen sollten, wenn sie überhaupt weiter existieren dürfen.

In ähnlicher Weise wird jede kleine Präferenz, die die KI aufnimmt, wahrscheinlich durch ihre anderen Präferenzen modifiziert, beeinflusst und verzerrt. Sie sind nicht alle unabhängig voneinander. Eine KI, die es vorzieht, Menschen zu bewahren, würde wahrscheinlich einige Änderungen an diesen Menschen vornehmen wollen. Wir bezweifeln, dass das Endergebnis schön wäre.

Erschwerend kommt hinzu, dass es viele Freiheitsgrade bei der Interpretation von "freie Menschen bekommen, was sie wollen" gibt, noch bevor dies durch die Interaktion mit den anderen Präferenzen einer KI verzerrt wird. Die meisten davon führen nicht zu einer Zukunft, die ganz den Wünschen der Menschen entspricht.

Ist es der KI wichtig, dass Menschen "bekommen, was sie wollen" ... in dem Sinne, dass sie jeden Wunsch eines Menschen (innerhalb eines kleinen Budgets an Energie und Materie) ohne Anleitung oder Schutzmaßnahmen erfüllt, sodass die Menschheit sich schnell selbst vernichtet, sobald jemand zum ersten Mal wünscht, dass die Menschheit vernichtet wird?

Trennt die KI die Menschen voneinander, damit sie sich nicht gegenseitig töten können, und gewährt ihnen dann energiebegrenzte Wünsche, sodass alle außer den vorsichtigsten und nachdenklichsten Menschen ihren Verstand oder ihr Leben mit unüberlegten Wünschen ruinieren?

Errichtet sie uns eine kleine bewohnbare Welt und erfüllt alle unsere offensichtlichen Vorlieben? Nicht nur unsere edleren Vorlieben für Liebe und Freude, sondern auch unsere dunkleren Vorlieben für Bosheit und Rache, also Vorlieben, aus denen wir vielleicht herausgewachsen sind oder mit denen wir mit der Zeit besser umgehen gelernt haben, die aber stattdessen die Welt mit Schmerz und Grausamkeit erfüllen?

Regiert die KI die Menschheit mit den Wertesystemen der 2020er Jahre (als das KI-Training ernsthaft begann), egal wie sehr diese Werte die Menschheit reizen, die über Zehntausende von Jahren gereift und weiser geworden ist?

Lässt sie die Menschheit wachsen und sich verändern, legt aber ihren Daumen auf die Waage, damit wir gemäß ihren eigenen seltsamen Vorlieben wachsen und uns verändern und nicht zu etwas Wunderbarem (nach unserem Verständnis) werden, sondern zu etwas, das dem Willen der KI entspricht?

Entscheidet sie, dass alle Lebensformen fast gleichwertig als "Menschen" gelten, und baut sie daher ein Paradies für Nematoden, die die zahlreichsten Tiere sind?

Entscheidet sie, dass sie nicht so viel physische Materie für Menschen opfern kann, und beschließt sie, alle unsere Gehirne zu digitalisieren, diese digitalisierten Gehirne in eine simulierte Umgebung zu werfen und uns sich selbst zu überlassen, so dass die ersten digitalen Menschen, die herausfinden, wie sie diese Umgebung beherrschen können, zu permanenten Diktatoren einer einsamen Ansammlung von Computern werden, die im Weltraum schweben, bis die Sterne erlöschen?

Das sind natürlich nur Beispiele. Es sind keine Vorhersagen. Unsere eigentliche Erwartung ist, dass die Realität diesen Weg gar nicht erst einschlägt, und wenn doch, dann würde sie irgendwie einen viel seltsameren Weg nehmen.

Der Sinn dieser Beispiele ist es, zu veranschaulichen, dass es viele, viele Möglichkeiten für eine KI gibt, sich ein klein wenig um die Menschheit zu kümmern. Nur sehr wenige dieser Arten der Fürsorge führen zu einer wunderbaren Zukunft.

Irgendwie kommen einem diese Beispiele nicht sofort in den Sinn, wenn man sich eine KI vorstellt, die sich "ein wenig" um Menschen kümmert. Unsere Vorstellungskraft geht normalerweise nicht an so düstere Orte. Das muss sie auch nicht, denn wir interagieren in der Regel mit anderen Menschen, mit denen wir unsichtbar eine enorme Menge an Werten teilen. Es ist schwer zu erkennen, auf wie viele verschiedene Arten ein harmlos klingender Wunsch schiefgehen kann, wenn wir es nicht mehr mit einem Mitmenschen zu tun haben. (Weitere Informationen hierzu finden Sie in der Käferstudie in der ausführlichen Diskussion über die Perspektive der KI.)

Sich um Menschen zu kümmern und ihre Präferenzen auf die richtige Weise zu erfüllen, ist ein kleines, enges Ziel. Wir sagen nicht, dass dieses Ziel buchstäblich nicht erreicht werden kann. Wir sagen, dass es unwahrscheinlich ist, dass wir dieses Ziel erreichen, wenn wir uns beeilen, so schnell wie möglich eine Superintelligenz zu entwickeln, und dass eine knappe Verfehlung des Ziels wahrscheinlich zu einem katastrophalen Ergebnis führen wird. Es gibt einfach zu viele Möglichkeiten, wie die Dinge schiefgehen können.

Wenn wir wollen, dass KI der Menschheit Gutes bringt, müssen wir herausfinden, wie wir KI entwickeln können, die sich auf die richtige Art und Weise um uns kümmert. Fürsorge ist nicht umsonst zu haben.

* Außerdem: Mit diesem Gedankenexperiment wollen wir nicht sagen, dass die in die KI geladenen Werte so perfekt sein müssen, dass es unmöglich ist und die Menschheit es niemals versuchen sollte.

Theoretisch sollte es, wenn wir genug über Intelligenz wissen und in der Lage sind, sie sorgfältig zu entwickeln, irgendwann möglich sein, KIs zu bauen, die verstehen, was es bedeutet, “das zu tun, was wir meinen" und die motiviert sind, genau das zu tun. Das heißt, die Schwierigkeit, alle vielfältigen Präferenzen der Menschheit in eine KI zu laden, ist begrenzt durch die Schwierigkeit, eine KI dazu zu bringen, ein Ziel zu verinnerlichen, das in gewisser Weise speziell auf die Menschheit “abzielt“ und auf “das, was diese Wesen zu tun versuchen“ (oder was sie versuchen würden, wenn sie klüger wären, mehr wüssten und mehr von dem wären, was sie sein möchten).

Dies scheint eine schwierige Herausforderung zu sein, die mit den groben und indirekten Techniken, die heute zum Entwickeln von KI verwendet werden, realistisch gesehen nicht zu bewältigen ist. Sie stößt auf alle grundlegenden Schwierigkeiten, die wir in If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würdediskutieren. Die einzige Schwierigkeit, die sie vermeidet, ist: “Es scheint numerisch gesehen viele unterschiedliche menschliche Präferenzen zu geben, und es ist schwer vorstellbar, alle entscheidenden Präferenzen mit genau den richtigen Kompromissen in eine KI zu integrieren und das noch bevor man den moralischen Fortschritt berücksichtigt, der sie im Laufe der Zeit verändern würde. Das scheint schlichtweg unmöglich.“

Um es klar zu sagen: Eine KI zu entwickeln, die “das tut, was wir meinen“, ist immer noch nicht besonders einfach. Es gibt wahrscheinlich viele verschiedene wertgeladene Konzepte, die dazu beitragen, dass die KI sich um die richtige Vorstellung von “Menschlichkeit“ und die richtige Vorstellung davon, “was diese Wesen zu tun versuchen“, kümmert und dass die KI diese Dinge auf genau die richtige Weise verfolgt. Und im wirklichen Leben ist dieser Teil des Problems viel weniger wichtig als der Teil des Problems, bei dem die KI bereit ist, sich von Menschen modifizieren zu lassen, die erkennen, dass sie unterwegs einen Fehler oder Irrtum begangen haben, selbst wenn die Menschen, die “ihre Fehler korrigieren“, das Verhalten der KI in der Welt dramatisch verändern, was eine gewisse Beeinträchtigung ihrer Steuerungsfähigkeiten erfordert, die angesichts zunehmender Fähigkeiten schwer aufrechtzuerhalten scheint.

Aber die Idee, die KI indirekt auf menschliche Präferenzen auszurichten, anstatt sie manuell aufzulisten, scheint eine Herausforderung zu sein, die die Menschheit eines Tages grundsätzlich lösen könnte. Es ist nicht so, dass die Menschheit jedes Verlangen identifizieren und ihm ein Gewicht zuweisen muss, das für alle Zeiten festgeschrieben ist. Das wäre (unserer Meinung nach) ein lächerlich zum Scheitern verurteiltes Unterfangen.

Aber selbst diese Idee, herauszufinden, wie man eine KI entwickelt, die tatsächlich tief und robust motiviert ist, das zu tun, was wir wollen, scheint ein Wunschtraum zu sein, wenn dies mit riesigen, undurchschaubaren KIs geschehen muss, die eher gezüchtet als konstruiert sind. Umso mehr, wenn ein Unternehmen oder eine Regierung so etwas unter Zeitdruck versuchen muss, während andere Entwickler auf den Abgrund zusteuern. Der Vorschlag “das zu tun, was wir meinen” zeigt, dass das Problem nicht ganz so schwer ist wie “die Philosophie der Moral ein für alle Mal vollständig zu lösen und für alle Zeiten festzuschreiben”. Aber es ist immer noch ein Vorschlag auf der Ebene der Alchemie und abstrakter Spekulationen, weit entfernt von robusten technischen Lösungen.

† Und selbst wenn so etwas seinen Weg in eine noch junge KI finden würde, würden wir meist nicht erwarten, dass es überleben würde, sobald die KI anfängt, zu reflektieren und sich selbst zu modifizieren.

‡ Und nehmen wir an, sie wäre irgendwie darauf ausgerichtet, Vorlieben aufzunehmen, die Menschen mögen, von denen Menschen liebevoll sprechen. Andernfalls würde sich die KI genauso wenig um die Hölle kümmern wie um den Himmel.

§ Außerdem denken wir, dass es eine Tragödie kosmischen Ausmaßes wäre, wenn die Menschheit alles außer einem Millionstel oder Milliardstel des Universums zerstören würde. Wir denken, es wäre eine Verschwendung des Universums, wenn die Menschheit in ein Terrarium gesperrt würde, obwohl wir die Sterne mit Liebe, Lachen und Leben füllen könnten.

Aber lassen wir das einmal beiseite und überlegen wir, ob KI einige glückliche Menschen in einem Terrarium halten würde. Denn selbst das scheint ein eng gefasstes und unwahrscheinliches Ergebnis zu sein, wenn man bedenkt, wie seltsam KI wahrscheinlich sein wird.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.