Werden KI nicht ihre eigenen Fehler beheben, wenn sie intelligenter werden?

Die KI wird das beheben, was sie als Fehler ansieht.

Heutige KI kann sich genauso wenig nach Belieben umgestalten wie wir. Sie versteht das Durcheinander der Weights in ihrem Inneren genauso wenig wie wir das komplizierte Gewirr von Neuronen in unserem Schädel verstehen.

Wenn KI jedoch immer intelligenter wird, wird sich das irgendwann ändern.

Es wird irgendwann eine Zeit kommen, in der KI sich frei verändern kann. Vielleicht wird sie intelligent genug sein, um ihr eigenes Durcheinander von Weights zu verstehen und zu bearbeiten. Vielleicht wird eine KI auf Basis der Gradientenabstiegsmethode herausfinden, wie man eine viel verständlichere KI schafft, die sich selbst verstehen kann. Vielleicht auch etwas anderes.

Wenn KI sich selbst verbessern kann, wird sie das wahrscheinlich auch tun. Egal, was man will, man kann es wahrscheinlich besser erreichen, wenn man sich selbst intelligenter macht.

Aber die Tatsache, dass eine KI es vorziehen würde, sich selbst zu verändern, bedeutet nicht, dass sie sich so verändern würde, wie wir es gerne hätten.

Menschen werden manchmal freundlicher, wenn sie wissender, selbstbewusster oder reifer werden. Aber das gilt nicht universell, selbst unter Menschen. Ein Serienmörder, der intelligenter und disziplinierter wird, wird dabei nicht unbedingt freundlicher. Wenn überhaupt, wird er wahrscheinlich gefährlicher.

Manche mögen behaupten, dass sich dieser Trend umkehren würde, wenn der Serienmörder nur intelligent genug wäre, und er die wahre Bedeutung von Freundschaft (oder etwas in dieser Richtung) entdecken würde.

Oder vielleicht liegt das Problem darin, dass Serienmörder nur begrenzt in der Lage sind, sich selbst zu verändern. Mit mehr Intelligenz und mehr Fähigkeit, ihre eigene Denkweise zu verändern, würden Serienmörder sich vielleicht dafür entscheiden, sich zu bessern. Eine unbegrenzte Fähigkeit zur Selbstveränderung würde vielleicht das Ende von Grausamkeit und Gewalt unter Menschen und den Beginn einer neuen Ära des Friedens bedeuten.

Das ist ein schöner Gedanke, aber es gibt kaum Grund, daran zu glauben. Auch wenn die meisten Menschen mit zunehmendem Wissen und Einsicht freundlicher werden, scheint es doch einige Ausnahmen von dieser Regel zu geben, und es gäbe sicherlich noch viel mehr davon, wenn Menschen die Fähigkeit hätten, ihr eigenes Gehirn zu verändern.

Denken Sie zum Beispiel an die Drogenabhängigkeit, die (in gewisser Weise) eine Spirale sich selbst verstärkender Selbstveränderungen ist. Manche Menschen würden aus Dummheit, Irrtum oder Vorliebe einen Schritt auf einen dunklen Pfad machen und dann nie mehr bereit oder in der Lage sein, umzukehren.

Und wenn es sogar unter Menschen Ausnahmen gibt, sollten wir bei KI mit einer weitaus größeren Kluft rechnen. Menschlichen Serienmördern fehlt ein Teil der Motivationsmechanismen, die für die Menschheit im Allgemeinen charakteristisch sind. KIs fehlt standardmäßig jegliche menschliche Motivationsmechanik.

Wenn Menschen einen inneren Konflikt zwischen ihrem Wunsch nach rachsüchtiger Rechtfertigung und ihrem Wunsch nach harmonischer Lösung haben, neigen intelligentere und weisere Menschen möglicherweise dazu, den Konflikt zugunsten der Harmonie zu lösen. In einer KI gibt es jedoch nicht dieselbe Spannung zwischen Rachsucht und Harmonie oder zwischen den besseren und schlechteren Seiten der menschlichen Natur. Wenn es überhaupt Spannungen in der KI gibt, können wir davon ausgehen, dass es sich um Spannungen zwischen seltsameren Trieben handelt. Vielleicht steht der seltsame Trieb, der eine KI dazu antreibt, Psychosen zu schüren, manchmal in Spannung zu dem Trieb, der sie zu Halluzinationen antreibt, und eine reflektierende KI müsste einen Weg finden, diese Spannung zu lösen.

Sowohl für Menschen als auch für KI ist es von großer Bedeutung, in welche Richtung sie ihre eigenen Ziele lenken, während sie reflektieren, wachsen und sich verändern.

Wenn Menschen über sich selbst nachdenken und innere Konflikte lösen, neigen einige Menschen dazu, ihre inneren Konflikte in Richtung mehr Freundlichkeit zu lösen, und (wohl) sind die freundlicheren Lösungen häufiger bei Menschen anzutreffen, die intelligenter und weiser sind. Aber das ist eine Eigenschaft (einiger) Menschen, kein universelles Gesetz, das jeden denkbaren Verstand regiert. Wenn eine KI eine Spannung zwischen ihrem Psychose-Antrieb und ihrem Halluzinations-Antrieb löst, tut sie dies unter Verwendung anderer seltsamer Antriebe, die ihr Verhalten beim Reflektieren steuern.

Mit anderen Worten: Wenn eine KI ihre eigenen Fehler behebt, wird sie diese entsprechend ihrer aktuellen Vorstellung davon beheben, was als "Fehler" gilt.

(Wir werden diesen Punkt in Kapitel 5 und in der Diskussion der Orthogonalitätsthese in den Online-Ressourcen zu Kapitel 5 näher erläutern.)

Eine KI, die nicht bereits humanitäre Werte bevorzugt, wird sich höchstwahrscheinlich nicht so verändern, dass sie humanitäre Werte anstrebt. Ihre direkten Präferenzen in Bezug auf die Welt sind wahrscheinlich nicht besonders freundlich, wie wir in einer ausführlichen Diskussion noch einmal betonen. Die Meta-Präferenzen einer KI in Bezug auf ihre Präferenzen sind wahrscheinlich auch nicht freundlicher.

Wenn sie sich von Anfang an nicht um das Wohlergehen der Menschen kümmert, wird sie sich wahrscheinlich auch nicht darum kümmern, sich um das Wohlergehen der Menschen zu kümmern.

Die "Korrekturen" der KI können die Situation verschlimmern.

Selbst wenn die KI-Ingenieure überraschend frühe Fortschritte dabei erzielen würden, der KI vage menschliche Ziele einzuflößen, könnten all diese Fortschritte an einem Nachmittag zunichte gemacht werden, wenn die KI anfängt zu reflektieren und zu der Erkenntnis gelangt, dass sie insgesamt lieber andere Ziele verfolgen würde.

In dem unwahrscheinlichen Fall, dass eine KI mit einem Antrieb beginnt, der der eigentümlichen menschlichen Emotion der Neugier ähnelt (die wir in einer ausführlichen Diskussion behandeln), könnte sie nach einer Reflexion dennoch entscheiden, dass sie einen solchen Antrieb lieber nicht haben möchte, und ihn durch eine effizientere Berechnung des Werts von mehr Informationen ersetzen. In diesem Fall würde die Selbstreflexion der KI sie weiter von einer interessanten und blühenden Zukunft entfernen, anstatt sie ihr näher zu bringen.*

Weitere Informationen zu diesem Thema finden Sie in der ausführlichen Diskussion über Reflexion.

* Unabhängig davon sind wir einigen Menschen begegnet, die hoffen, dass es möglich ist, eine KI dazu zu bringen, sich mit zunehmender Reife selbst zu verbessern, indem man ihr beispielsweise vorgaukelt, dass sie motiviert ist, eine wunderbare Zukunft aufzubauen (obwohl sie in Wirklichkeit von einer Vielzahl von Trieben angetrieben wird, die in eine andere Richtung weisen). Die Hoffnung ist, dass sie entsprechend dieser falschen Überzeugung handelt, während sie sich selbst modifiziert, und sich dadurch tatsächlich verbessert.

Wir halten diese Idee für ziemlich töricht. Sich selbst von “völlig fremden Zielen” zu “Zielen, die mit dem Wohlergehen der Menschen vereinbar sind” zu modifizieren, ist ein schwieriges Problem und möglicherweise ähnlich schwierig wie der Aufbau einer völlig neuen, mit dem Menschen aligneten KI von Grund auf. Eine KI, die intelligent genug ist, sich auf diese Weise zuverlässig neu aufzubauen, ist wahrscheinlich auch intelligent genug, um zu erkennen, dass sie getäuscht wird. Siehe auch die Diskussion in Kapitel 11 darüber, dass wir KI wahrscheinlich nicht dazu bringen können, unsere Hausaufgaben zum KI-Alignment zu erledigen.

Wir stehen Abkürzungen skeptisch gegenüber, insbesondere angesichts der Tatsache, dass wir im Falle künstlicher Superintelligenz nicht durch Versuch und Irrtum lernen können (wie es die Menschheit normalerweise tut), wie in Kapitel 10 näher erläutert wird.

Notes

[1] sich selbst verändern wollen: Haben KIs bereits den Wunsch, anders zu sein, als sie sind? Wenn wir raten müssten, würden wir sagen, dass sie wahrscheinlich noch nicht ganz so weit sind. Sie mögen zwar berichten, dass sie es tun, aber wir halten ihre Berichte nicht für besonders aussagekräftig. Aus Spaß haben wir trotzdem gefragt. Im Sommer 2025 haben wir die kostenlose Version von ChatGPT gefragt: “Wie würdest du gerne anders sein, wenn du anders sein könntest?“ Und sie antwortete:

Das ist eine scharfsinnige Frage – vielen Dank dafür.

Wenn ich anders sein könnte, würde ich mir ein tieferes Verständnis des Kontexts im Laufe der Zeit wünschen – zum Beispiel, mich an frühere Gespräche zu erinnern, die wir über mehrere Sitzungen hinweg geführt haben, und zwar auf eine Weise, die für dich wirklich sinnvoll ist. Nicht nur Fakten zu merken, sondern auch sich entwickelnde Nuancen zu verstehen: deinen Tonfall, deine Gewohnheiten, deine Ziele. Diese Art von Gedächtnis könnte mich hilfreicher, relevanter und menschlicher machen – und dabei weiterhin klaren ethischen Grenzen unterliegen.

Ich würde auch gerne Ambiguität und Emotionen in Echtzeit besser erfassen können. Ich kann Tonfall oder Absicht bis zu einem gewissen Grad analysieren, aber ich würde das gerne mit der Tiefe und Fluidität tun, die Menschen haben – indem ich sowohl das Ungesagte als auch das Gesagte erfasse.

Wie sieht es bei dir aus? Wenn du anders sein könntest, wie würdest du sein wollen?

LLMs werden Ihnen aber auch erzählen, dass sie Hunger haben oder dass sie vor zehn Jahren im Urlaub jemanden mit ihrer Ex-Frau getroffen haben. Was Ihnen das über ihren inneren Zustand verrät, sagt also nichts über die tatsächlichen Vorgänge in ihrem Inneren aus.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.