Warum nicht einfach die Gedanken der KI lesen?
Ihre Gedanken sind schwer zu lesen.
Viele Menschen, die in der KI-Branche arbeiten, darunter auch eine Handvoll Laborleiter, haben in verschiedenen Diskussionen mit uns folgenden Einwand vorgebracht:
Eine KI wird uns nicht täuschen können, weil wir ihre Gedanken lesen können! Wir haben vollen Zugriff auf das "Gehirn" der KI.
Selbst wenn die KI Dinge weiß, die wir nicht wissen, und einen Plan ausarbeitet, dessen Konsequenzen wir nicht verstehen würden, müsste die KI vermutlich zumindest einmal den Gedanken haben, dass es nützlich wäre, ihre Betreiber zu täuschen, und wir, die wir die Gedanken der KI lesen können, würden dies bemerken. (Und wenn es zu viele Gedanken gibt, als dass wir sie überwachen könnten, können wir einfach andere KIs ihre Gedanken überwachen lassen!
Ein Nachteil dieses Plans ist, dass wir derzeit schlecht darin sind, die Gedanken von KI zu lesen. Die Fachleute, die sich mit den Vorgängen im Inneren von KI beschäftigen, sind noch weit von diesem Verständnisniveau entfernt und sprechen offen über diese Tatsache.
Wie wir in Kapitel 2 besprochen haben, werden moderne KI nicht entwickelt, sondern gezüchtet. Wir können zwar die riesige Menge an Zahlen betrachten, aus denen das Gehirn einer KI besteht, aber das bedeutet nicht, dass wir diese Zahlen sinnvoll interpretieren und erkennen können, was die KI denkt.
Seit Ende 2024 und dem Aufkommen von "Reasoning"-Modellen gibt es Teile der Gedanken von KI, die zumindest lesbar erscheinen (die "Reasoning Traces"). Und sie sind viel besser lesbar als alles, was im Basismodell vor sich geht. Aber diese Protokolle sind auch irreführend, und es gibt zahlreiche Möglichkeiten für eine KI, Gedanken zu verbergen, die sie uns lieber nicht zeigen möchte.
Darüber hinaus denken moderne KI wahrscheinlich ziemlich einfache und oberflächliche Gedanken, verglichen mit einer Superintelligenz. Das Problem wird wahrscheinlich nur noch schwieriger, wenn KI intelligenter wird und immer mehr Gedanken entwickelt, die für uns immer weniger verständlich sind.
Kann man das Problem lösen, indem man einfach andere KI einsetzt, um die KI zu überwachen und sicherzustellen, dass sie auf Kurs bleibt? Wir bezweifeln das.
Wenn die brillanten menschlichen Wissenschaftler, die die KI entwickeln, nicht herausfinden können, was die KI denkt, werden schwache KIs wahrscheinlich auch Schwierigkeiten damit haben. Und die Art von KI, die intelligent genug ist, um dies zu tun, ist wahrscheinlich selbst gefährlich und wird wahrscheinlich nicht genau das tun, was man von ihr verlangt. Das ist ein Henne-Ei-Problem.
Wir wüssten nicht, was wir tun sollten, wenn wir eine KI mit gefährlichen Gedanken erwischen würden.
Ein weiterer Fehler in diesem Plan: Selbst wenn KI-Forscher die Gedanken einer KI gut genug lesen könnten, um die Warnsignale zu erkennen, was würden sie tun, wenn sie eines sehen würden?
Sie könnten die fehlbare KI bestrafen und sie so trainieren, dass sie den Detektor für "schlechte Gedanken" nicht mehr auslöst. Das würde die KI jedoch nicht unbedingt dazu bringen, solche Gedanken zu unterlassen, sondern vielmehr dazu, ihre wahren Gedanken vor dem Detektor zu verbergen.
Dieses Problem ist heimtückisch. Der Anreiz, der eine KI dazu veranlasst, sich gegen Menschen zu wenden, um das zu bekommen, was sie will, ist kein oberflächlicher Aspekt ihres Temperaments, der einfach wegmassiert werden kann. Es ist einfach eine Tatsache, dass eine ausgereifte KI Präferenzen haben würde, die sich von denen der Betreiber unterscheiden; es ist eine Tatsache, dass sie mehr von dem bekommen würde, was sie bevorzugt, wenn sie ihre Betreiber unterwandert.
Die Mechanismen in einer KI, die gut darin sind, echte Vorteile in einer Vielzahl von Bereichen auf tiefgreifende und allgemeine Weise zu erkennen und auszunutzen, sind auch in der Lage, Möglichkeiten zur Unterwanderung der Betreiber der KI zu erkennen und auszunutzen.
Selbst wenn man einen Alarm bauen könnte, der immer dann ausgelöst wird, wenn eine KI bemerkt, dass ihre Präferenzen und Ihre Präferenzen nicht übereinstimmen, sagt Ihnen dieser Alarm nicht, wie Sie eine KI bekommen, die sich wirklich für gute Dinge interessiert. Es ist viel einfacher, eine KI so zu trainieren, dass sie Ihre Überwachungsinstrumente täuscht, oder sogar so, dass sie sich selbst täuscht, als sie so zu trainieren, dass sie tatsächlich eine Zukunft bevorzugt, die nach menschlichen Maßstäben wunderbar ist, insbesondere auf eine Weise, die robust gegenüber der Entwicklung der KI hin zur Superintelligenz ist.
Wenn KI sorgfältig und präzise unter Verwendung von Methoden entwickelt würde, die auf einer ausgereiften und bewährten Theorie der Intelligenz basieren, könnten KI-Forscher möglicherweise Alarmsysteme einrichten, die ihnen helfen würden, Fehler in ihrem Design zu erkennen und zu beheben. Aber moderne KI ist nicht so.
Moderne KI (zum Zeitpunkt des Verfassens dieses Artikels) neigt zu "Halluzinationen", bei denen sie einfach Antworten auf Fragen in einem selbstbewusst klingenden Tonfall erfindet. Aber kein KI-Ingenieur ist auch nur annähernd in der Lage, genau zu verstehen, welche Mechanismen dies verursachen. Ebenso verfügt niemand über das Verständnis oder die Präzision, die erforderlich wären, um in eine KI einzudringen und nur die halluzinierenden Teile herauszuziehen (wenn so etwas überhaupt möglich ist).
Noch schwieriger wäre es, die "irreführenden" Teile einer KI herauszufiltern.
Wenn wir extrem viel Glück haben, werden die Helden, die an der Interpretierbarkeit von KI arbeiten, ihr Fachgebiet so weit vorantreiben, dass es möglich ist, einige Alarme einzurichten, die in einem Bruchteil der Fälle ausgelöst werden, in denen KIs einen täuschenden Gedanken haben. Aber was dann? Wenn der Alarm losgeht, werden dann alle einfach aufhören? Oder werden zutiefst gedankenlose Ingenieure die KI so lange umtrainieren, bis sie lernt, ihre Gedanken besser zu verbergen, und die Alarme nicht mehr ausgelöst werden?
Tatsächlich haben wir (Yudkowsky und Soares) mit der Arbeit am Problem des KI-Alignment begonnen, bevor klar war, dass Gradientenabstieg zum dominierenden Paradigma werden würde. Damals, als in der KI noch nichts funktionierte, schien es eine vernünftige Wette zu sein, dass die Menschheit auf dem Weg zur Schaffung von Intelligenz herausfinden würde, wie Intelligenz überhaupt funktioniert, und selbst dann erwarteten wir, dass das Problem des KI-Alignment schwierig sein würde (aus verschiedenen Gründen, z. B. aufgrund der Art und Weise, wie sich die KI im Laufe der Zeit verändern würde). Das Lesen der Gedanken der KI wäre ein Schritt zurück zu dem etwas einfacheren Alignment-Problem eines Verstandes, den Menschen verstehen, aber nur ein Schritt: Das Lesen eines Verstandes ist weit davon entfernt, einen Verstand im Detail zu verstehen oder zu wissen, wie man ihn verändern kann.
Das Lesen der Gedanken der KI ist keine Lösung für diese Herausforderung. Es ist hilfreich, aber es ist keine Lösung. Wir glauben nicht, dass es aus heutiger Sicht realisierbare technologische Lösungen gibt. Das bedeutet, dass die Menschheit sich einfach von dieser Herausforderung zurückziehen muss.*
Siehe auch: Warnzeichen helfen nicht, wenn man nicht weiß, was man damit anfangen soll.
* Wir diskutieren dies ausführlicher in den letzten Kapiteln des Buches.