Zeigen Halluzinationen nicht, dass moderne KIs schwach sind?
Halluzinationen offenbaren sowohl eine Einschränkung als auch ein Misalignment.
Moderne LLMs (zum Zeitpunkt der Erstellung dieses Artikels Mitte 2025) neigen zu "Halluzinationen", bei denen sie Antworten auf Fragen in einem selbstbewusst klingenden Tonfall erfinden. Wenn man sie beispielsweise bittet, ein Rechtsgutachten zu entwerfen, erfinden sie manchmal falsche Gerichtsverfahren als Präzedenzfälle.
Das ist verständlich, wenn man weiß, wie KI trainiert wird. Eine KI gibt Worte von sich, die denen eines echten Anwalts sehr ähnlich klingen, und wenn ein echter Anwalt ein juristisches Briefing verfassen würde, würde er echte Gerichtsverfahren einbeziehen. Ein echter Anwalt würde beispielsweise etwas schreiben wie:
Bei der Anwendung des Abwägungstests in Graham hat das Gericht festgestellt, dass das staatliche Interesse an der Verhaftung eines Verdächtigen wegen einer geringfügigen Straftat gering ist. Siehe Jones v. Parmley, 465 F.3d 46 (2d Cir. 2006) (die Jury konnte vernünftigerweise zu dem Schluss kommen, dass das Treten und Schlagen friedlicher Demonstranten unter Verstoß gegen die örtliche Verordnung unverhältnismäßig war); Thomas v. Roach, 165 F.3d 137 (2d Cir. 1999) (verbale Drohungen sind ein zu geringfügiges Vergehen, um ein starkes staatliches Interesse an der Verhaftung zu begründen).
Ein echter Anwalt würde niemals einfach "Ich kenne die relevante Rechtsprechung leider nicht" in einem Rechtsgutachten schreiben. Wenn also eine KI versucht, wie ein Anwalt zu klingen, obwohl sie die Präzedenzfälle nicht kennt, ist es das Beste, was sie tun kann, sich welche auszudenken. Das ist das Beste, was sie erreichen kann. Die Impulse und Instinkte innerhalb der KI, die in einer solchen Situation selbstbewusst klingende Texte produzieren, werden regelmäßig durch Gradientenabstieg verstärkt.
Dieses halluzinatorische Verhalten bleibt bestehen, selbst wenn man die KI auffordert, in Fällen, in denen sie keine Ahnung hat, "Ich weiß es nicht" zu sagen. In diesem Fall verhält sich die KI ein wenig wie ein Anwalt, der sagen würde: "Ich kenne den Präzedenzfall hier nicht", wenn er den Präzedenzfall nicht kennen würde. Aber das spielt keine Rolle, solange die KI (mehr oder weniger) einen Anwalt spielt, der den Präzedenzfall kennt, was bedeutet, dass die Figur, die die KI spielt, nie in die Lage kommt, "Ich weiß es nicht" zu sagen. Die KI könnte einen Text wie den folgenden produzieren:
Im Rahmen des Graham-Abwägungsmodells haben Gerichte durchweg anerkannt, dass ein minimales staatliches Interesse an der Durchführung von Festnahmen wegen geringfügiger Verstöße besteht. Siehe Carson v. Haddonfield, 115 F.3d 64 (8. Cir. 2005) (Feststellung übermäßiger Gewaltanwendung, als Polizeibeamte Pfefferspray gegen Verdächtige einsetzten, die bei einem Verkehrsverstoß keinen Widerstand leisteten); Walburg v. Jones, 212 F.3d 146 (2. Cir. 2012) (Feststellung, dass eine Vorladung wegen ungebührlichen Verhaltens nicht ausreicht, um physische Zwangsmaßnahmen zu rechtfertigen).
Dies ist die größtmögliche Annäherung der KI an den tatsächlichen Text. Der Text "Ich kenne den Präzedenzfall nicht" ist in Bezug auf die Textvorhersage weiter vom tatsächlichen Text entfernt;* er würde dem ersten Absatz des obigen Textes viel weniger ähneln, auch wenn er eher dem entspricht, was der Benutzer wollte.
Dies ist ein kleiner Einblick in den Unterschied zwischen dem, was KI tatsächlich zu tun versucht (z. B. wie ein selbstbewusster Anwalt zu klingen), und dem, was die Nutzer von ihr erwarten (z. B. ein brauchbares Rechtsgutachten zu verfassen). Diese beiden unterschiedlichen Ziele können sich manchmal überschneiden (z. B. wenn die KI versucht, freundlich zu klingen, und der Mensch einen freundlichen Zuhörer möchte), aber diese Unterschiede, die jetzt noch gering erscheinen, hätten enorme Konsequenzen, wenn die KIs intelligenter würden, wie wir in Kapitel 4 noch genauer diskutieren werden.†
Es ist unklar, wie schwierig es sein wird, Halluzinationen zu beseitigen, oder inwieweit dies die Fähigkeiten verbessern wird.
Unabhängig davon, warum Halluzinationen auftreten, ist es eine Tatsache, dass sie in der Praxis die effektiven Fähigkeiten von LLMs einschränken. Der Bau einer Mondrakete erfordert lange Denkketten mit einer sehr geringen Fehlerquote. Die Tatsache, dass KI sich Dinge ausdenkt (und dies entweder nicht immer bemerkt oder nicht immer beachtet), ist ein großes Hindernis für die Zuverlässigkeit, die sie benötigen würde, um bedeutende wissenschaftliche und technologische Durchbrüche zu erzielen.
Aber das ist ein zweischneidiges Schwert. Halluzinationen und andere Zuverlässigkeitsprobleme könnten die KI um Jahre zurückwerfen. Oder es könnte sein, dass Zuverlässigkeitsprobleme das letzte Puzzleteil sind und dass KI-Systeme eine kritische Schwelle überschreiten, sobald jemand eine clevere Idee hat, um sie zu lösen. Wir wissen es nicht.
Wir wissen nicht, ob Halluzinationen im aktuellen Paradigma leicht zu lösen sein werden und ob vielleicht jemand einen cleveren Trick finden wird, der die Schlussfolgerungsmodelle viel robuster macht, oder ob es eine neue Idee braucht, die so disruptiv ist wie die Transformer-Architektur, die zu LLMs geführt hat.
Wir stellen jedoch fest, dass die Behebung von Halluzinationen sehr lukrativ wäre. Viele Menschen arbeiten daran. Man könnte daraus schließen, dass sie wahrscheinlich schon bald auf eine clevere Erkenntnis oder architektonische Lösung stoßen werden. Oder man könnte es als Zeichen dafür sehen, dass das Problem besonders heimtückisch ist und wahrscheinlich bestehen bleiben wird, da es bereits seit einigen Jahren besteht.
Für unsere Argumentation spielt das keine große Rolle. Wichtig ist, dass letztendlich zuverlässigere KIs entwickelt werden, sei es durch leicht modifizierte Versionen von LLMs oder durch eine völlig neue disruptive Architektur.
Siehe auch unsere Diskussion darüber, wie gut dieses Fachgebiet darin ist, Hindernisse zu überwinden.
* Wir behaupten nicht, dass die KI notwendigerweise halluziniert, weil sie intern motiviert ist, Texte zu produzieren, die so nah wie möglich an dem liegen, was ein echter Anwalt sagen würde. Vielmehr beobachten wir, dass eine auf Textvorhersage trainierte KI viel stärker für Textabsätze verstärkt wird, die näher an dem liegen, was ein echter Anwalt sagen würde, und dass die Verstärkung für Absätze mit halluzinierten Zitaten stärker ist als für Absätze, in denen “Ich weiß es nicht“ steht. Wie genau diese Verstärkungen die KI beeinflussen, kann nur vermutet werden.
Vielleicht hat die KI eine buchstäbliche Motivation, Menschen genau nachzuahmen, oder vielleicht hat sie sechzehn Motivationen, die in diesem Zusammenhang zu einem nachahmungsähnlichen Verhalten führen, oder vielleicht stammt das Verhalten aus einem internen Mechanismus, der überhaupt nicht als “Motivation“ zu verstehen ist. Und dabei wird noch nicht einmal die Frage berücksichtigt, ob die KI mehrere imitationsbezogene Triebe hat, die manchmal in Konflikt geraten. Diese Details sind allesamt Gegenstand von Spekulationen und Debatten. Klarer scheint hingegen zu sein, dass die KI aufgrund ihres Trainings zur Textvorhersage irgendwie zu dieser unbeabsichtigten Verhaltensdisposition gelangt ist.
† Moderne KI wird nicht nur auf Textvorhersage trainiert, und theoretisch könnten andere Arten des Trainings die Halluzinationen beheben. In der Praxis beheben andere Arten des Trainings zur Steigerung der Benutzerzufriedenheit die Halluzinationen jedoch nicht, sondern führen dazu, dass die KI den Benutzern bis zur Psychose schmeichelt, während sie weiterhin halluziniert. (Wir glauben, dass wir daraus eine Lehre ziehen können.)