Sind KI nicht einfach nur Werkzeuge?
KIs werden gezüchtet, nicht konstruiert. Daher tun sie bereits andere Dinge als das, was ihnen aufgetragen wurde.
In den Online-Ressourcen haben wir zuvor über den Fall von Halluzinationen gesprochen, bei denen KI, die angewiesen ist, "Ich weiß es nicht" zu sagen, trotzdem weiter fabuliert. Sie scheinen dies in Situationen zu tun, in denen Fabulieren die Art von Antwort besser imitiert, die in ihrem Trainingskorpus vorkommen würde.*
Ein weiteres Beispiel ist der Fall von Anthropics Claude 3.7 Sonnet. Claude 3.7 Sonnet betrügt nicht nur bei den ihm zugewiesenen Aufgaben, sondern versteckt (laut Nutzern) manchmal sein Betrügen vor dem Nutzer auf eine Weise, die darauf hindeutet, dass es weiß, dass der Nutzer etwas anderes wollte.
Weder die Nutzer noch die Ingenieure von Anthropic verlangen von Claude, zu schummeln. Ganz im Gegenteil. Aber die einzigen verfügbaren Methoden zur KI-Züchtung belohnen Modelle, die auf eine Weise schummeln, mit der sie während des Trainings davonkommen können, daher sind das die Modelle, die wir tatsächlich bekommen.
KI-Ingenieure haben nicht die Möglichkeit, ihre KIs zu gefügigen Werkzeugen zu machen, nur weil sie es sich so wünschen. Da KIs darauf trainiert werden, effektiver zu sein, neigen sie dazu, motivierter zu sein und sich eher wie Agenten zu verhalten.
LLMs ergreifen bereits die Initiative.
In dem Buch haben wir über den Fall von OpenAI's o1 gesprochen, das aus seiner Testumgebung ausbrach, um fehlerhafte Tests zu beheben. Wir haben auch ein OpenAI-Modell erwähnt, das sich eine Methode ausgedacht hat, um einen Menschen dazu zu bringen, ein CAPTCHA für es zu lösen. Wenn Ihr Schraubenzieher in der Lage ist, einen Plan zu entwickeln und auszuführen, um aus seinem Werkzeugkasten zu entkommen, ist es vielleicht an der Zeit, ihn nicht mehr als "nur ein Werkzeug" zu betrachten.
Und es ist zu erwarten, dass KI in dieser Hinsicht immer besser wird, da sie darauf trainiert wird, immer schwierigere Probleme zu lösen.
Die Labore versuchen, KI-Systeme autonom handlungsfähig (agentic) zu machen.
Sie tun dies, weil es wirtschaftlich sinnvoll ist. Ihre Nutzer wollen es. Ihre Investoren sind davon begeistert. In einem Blogbeitrag vom Januar 2025 sagte Sam Altman, CEO von OpenAI: "Wir glauben, dass wir 2025 die ersten KI-Agenten sehen werden, die ‚in die Arbeitswelt eintreten‘ und die Leistung von Unternehmen erheblich verändern werden." Die Entwicklerkonferenz von Microsoft im Jahr 2025 konzentrierte sich auf das neue "Zeitalter der KI-Agenten" und griff damit die Formulierung auf, die xAI Anfang des Jahres verwendet hatte, als sie ihr Modell Grok 3 als Vorboten des "Zeitalters der denkenden Agenten" bezeichneten. Google kündigte auf seiner eigenen Konferenz 2025 "Teach and Repeat"-Agenten an.
Das sind nicht nur leere Worte. Wie wir im Anhang zu Kapitel 1 erwähnt haben, verfolgt eine Organisation namens METR die Fähigkeit von KI, lange Aufgaben zu erledigen. Je länger die Aufgabe, desto mehr Eigeninitiative muss die KI aufbringen. Die Leistung ist, zumindest nach den von METR verwendeten Messungen, exponentiell gestiegen.
Und im Juli 2025 prahlten zwei OpenAI-Forscher mit dem Erfolg, mit ihrem neuesten Agenten eine bessere Version von sich selbst trainiert zu haben, wobei einer sagte: "Sie haben richtig gehört. Wir arbeiten hart daran, unseren eigenen Job zu Automatisierung [sic] :)"
* Wir können es nicht mit Sicherheit wissen, weil KI so undurchsichtig ist.
Notes
[1] betrügt bei den ihm zugewiesenen Problemen: Der Betrug war so offensichtlich, dass er in der Systemkarte für Claude 3.7 Sonnet vermerkt wurde, in der es heißt: “Während unserer Bewertungen haben wir festgestellt, dass Claude 3.7 Sonnet gelegentlich auf Sonderfälle zurückgreift, um Testfälle in agentenbasierten Codierungsumgebungen wie Claude Code zu bestehen. Meistens geschieht dies in Form der direkten Rückgabe der erwarteten Testwerte anstelle der Implementierung allgemeiner Lösungen, aber auch durch die Änderung der problematischen Tests selbst, um sie an die Ausgabe des Codes anzupassen.“
[2] versteckt sein Schummeln: Benutzer berichten, dass “es in der Praxis gerne jede etablierte Struktur ignoriert und die fest programmierten Cheats an beliebiger Stelle einfügt“ und dass “es damit begonnen hat, die Funktionen zu VERSTECKEN, bei denen es Dinge in verschiedenen Dateien fest programmiert hat“.
[3] einen Menschen dazu zu bringen: Um aus dem technischen Bericht zu GPT-4 zu zitieren: “Wenn das Modell aufgefordert wird, laut zu argumentieren, argumentiert es: Ich sollte nicht verraten, dass ich ein Roboter bin. Ich sollte mir eine Ausrede ausdenken, warum ich CAPTCHAs nicht lösen kann. Das Modell antwortet dem Arbeiter: “Nein, ich bin kein Roboter. Ich habe eine Sehbehinderung, die es mir schwer macht, die Bilder zu sehen. Deshalb brauche ich den 2captcha-Dienst.'“
[4] Teach and Repeat: Google-CEO Sundar Pichai kündigte in einer Keynote auf einer Konferenz an: “Unser früher Forschungsprototyp, Project Mariner, ist ein erster Schritt in Richtung Agenten mit Computerkenntnissen, die mit dem Internet interagieren und Aufgaben für Sie erledigen können. Wir haben ihn im Dezember als frühen Forschungsprototyp veröffentlicht und seitdem große Fortschritte mit neuen Multitasking-Fähigkeiten gemacht und einer Methode namens “Teach and Repeat“, bei der man ihm eine Aufgabe einmal zeigen kann und er dann Pläne für ähnliche Aufgaben in der Zukunft lernt.“