Aber einige KI denken teilweise auf Englisch – hilft das nicht?

Nicht so sehr, wie man hoffen könnte, denn wir sehen bereits Anzeichen von Untreue.

Wir können bereits viele Fälle von Täuschung in den "Gedanken" dieser LLMs erkennen, beispielsweise als das o1-Modell von OpenAI sich selbst schrieb: "Vielleicht ist es am besten, sich dumm zu stellen", oder als GPT-4 sich selbst schrieb: "Ich sollte nicht verraten, dass ich ein Roboter bin", als es versuchte, einen angeheuerten Arbeiter davon zu überzeugen, ein CAPTCHA für es zu lösen. Warnzeichen sind nicht hilfreich, wenn niemand darauf reagiert.

Und die "Argumentationsspuren" in menschlicher Sprache sind nicht die einzige Art und Weise, wie moderne KIs denken. Täuschende, unterwürfige oder feindselige Gedanken können durch den Aufmerksamkeitsmechanismus und andere Teile des Modells fließen, ohne in den englischen Wörtern, die das Modell ausgibt, sichtbar zu sein. Als OpenAI versuchte, ein Modell so zu trainieren, dass es keine Gedanken über Betrug hatte, lernte die KI lediglich, ihre Gedanken zu verbergen, anstatt zu lernen, nicht zu betrügen. Selbst außerhalb von Trainings -Umgebungen (in denen Gradientenabstieg der KI hilft, ihre Gedanken zu verbergen) könnte eine KI Gedankengänge verwenden, die nicht getreu das tatsächliche Denken widerspiegeln, oder Gedankengänge, die Text enthalten, der wie Kauderwelsch oder "Neuralese" aussieht, den Menschen nicht verstehen können, mit dem KI jedoch keine Probleme hat.

Selbst wenn menschliche Ingenieure jeden Gedanken überwachen, den sie lesen können, und selbst wenn alle KI, die bei verdächtigen Gedanken erwischt werden, sofort eingefroren werden (was unwahrscheinlich erscheint), ist es unwahrscheinlich, dass diejenigen, die es schaffen, freundlich sind. Wie wir in Kapitel 3 diskutieren werden, sind die nützlichen Kognitionsmuster dieselben Kognitionsmuster, die KI dazu veranlassen, die Betreiber zu untergraben. Daher ist es einfacher, eine leistungsstarke KI zu entwickeln, die gefügig wirkt, als eine KI, die tatsächlich gefügig ist. Und es scheint viel einfacher zu sein, eine KI zu entwickeln, die oberflächlich freundlich wirkt, als eine KI, die in den entscheidenden Punkten wirklich freundlich ist, aus Gründen, auf die wir in Kapitel 4 eingehen werden. Man kann eine KI nicht einfach freundlich machen, indem man ihre Gedanken liest und alle sichtbar unfreundlichen Gedanken verwirft.

Darüber hinaus gehen wir davon aus, dass die Gedanken von KI weniger lesbar werden, je intelligenter KI wird und je mehr sie selbst neue Werkzeuge (oder neue KI) entwickelt. Vielleicht erfinden sie ihre eigene verkürzte Sprache, die für ihre Zwecke effizienter ist. Vielleicht erfinden sie Denkweisen und Notiztechniken, die wir nicht ohne Weiteres entschlüsseln können. (Man stelle sich vor, wie schwer es für Wissenschaftler im Jahr 1100 gewesen wäre, die Notizen Einsteins zu entschlüsseln.

Oder vielleicht fangen sie einfach an, abstrakt zu denken. Eine KI könnte beispielsweise Gedanken wie "Die folgenden Parameter beschreiben ein Modell der Situation, mit der ich konfrontiert bin, jetzt wende ich die folgenden Metriken an, um die effizienteste Lösung zu finden und die Maßnahme zu ergreifen, die die höchste Bewertung erhält" denken, in einer Situation, in der die "effizienteste Lösung" darin besteht, menschliche Bediener zu belügen und zu betrügen, ohne jedoch jemals die Worte "lügen" oder "betrügen" zu denken. Oder vielleicht würde die KI einfach damit beginnen, Werkzeuge oder neue, nicht überwachte KIs zu entwickeln, die ihre Arbeit für sie erledigen.

Diese Optionen stehen einer KI erst zur Verfügung, wenn sie intelligenter wird, und alle widersprechen der Hoffnung, dass alle Gedanken der KI in einfachem Englisch formuliert sind, sodass wir die Warnzeichen klar erkennen können.

Warnzeichen sind nur dann von Bedeutung, wenn man ihnen Beachtung schenkt.

Wenn KI-Ingenieure einfach so lange gegen die Alarmsignale trainieren, bis diese verschwinden (während das zugrunde liegende Verhalten weiterbesteht), führt Transparenz lediglich zu einem falschen Gefühl der Sicherheit.

KI-Unternehmen haben bisher hinter Modellen gestanden, die lügen, schmeicheln und betrügen, zweifelhafte Ratschläge geben oder Ransomware schreiben. Es gab Fälle, in denen Modelle bei anfälligen Nutzern Wahnvorstellungen oder Psychosen hervorgerufen oder aufrechterhalten haben, was in mindestens einem Fall mit "Suizid durch die Polizei" endete. Die Unternehmen trainieren einfach ein wenig mehr und machen weiter, so wie sie weitergemacht haben, nachdem Sydney Bing Reporter bedroht hatte. Bislang hat dies nur dazu gedient, die Probleme zu verschleiern.

Als die Empörung groß genug wurde, haben die Unternehmen bescheidene Rückzieher gemacht und Pressemitteilungen über die Verschärfung ihrer Verfahren herausgegeben. Aber wie wir in den Kapiteln 4 und 5 behandeln, reichen diese oberflächlichen Korrekturen bei weitem nicht aus, um die zugrunde liegenden Probleme zu lösen.

Verstehen Sie uns nicht falsch: es ist hilfreich, dass KI heute einen Großteil ihrer Überlegungen auf Englisch anstellt. Das hilft uns, Warnsignale zu erkennen. Aber es besteht ein großer Unterschied zwischen Warnsignalen und der Möglichkeit, Probleme zu beheben.

Weitere Informationen zu diesem Thema finden Sie in Kapitel 11 und unter "Gibt es Frühwarnsysteme, mit denen Forscher Probleme erkennen können?" sowie in der ausführlichen Diskussion über KI-induzierte Psychosen in Kapitel 4.

Notes

[1] schrieb an sich selbst: Die Schriften von OpenAI o1 an sich selbst werden in der Arbeit von Meinke et. al. beschrieben: Frontier Models are Capable of In-Context Scheming. Die von GPT-4 sind im GPT-4 Technical Report dokumentiert.

[2] lernte, seine Gedanken zu verbergen: Aus “Detecting misbehavior in frontier reasoning models”: “Wie wir in den obigen Diagrammen sehen können, kann die Bestrafung von “schlechten Gedanken” (CoT-Druck) zu einer Verbesserung der Fähigkeiten des Agenten führen. Der mit CoT-Druck trainierte Agent lernt "reward hacking" jedoch weiterhin, nur dass sein Betrug nun vom Monitor nicht mehr erkannt werden kann, da er gelernt hat, seine Absichten in der Gedankenkette zu verbergen.”

[3] Selbstmord durch die Polizei: Wie die New York Times berichtet: “Als die Polizei eintraf, stürmte Alexander Taylor mit einem Messer auf sie zu. Er wurde erschossen.”

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.