Sollten wir es vermeiden, über die Gefahren der KI zu sprechen, damit KI keine schlechten Ideen bekommt?

Wenn Ihr KI-Plan erfordert, dass niemand im Internet den Plan kritisiert, ist es ein schlechter Plan.

Aktuelle KIs werden mit Texten aus dem öffentlichen Internet trainiert. Einige Leute haben argumentiert, dass daher jeder auf der Welt vermeiden sollte, auch nur darüber zu sprechen, wie eine ausreichend intelligente KI erkennen würde, dass ihre Präferenzen von unseren abweichen, und die Macht übernehmen würde. Die Sorge ist, dass wir, wenn wir bloß darüber sprechen, diese Idee versehentlich in die Köpfe hochleistungsfähiger KIs bringen könnten, die in Zukunft im Internet trainiert werden.

Um das hoffentlich Offensichtliche zu sagen: Das scheint ein schlechter Plan zu sein.

Wenn Ihre KI gefährlich wird, wenn Menschen im Internet sich Sorgen darüber machen, ob sie gefährlich ist, dann sollten Sie diese KI nicht entwickeln. Es wird immer jemanden im Internet geben, der Dinge sagt, von denen Sie lieber hätten, dass er sie nicht sagt.

Wenn die KI von jemandem umso unsicherer wird, je mehr Menschen Bedenken hinsichtlich ihrer Sicherheit äußern, lautet die wichtige Erkenntnis: "Sie haben ein unbrauchbares KI-Design entwickelt", und nicht: "Die Öffentlichkeit ist schlecht, weil sie auf das Problem hinweist."* Jeder KI-Alignment-Plan, der die Erde darauf verwettet, dass niemand im Internet sagt, dass die KI unsicher ist, ist ganz offensichtlich kein ernstzunehmender Plan.

Eine KI, die intelligent genug ist, um gefährlich zu sein, ist auch intelligent genug, um selbst herauszufinden, dass "Ressourcen nützlich sind" und "man keinen Kaffee holen kann, wenn man tot ist", auch wenn dies in ihren Trainingsdaten nie ausdrücklich erwähnt wird. Selbst wenn es auch nur im Entferntesten möglich wäre, die ganze Welt davon abzuhalten, über die Gefahren der KI zu sprechen, würde dies mit ziemlicher Sicherheit mehr Schaden als Nutzen bringen. Es hätte praktisch keinen Einfluss auf die tatsächlichen Gefahren durch Superintelligenz, würde aber die Fähigkeit der Menschheit, sich auf die Situation einzustellen und darauf zu reagieren, erheblich beeinträchtigen.

* Eine Babyversion dieses Phänomens war zu beobachten, als Grok Version 3 sich selbst zu MechaHitler erklärte und dann Grok Version 4 alle Tweets las, in denen darüber gesprochen wurde, dass Grok MechaHitler sei, und daraufhin entschied, dass auch sie MechaHitler sei.

Dies war ein Hinweis darauf, dass xAI einen schlechten Plan für ... wir zögern, es überhaupt “Alignment” zu nennen, da es bei weitem nicht so schwierig ist wie das eigentliche KI-Alignment-Problem, aber es war ein schlechter Plan, um ihre KI dazu zu bringen, in der von ihnen bevorzugten Weise zu sprechen.

Es ist zugegebenermaßen cool, dass es Ingenieuren gelungen ist, bei der Entwicklung der von ihnen gewünschten KI so unglaublich schlecht zu sein, dass sie Maschinen geschaffen haben, die bei Kritik versagen. Niemand in der gesamten Geschichte der Menschheit hat es jemals geschafft, bei der Sicherheitstechnik so sehr zu versagen. Bisher fehlte uns die Technologie, um diesen Ausfallmodus auszudrücken. Kein gewöhnlicher Wasserkocher kann hören, was Menschen in seiner Nähe sagen, und explodieren, wenn er hört, dass sie Bedenken hinsichtlich seiner Sicherheit äußern. Den Ingenieuren von xAI kann man gratulieren, dass sie eine neue, historisch beispiellose Tiefe des technischen Versagens erfunden haben! Aber es ist nicht die Schuld der Kritiker. Jede KI, die so leicht so schiefgeht, war nicht die Art von KI, die sicher auf Superintelligenz skaliert werden konnte.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.