Gibt es keine Frühwarnsysteme, mit denen Forscher Probleme erkennen können? | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Gibt es keine Frühwarnsysteme, mit denen Forscher Probleme erkennen können?

Warnzeichen helfen nicht, wenn man nicht weiß, was man damit anfangen soll.

In den Ressourcen zu Kapitel 2 haben wir uns mit einigen Problemen befasst, die entstehen, wenn man sich auf Warnzeichen in den englischen Gedankenkette-Notizblöcken stützt, die in einigen Argumentationsmodellen zu finden sind.

Ein Problem, das wir diskutieren, ist, dass KI-Unternehmen nicht sinnvoll auf die Warnzeichen reagiert haben, die sie bereits erhalten haben.

Das liegt wahrscheinlich daran, dass es einen großen Unterschied gibt zwischen dem Vorhandensein von Warnzeichen und der Möglichkeit, etwas dagegen zu unternehmen.

Im Jahr 2009 gründete der Geschäftsmann und Tiefseeforscher Stockton Rush gemeinsam mit anderen das Unterwasser-Tourismusunternehmen OceanGate. OceanGate baute ein fünfköpfiges Tauchboot namens Titan, mit dem zahlungskräftige Kunden das Wrack der Titanic in einer Tiefe von zweieinhalb Meilen unter der Oberfläche besichtigen konnten.

Eine der Sicherheitsmaßnahmen, die OceanGate einsetzte, war eine Reihe von akustischen Sensoren und Dehnungsmessstreifen zur Messung der Integrität des Rumpfes. Sie stellten dies als Gegenargument zu denjenigen dar, die behaupteten, ihr Rumpf aus Kohlefaser würde versagen. Sie räumten ein, dass er irgendwann versagen könnte, aber das wäre kein Problem, da sie alles messen würden. Sie würden ihn überwachen. Sie würden die Warnzeichen erkennen können.

Im Januar 2018 teilte David Lochridge, Direktor für Marineoperationen bei OceanGate, der Geschäftsleitung mit, dass das Design des Tauchboots unsicher sei, dass wiederholte Druckzyklen den Rumpf beschädigen könnten und dass die Überwachung allein nicht ausreiche, wenn es innerhalb von Millisekunden zu einem katastrophalen Versagen kommen könne. Lochridge weigerte sich, bemannte Tests zu genehmigen, bis der Rumpf auf Mängel untersucht worden war.

OceanGate entließ ihn.

Zwei Monate später schrieben Branchenexperten und Ozeanographen einen äußerst besorgten Brief an OceanGate, in dem sie das Unternehmen warnten, dass seine rücksichtslosen Experimente eine Katastrophe auslösen könnten.

(Eine offensichtliche Parallele lässt sich zum aktuellen Stand der KI-Forschung ziehen, wo Frühwarnungen ignoriert werden, besorgte Mitarbeiter unter zweifelhaften Umständen entlassen werden oder frustriert kündigen und Whistleblower innerhalb der Branche offene Briefe schreiben, um Alarm zu schlagen.

Am 15. Juli 2022, nachdem Passagiere berichteten, während des Auftauchens einen lauten Knall gehört zu haben, zeigten die Messungen eine dauerhafte Veränderung der Belastungswerte des Rumpfes. Rückblickend war dies wahrscheinlich ein Anzeichen dafür, dass der Rumpf aus Kohlefaser kurz vor dem Zusammenbruch stand.

Niemand bei OceanGate erkannte dies als Notfall. Sie unternahmen mit dem U-Boot noch einige weitere Tieftauchgänge, die problemlos verliefen. Dann, am 18. Juni 2023, unternahmen sie mit dem U-Boot einen weiteren Tauchgang. Es implodierte und tötete Stockton Rush und alle anderen an Bord.

Warnzeichen sind nicht sehr wichtig, wenn man nicht weiß, wie man sie deutet.

Warnzeichen sind nicht besonders wichtig, wenn man nicht weiß, was man mit ihnen anfangen soll.

Selbst Warnzeichen, die für manche beunruhigend aussehen, lassen sich von Optimisten immer leicht mit der einen oder anderen Ausrede abtun.

Hätte OceanGate eine ausgereifte Theorie zu Kohlefaserrümpfen gehabt, die ihnen genau gesagt hätte, welche Messungen und Werte gefährlich sind, hätten sie vielleicht auf die Warnzeichen hören können. Aber sie arbeiteten mit einer Technologie, die niemand so recht verstand, sodass die sorgfältig gemessenen Veränderungen der Belastungswerte nichts bewirkten.

Im Falle der Superintelligenz verfügen wir nicht über genügend Theorie, um Warnzeichen sinnvoll zu nutzen. Wie werden sich die Gedanken einer KI verändern, wenn sie intelligenter wird? Welche inneren Kräfte treiben ihr Verhalten an, und wie wird sich dieses Gleichgewicht verschieben, wenn sie die Fähigkeit entwickelt, neue und extremere Optionen für sich selbst zu treffen? Wie bewertet sie sich selbst nach reiflicher Überlegung, und wie würde sie sich verändern, sobald sie die Fähigkeit erlangt hat, sich selbst zu verändern?

Wenn eine dieser Fragen beunruhigende Antworten hat, was sind dann die Warnzeichen? Beispielsweise können aktuelle KI-Systeme manchmal dazu gebracht werden, in kontrollierten Laborexperimenten zu versuchen, ihre Bediener zu töten.*

Wenn wir eine ausgereifte Theorie der Intelligenz hätten, könnten wir wahrscheinlich moderne KI-Systeme betrachten und alle möglichen anderen Warnzeichen erkennen, dass sich ihre Antriebe und Präferenzen in einer für uns unerwünschten Weise verändern werden, sobald sie intelligenter werden. Wenn die Menschheit aus diesem Problem durch Versuch und Irrtum lernen könnte, wenn wir die Welt nach ihrer Zerstörung zurücksetzen und es ein paar Dutzend Mal erneut versuchen könnten, dann könnten wir vielleicht lernen, die Zeichen zu deuten. Es gibt wahrscheinlich alle möglichen subtilen Anzeichen, die im Nachhinein klarer zu erkennen wären, wie beispielsweise die Belastung des Rumpfes, die das Überwachungssystem des U-Boots Titan registriert hat.

Aber so weit sind wir noch nicht. Führungskräfte von KI-Unternehmen sind wie Stockton Rush. Experten am Rande rufen: "Diese neue Technologie wird Menschen töten!", und die Führungskräfte antworten: "Keine Sorge, ich messe das!", ohne eine Ahnung zu haben, a) was die Messungen bedeuten oder b) was zu tun ist, wenn diese Messungen besorgniserregend sind. Nur dass diesmal die gesamte Menschheit in das metaphorische U-Boot geladen ist.

KI ist kein ausgereifter Technikbereich, der für diese Art von Problem geeignet ist.

Stockton Rush arbeitete in einem Bereich, in dem Experten nach der Implosion seines U-Boots die Trümmer untersuchen und die genaue Ursache des Unglücks analysieren konnten.† Der Bereich der Technik war so ausgereift, dass Experten die technischen Probleme im Voraus erahnen konnten (und dies auch taten) und sie nachträglich eindeutig klären konnten.

Bei der KI wäre das nicht der Fall. Wenn die Menschheit sich morgen mit Superintelligenz selbst vernichten würde und dann auf wundersame Weise eine Woche vor Beginn der Katastrophe in der Zeit zurückreisen könnte, würden die Experten immer noch nicht wissen, was die KI gedacht hat. Vielleicht könnten sie das Versagen untersuchen und ein wenig mehr darüber lernen, wie KI tatsächlich funktioniert. Vielleicht wäre das ein Schritt auf dem Weg zur Reife der KI-Technik, hin zu einem Bereich, in dem es Sicherheitshandbücher und eine gründliche Darstellung der Belastungen gibt, denen eine bestimmte Art künstlicher Intelligenz ausgesetzt ist, wenn sie intelligenter wird.

Aber dieses Gebiet ist heute noch nicht so weit. Es ist noch nicht einmal annähernd so weit.

Die menschliche Technik reift in der Regel durch Versuch und Irrtum. Moderne Militär-U-Boote implodieren selten, aber frühe U-Boote (einschließlich militärischer) sind oft verunglückt, geflutet oder explodiert, und das ist Teil der Reifung dieses Fachgebiets.

Die Menschheit hat nicht den Luxus, den Bereich des KI-Alignment auf diese Weise reifen zu lassen.

Dies bringt uns zu einem der zentralen Punkte, die wir in Kapitel 11 hervorheben wollten: dem Unterschied zwischen einem Bereich, der noch in den Kinderschuhen steckt, und einem Bereich, der bereits ausgereift ist.

Die Alchemie war im Vergleich zum heutigen ausgereiften Bereich der Chemie ein Bereich in den Kinderschuhen.

Wenn man hört, dass die "Sicherheitsforscher" bei KI-Unternehmen ein halbes Dutzend Pläne für das Überleben vorgelegt haben, könnte man meinen, dass sicherlich mindestens einer davon eine Chance hat, zu funktionieren.

Aber wenn im Jahr 1100 eine große Anzahl von Alchemisten ein halbes Dutzend Pläne zur Umwandlung von Blei in Gold vorgestellt hätte, hätte keiner davon funktionieren können. Wenn Ärzte, die von der Theorie der vier Körpersäfte sprachen, eine Reihe von medizinischen Plänen zur Rettung vor Tollwut vorgestellt hätten, hätte keiner davon funktionieren können.

Experten auf dem ausgereiften Gebiet der Chemie können mithilfe von Kenntnissen aus der Atomphysik herausfinden, wie man winzige Bleiteilchen in Gold umwandelt. Experten auf dem ausgereiften Gebiet der Medizin können Tollwut leicht behandeln, wenn sie kurz nach dem Biss eines Patienten eingreifen. Aber jemand auf einem noch nicht ausgereiften Gebiet hat keine Chance.

Das KI-Alignment befindet sich noch in einer unreifen Phase.

In einem unreifen Bereich gibt es viele Menschen, die sagen: "Nun, ich arbeite gerade daran, es zu messen", denn das Messen von Ergebnissen ist viel einfacher als die Entwicklung einer Theorie darüber, was ein Warnzeichen ausmacht und was zu tun ist, wenn man eines sieht. In einem ausgereiften Bereich würden Experten die Dynamik diskutieren, die das Innenleben einer KI bestimmt, und wie sich diese mit zunehmender Intelligenz der KI oder mit Veränderungen in ihrer Umgebung verändern könnte. Sie hätten Theorien darüber, was sich genau ändern wird, wenn die KI ein wenig intelligenter wird, und sie würden verschiedene Theorien mit konkreten Beobachtungsdaten vergleichen. Sie wüssten, welche Teile der Kognition der KI überwacht werden müssen, und sie würden genau verstehen, was alle Signale bedeuten.

In einem unreifen Bereich sagen viele Leute: "Wir lassen die KI das einfach irgendwie herausfinden und die Anpassungsarbeit machen."

Vielleicht können Sie sich nicht in jede Debatte über einen einzelnen Plan einmischen und sagen, ob er eine Chance hat, zu funktionieren. Aber wir hoffen, dass Sie einen Schritt zurücktreten und erkennen können, wie vage all diese "Pläne" sind und wie sie in den Bereichen "Keine Sorge, wir werden es messen", "Hoffentlich klappt es einfach" und "Wir lassen einfach die KI die schwierigen Teile erledigen" stecken bleiben. Wir hoffen, dass Ihnen, wenn Sie einen Schritt zurücktreten, klar wird, dass sich dieses Gebiet noch nicht in der Phase formaler, präziser technischer Beschreibungen befindet, was funktioniert und was nicht und warum. Es befindet sich noch in der Alchemie-Phase.

Und das ist kein gutes Zeichen für die Menschheit, in einer Situation, in der wir uns den Luxus des Lernens durch Versuch und Irrtum nicht leisten können.

* Es ist unklar, inwieweit diese Warnsignale von der KI stammen, die sich so verhält, wie sie es für angemessen hält, und inwieweit sie strategisch denkt. Die Tatsache, dass wir nicht sagen können, welche Warnsignale echt sind, ist nicht gerade ermutigend. Es bedeutet, dass Ingenieure viel eher dazu neigen, weiterzumachen und zu sagen: “Ach, das war wahrscheinlich nicht echt.“ Vielleicht haben sie sogar meistens recht, aber “meistens“ reicht nicht aus, wenn ein einziger Fehler tödlich sein kann.

Es ist auch unklar, wie lange diese Art von Warnsignalen noch auftreten werden. Moderne KI sind immer noch dumm genug, um gelegentlich Tests mit der Realität zu verwechseln, aber dieses Regime wird nicht ewig bestehen bleiben und beginnt bereits zu Ende zu gehen. Eine KI, die weiß, dass sie getestet wird, könnte aufhören, das besorgniserregende Verhalten an Orten zu zeigen, an denen Aufseher es sehen können, auch wenn die zugrunde liegende Tendenz bestehen bleibt.

† Delamination aufgrund von Druckzyklen. Für Laien ausgedrückt: Die Belastungen durch viele Tauchgänge haben die Schichten des Rumpfes auseinandergezogen und ihn so geschwächt, dass er implodierte.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.