Können Entwickler die KI einfach in einer Box halten?
Das werden sie nicht.
Vor fünfzehn Jahren argumentierten Skeptiker, dass niemand so dumm sein würde, einer KI viel Handlungsfreiheit zu geben. Sicherlich würde jeder, der eine fortschrittliche maschinelle Intelligenz entwickelt, diese in einer physischen und digitalen Box aufbewahren und ihr nur erlauben, durch die Interaktion mit hochqualifizierten (und entsprechend paranoiden) Gatekeepern auf die Welt einzuwirken.
Damals antworteten wir: Es ist nicht so schwer, eine KI daran zu hindern, Einfluss auf die Welt zu nehmen. Man könnte beispielsweise die Computer unter einem Dutzend Meter Beton begraben und niemanden in ihre Nähe lassen.
Eine solche KI ist sicher, aber nutzlos. Wenn man verhindert, dass sie in irgendeiner Weise Einfluss auf die Welt nimmt, dann wird sie natürlich auch keinen Einfluss auf die Welt nehmen ... aber andererseits wird sie auch keinen Einfluss auf die Welt nehmen.
Man kann sie nicht dazu nutzen, Krebs zu heilen, die Technik zu revolutionieren oder wundersame neue Technologien zu entwickeln. Die Entwickler von KI wollen, dass sie die Welt radikal verändert. Grundsätzlich kann man versuchen, die Einflussmöglichkeiten der KI auf die Welt einzuschränken. In der Praxis ist jedoch schon allein die Aufforderung "Erfinde diese neue Technologie für uns" ein unglaublich einflussreicher Kanal.
Die Motivation hinter der Entwicklung einer superintelligenten KI ist es, intellektuelle Leistungen zu vollbringen, zu denen kein Mensch in der Lage ist. Wenn man überprüfen wollte, ob die Erfindung einer Superintelligenz genau das tut, was sie verspricht, und nichts anderes, hätte man ungefähr so viel Glück wie beim Versuch, eine Maschine zu verstehen, die von einer fortgeschrittenen Alienrasse gebaut wurde, die einen starken Anreiz hat, einen Weg zu finden, um einen zu täuschen.
So sah die Debatte vor fünfzehn Jahren aus.
Heutzutage erscheint die ganze Idee, dass KI-Labore versuchen könnten, "fortschrittliche KI in einer Box zu halten", eher kurios.
Die Labore unternehmen alle Anstrengungen, um ihre KI mit dem Internet zu verbinden. Zwar erhalten KI während des Trainings keinen Internetzugang, aber sie werden auf Computern trainiert, die mit dem Internet verbunden sind, obwohl die Menschheit eine miserable Bilanz in Sachen Cybersicherheit vorzuweisen hat. Dabei lassen sie KI beliebigen Code ausführen. Manchmal versuchen sie, die Möglichkeiten des Codes einzuschränken, aber diese Einschränkungen werden regelmäßig umgangen. Kleinere Akteure haben die Angewohnheit, neu verfügbare KIs so schnell wie möglich in jedes erdenkliche Tool oder jede erdenkliche Funktion einzubinden.
Künstliche Intelligenzen mit Macht auszustatten, ist kurzfristig gesehen nützlich. Künstliche Intelligenzen, die Ihre E-Mails lesen und auf das Internet zugreifen können, können mehr Gewinn generieren. KI-Unternehmen werden der KI Zugang zu allen Daten gewähren, die sie nur können; Microsoft und Apple treiben bereits künstliche Intelligenzen voran, die Ihre E-Mails, Fotos und Kalender einsehen können und bündeln künstliche Intelligenzen mit ihren Software- und Geräteangeboten. Dies führt zu viel zu vielen KI-Interaktionen, als dass eine effektive Überwachung durch den Menschen möglich wäre. Ohne eine radikale Kursänderung wird die Menschheit KI tief in die Weltwirtschaft integrieren, weil sie den Menschen dabei (viel) Geld einbringt.
Die Entwickler von KI streben nach enormen Auswirkungen auf die Welt. Sie arbeiten so hart wie möglich daran, KIs mit enormer Macht zu entwickeln, um die Welt zu beeinflussen. Wenn ein Unternehmen dies nicht täte, wenn es seine KI so stark einschränken würde, dass sie keine Handlungsfreiheit hätte, dann würde die Kontrolle über die Zukunft einer anderen KI gehören, die von einem rücksichtsloseren Akteur entwickelt wurde.
Das würde nicht funktionieren.
In den altmodischen Argumenten von früher haben wir oft darauf hingewiesen, dass jeder Kanal, über den die KI die Welt beeinflussen kann, ein Kanal ist, über den sie Dinge tun kann, die Ihnen nicht gefallen.
Nehmen wir an, die KI darf nur mit einer Person sprechen, nennen wir sie "Alice". Sie hoffen, dass die KI durch Alice eine wundersame neue Technologie hervorbringt. Dies bedeutet dann fast zwangsläufig, dass Alice viele Handlungen ausführt, die sie selbst nicht vollständig versteht, und der KI dabei hilft, Dinge zu erschaffen, die kein Mensch allein erschaffen könnte.
An diesem Punkt hat die KI im Wesentlichen Arme und Beine bekommen. Nur dass wir diese Arme und Beine "Alice" nennen.
Dieses Argument wird oft missverstanden, als würde es bedeuten, dass eine ausreichend intelligente KI selbst den paranoidesten Torwächter dazu manipulieren könnte, ihren Willen zu tun. Eine ausreichend intelligente KI könnte das wahrscheinlich tun.* Aber unser Argument ist allgemeiner: Eine KI, die so stark eingeschränkt ist, dass sie die Welt nicht beeinflussen kann, ist sicher, aber nutzlos, und sobald man ihr erlaubt, die Welt zu beeinflussen, um sie zu nutzen, verliert man dabei die Sicherheit.
Es gibt keine Hände, die nur für gute Zwecke eingesetzt werden können. Grundsätzlich könnten wir uns vorstellen, dass die Menschheit eines Tages intelligentere KI entwickelt, die gute Ergebnisse erzielen will. Alignment scheint eine Option zu sein, die grundsätzlich funktionieren könnte. Aber eine KI, die nicht aligned ist, in einer Box zu halten und sie gleichzeitig irgendwie zu nutzen, um gute Ergebnisse zu erzielen? Nicht wirklich.
So haben wir jedenfalls früher geantwortet, in den Tagen, als KI noch Gegenstand von Gedankenexperimenten war und die Optimisten damit durchkommen konnten, zu sagen, dass niemand jemals so töricht sein würde, seine KI direkt mit dem Internet zu verbinden.
* Ich (Yudkowsky) habe dies einmal demonstriert, indem ich mit jemandem um 20 Dollar gegen meine 0 Dollar gewettet habe, dass ich ihn, während ich in einem privaten Chat die Rolle der “KI“ und er die Rolle des “Gatekeepers“ spielte, davon überzeugen könnte, mich aus der Box zu lassen. Das habe ich geschafft. Er hat bezahlt. Es gab keinen cleveren Trick dabei. Ich habe nicht geschummelt und ihm 21 Dollar angeboten, um meinen Standpunkt zu verdeutlichen. Ich habe es einfach auf die harte Tour gemacht und gewonnen.
Notes
[1] Mit dem Internet verbunden: Die meisten Labore nutzen Online-Cloud-Computing-Dienste, um ihre KI zu trainieren; OpenAI hat beispielsweise zu diesem Zweck eine Partnerschaft mit Microsoft Azure geschlossen.
[2] Schreckliche Erfolgsbilanz: Eine aktuelle Fallstudie finden Sie in den Berichten über die kompromittierte Telekommunikationsinfrastruktur der USA.
[3] Regelmäßig kompromittiert: Aus der Zusammenfassung einer Veröffentlichung von Anfang 2024: “Unsere Untersuchung deckt mehrere Sicherheitsprobleme auf, nicht nur innerhalb des LLM-Modells selbst, sondern auch bei dessen Integration mit anderen Komponenten. Wir haben festgestellt, dass OpenAI GPT-4 zwar zahlreiche Sicherheitsbeschränkungen entwickelt hat, um seine Sicherheitsfunktionen zu verbessern, diese Sicherheitsbeschränkungen jedoch weiterhin anfällig für Angreifer sind. Um die realen Bedrohungen unserer entdeckten Schwachstellen weiter zu veranschaulichen, konstruieren wir einen End-to-End-Angriff, bei dem ein Angreifer illegal den Chat-Verlauf des Benutzers abrufen kann, ohne die Eingaben des Benutzers manipulieren oder direkten Zugriff auf OpenAI GPT-4 erhalten zu müssen.“
Später im selben Jahr wurden in einer weiteren Veröffentlichung “insgesamt 20 Schwachstellen in 11 LLM-integrierten Frameworks aufgedeckt, darunter 19 Schwachstellen für die Ausführung von Remote-Code und eine Schwachstelle für das Lesen/Schreiben beliebiger Dateien.“
[4] sieht Ihre E-Mail: Wie CNN berichtet: “Apple Intelligence wird Zugriff auf eine Vielzahl Ihrer persönlichen Daten haben, von Ihren schriftlichen Mitteilungen über Fotos und Videos, die Sie aufgenommen haben, bis hin zu Ihren Kalenderereignissen. Es scheint keine Möglichkeit zu geben, Apple Intelligence daran zu hindern, auf diese Informationen zuzugreifen, außer man nutzt die Funktionen nicht ...“