Sehen Sie Alignment als eine Frage von "alles oder nichts"? | If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würde | If Anyone Builds It, Everyone Dies

Sehen Sie Alignment als eine Frage von "alles oder nichts"?

Nein. Aber ein "teilweises Alignment" dürfte dennoch katastrophale Folgen haben.

Eines der Argumente, sich weniger Sorgen um Superintelligenz zu machen, lautet in etwa: "KI wird sich wahrscheinlich schrittweise weiterentwickeln, sodass durch Trial-and-Error-Verbesserungen die KI bei jedem Schritt unter Kontrolle gehalten werden kann. Das Alignment muss nicht perfekt sein, damit alles gut läuft." Wir halten diese Ansicht aus mehreren Gründen für wenig hoffnungsvoll:

  • Unsere Bedenken hängen nicht davon ab, ob der Fortschritt schnell oder langsam ist. Wir sind uns nicht sicher, ob KI auf dem Weg zur Superintelligenz an verschiedenen Punkten stagnieren wird. Das scheint eher eine schwierige als eine einfache Entscheidung zu sein. Unsere beste Vermutung ist, dass maschinelle Intelligenz Schwellenwerteffekten unterliegt, aber letztendlich ist dies nur eine Vermutung, und unsere Argumente hängen nicht davon ab. Die Geschichte "Sable" in Teil II von If Anyone Builds It, Everyone Dies: Warum eine superintelligente KI uns alle vernichten würdeschildert absichtlich eine Katastrophe, die durch KI verursacht wird, die nicht weit über die Fähigkeiten des Menschen hinausgeht, um unter anderem zu vermitteln, dass ein KI-Gegner nicht schnell superintelligent werden muss, um außerordentlich gefährlich zu sein.
  • Unsere grundlegende Antwort auf die Frage "Was wäre, wenn wir Glück hätten und viel Zeit hätten, um Alignment-Ideen an schwachen KIs auszuprobieren, bevor KIs sehr leistungsfähig werden?" finden Sie in Kapitel 10 und der dazugehörigen ausführlichen Diskussion "Ein genauerer Blick auf vorher und nachher". Forscher können alle möglichen Details über schwache KIs herausfinden, aber es gibt unvermeidlich eine große Anzahl kritischer Unterschiede zwischen KIs, die schwach genug sind, um sicher untersucht zu werden, und den ersten KIs, die leistungsfähig genug sind, um einen Punkt ohne Wiederkehr zu erreichen. Selbst in einem ausgereiften Bereich wäre es sehr schwierig, all diese Unterschiede angemessen und rechtzeitig im Voraus zu berücksichtigen. In einem Bereich, der sich noch in der Alchemie-Phase befindet und in dem mit undurchschaubaren KIs gearbeitet wird (die eher gezüchtet als geschaffen sind), ist diese Hoffnung völlig unrealistisch.
  • Das Alignment der KI muss nicht perfekt sein, um langfristig hervorragende Ergebnisse zu erzielen. Grundsätzlich ist es möglich, eine KI mit einer gewissen Fehlertoleranz sorgfältig zu entwickeln, wenn man weiß, was man tut.* Das bedeutet jedoch nicht, dass "teilweise alignete" oder sogar "größtenteils alignete" KIs teilweise oder größtenteils akzeptable Ergebnisse liefern würden. Es gibt viele verschiedene Möglichkeiten und Gründe, warum eine KI in 95 Prozent der Fälle in der Gegenwart oder nahen Zukunft gut handeln könnte, ohne dass dies zu einem Happy End für die Menschheit führt, wie in den Online-Ressourcen zu Kapitel 5 aus vielen verschiedenen Blickwinkeln diskutiert wird. Von besonderer Relevanz ist "Werden sich KIs nicht zumindest ein wenig um Menschen kümmern?"

* Eine Diskussion darüber, warum man wirklich wissen muss, was man tut, finden Sie unter Intelligent (Usually) Implies Incorrigible, Deep Machinery of Steering und It’s Hard to Get Robust Laziness.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.