Der Weg zum Wollen

Warum ist Wollen eine effektive Vorgehensweise? Warum ist es erfolgreich? Warum stößt die Black-Box-Optimierung durch natürliche Selektion immer wieder auf diesen Trick?

Wir betrachten "willensähnliches" Verhalten als integralen Bestandteil einer erfolgreichen Steuerung der Welt. Das gilt nicht nur für intelligente Wesen wie Menschen oder KI, sondern auch für viel dümmere Wesen wie Amöben und Thermostate. Um diese Sichtweise genauer zu untersuchen, wollen wir einige der einfachsten Mechanismen betrachten, die die einfachste Form von "willensähnlichem Verhalten" aufweisen.

Beginnen wir mit Steinen. Steine zeigen eigentlich kein Verhalten, das wir für unsere Diskussion als "willensähnlich" bezeichnen würden. Manchmal rollt ein Stein einen Hügel hinunter, und ein Physiker würde Ihnen beiläufig sagen, dass der Stein unter der Wirkung der Schwerkraft "näher an den Mittelpunkt der Erde heranwollen" würde. Aber diese Art von Tendenz (in einem Gravitationsfeld zu fallen) ist nicht wirklich das, was wir unter "willensähnlichem" Verhalten verstehen.

Wenn Sie ein Objekt sehen würden, das einen Berg hinunterrollt, dabei immer wieder auf hochgelegene Schluchten trifft und ständig seinen Kurs ändert, um nicht in den Schluchten stecken zu bleiben, damit es den Weg bis ganz nach unten schafft, dann würden wir sagen, dass sich das Objekt so verhält, als "wolle" es sich auf einer niedrigeren Höhe befinden. Aber dieses "willensähnliche" Verhalten, von dem wir sprechen, beinhaltet eine robuste und dynamische Steuerung zu einem bestimmten Ziel, und Steine tun das nicht wirklich.

Einer der einfachsten Mechanismen, der etwas tut, was wir als "willensähnlich" bezeichnen würden, ist der bescheidene Thermostat. Ein Hausthermostat misst die Temperatur, schaltet die Heizung ein, wenn die Messung unter 21 Grad fällt, und schaltet die Klimaanlage ein, wenn die Messung über 23 Grad steigt. Wenn also sowohl das Messgerät als auch die Klimaanlage korrekt funktionieren, beschränkt ein Thermostat die Realität auf den Bereich möglicher Ergebnisse, in dem die Temperatur im Haus zwischen 21 Grad und 23 Grad bleibt.

Der einfachste Thermostat muss die aktuelle Temperatur im Haus nicht explizit numerisch anzeigen. Man nehme beispielsweise ein Bimetall-Thermometer (zwei dünne Streifen aus unterschiedlichen Metallen, die miteinander verschweißt sind, sodass sich die Metalle verbiegen, wenn sich die beiden Streifen aufgrund von Wärme unterschiedlich stark ausdehnen) und lasse das sich verbiegende Metall bei einer Krümmung von 21 Grad einen Schalter für die Heizung auslösen oder bei einer Krümmung von 23 Grad eine Klimaanlage.

Dann hält der Thermostat unter einer Vielzahl von Bedingungen einen engen Temperaturbereich aufrecht und erzeugt ein extrem einfaches Verhalten, das ein wenig dem ähnelt, was wir als "Wollen" bezeichnet haben.

In der Biochemie gibt es unzählige Thermostatprozesse. Sie treten überall dort auf, wo eine Zelle oder ein Körper davon profitiert, bestimmte Eigenschaften innerhalb eines bestimmten Bereichs zu halten.* Aber sie sind nur der erste Schritt auf dem Weg zu einer vollwertigen Steuerung.

Einfachen Geräten wie Thermostaten fehlen einige wichtige Komponenten der Planung. Innerhalb des Thermostats selbst gibt es weder das Vorstellungsvermögen, wahrscheinliche Konsequenzen vorherzusagen, noch die Suche nach möglichen Maßnahmen, die zu bestimmten ("bevorzugten") Konsequenzen führen, noch das Lernen, nachdem man gesehen hat, wie sich Ereignisse entwickeln.†

Wenn das Thermometer eines Thermostats, also sein Temperaturmesser, bei 18 Grad hängen bleibt, reagiert der Thermostat nicht überrascht, wenn die Heizung trotz kontinuierlichem Betrieb das Thermometer nicht nach oben bewegt, der Thermostat lässt die Heizung einfach weiterlaufen.

Um einen Schritt über Thermostate hinauszugehen, wenden wir uns den Tieren zu.

Einige Tiere zeigen ein Verhalten, das kaum über das eines Thermostats hinausgeht. Es gibt eine berühmte Geschichte über Goldgräberwespen oder Sphex-Wespen, die auf den Entomologen Jean-Henri Fabre aus dem Jahr 1915 zurückgeht. Die Wespe tötet eine Grille und schleppt sie zum Eingang ihres Baus, um ihre Nachkommen zu füttern. Sie geht hinein, um ihren Bau auf Anomalien zu überprüfen. Dann kommt sie zurück und schleppt die Grille hinein.

Fabre berichtete, dass, wenn er die Grille während der Überprüfung des Baus ein paar Zentimeter vom Nest wegzog, die Wespe, als sie wieder herauskam, die Grille zurück zum Eingang schleppte, dann ein zweites Mal in ihren Bau ging, ihren Bau ein zweites Mal untersuchte und dann wieder herauskam, um die Grille zu holen.

Wenn Fabre die Grille erneut wegzog, tat die Wespe genau dasselbe noch einmal.

Fabres ursprünglicher Bericht lautete, dass er dies vierzig Mal wiederholen konnte.

Später versuchte Fabre denselben Trick mit einer anderen Kolonie derselben Art, und in dieser Kolonie schien eine Wespe nach zwei oder drei Wiederholungen zu begreifen. Als die Wespe das nächste Mal herauskam, zog sie die Grille sofort ganz in den Bau hinein und übersprang den Untersuchungsschritt.

Für das menschliche Auge offenbart sich eine Wespe, die vierzig Wiederholungen durchläuft, in gewisser Weise als "vorprogrammiert", als würde sie blind einem Skript folgen und einer Reihe von Wenn-Dann-Regeln gehorchen. Umgekehrt scheint eine Wespe, die nach der vierten Wiederholung versteht und die Grille hineinzieht, zielgerichteter zu sein, als würde sie Verhaltensweisen mit dem Ziel ausführen, ein endgültiges Ziel zu erreichen, anstatt nur einem Skript zu folgen.

Was ist der entscheidende Unterschied?

Wir würden sagen: Die Muster durchbrechende Wespe verhält sich so, als könne sie aus früheren Erfahrungen lernen.

Sie verhält sich so, als könne sie aus "Meine Vorgehensweise ist letztes Mal fehlgeschlagen" die allgemeine Schlussfolgerung ziehen: "Wenn ich diese Vorgehensweise beibehalte, werde ich wahrscheinlich auch beim nächsten Mal scheitern."

Sie erfindet ein neues Verhalten, das direkt auf das Problem eingeht, auf das sie gestoßen ist.

Natürlich können wir die Neuronen im Gehirn einer Wespe nicht entschlüsseln (genauso wenig wie wir die Parameter in einem LLM entschlüsseln können), um genau zu wissen, was in ihrem Kopf vorging. Vielleicht folgten die musterbrechenden Wespen übergeordneten Wenn-Dann-Regeln darüber, wie sie bestimmte Schritte in Skripten überspringen können, wenn sie auf bestimmte Probleme stoßen. Vielleicht hat in diesem Fall eine relativ einfache und starre Reihe von Reflexen die Wespen gerettet, nur eben ein kleines bisschen weniger starr als die Kolonie, die diesen Test nicht bestanden hat. Es wäre sicherlich seltsam, wenn es einen großen kognitiven Unterschied zwischen zwei Wespenkolonien derselben Art gäbe.

Oder vielleicht sind Sphex-Wespen intelligent genug, um aus Erfahrungen zu lernen, wenn sie ihr Gehirn richtig einsetzen. Wir konnten keine Neuronenanzahl für Sphex-Wespen finden, aber Sphex-Wespen sind größer als Honigbienen, und Honigbienen haben Gehirne mit Millionen von Neuronen. Eine Million Neuronen mag für einen modernen KI-Programmierer oder einen Neurowissenschaftler, der an Säugetiergehirne gewöhnt ist, nicht viel erscheinen, aber im absoluten Sinne ist eine Million Neuronen wirklich eine Menge.

Vielleicht sind Sphex-Wespen vielseitiger, als sie erscheinen, und wir sollten uns die gescheiterte Kolonie als relativ flexible Denker vorstellen, die unter ganz bestimmten Umständen zufällig einer Art Sucht oder kognitiver Störung erlegen sind.

Unabhängig davon geht es darum, dass Wespen im Vergleich zu Thermostaten besser in der Lage sind, mit einer Vielzahl von Problemen umzugehen, insbesondere da ihr Verhalten von der unbeirrbaren Befolgung von Rezepten zu etwas übergeht, das eher dem Lernen aus Erfahrung ähnelt.

Wenn man diesen Weg weiterverfolgt, erhält man eine Antwort darauf, warum die Evolution immer wieder Tiere hervorbringt, die sich so verhalten, als hätten sie Wünsche. Der Grund dafür ist, dass viele Tiere besser überleben und sich besser fortpflanzen konnten, wenn sie allgemeinere Strategien zur Erreichung ihrer Ziele verfolgten, die gegen ein breiteres Spektrum von Hindernissen wirkten.

Früher gab es eine philosophische Ansicht, dass es eine natürliche Rangordnung unter den Lebewesen gab: Reptilien über Insekten, Säugetiere über Reptilien und Menschen (natürlich) an der Spitze. Ein Zeichen dafür, dass man einen höheren Status hatte, war die Fähigkeit, sich innerhalb eines einzigen Lebens anzupassen, nicht nur im Laufe der Evolution, die Welt zu sehen, zu modellieren und vorherzusagen, Rezepte für Misserfolge aufzugeben und neue Strategien zu erfinden, um zu gewinnen.

Diese Sichtweise einer großen Kette des Seins war nicht sehr differenziert, und heute kritisieren differenziertere Ansichten ihre Naivität.

Diese Sichtweise enthielt jedoch auch einen Funken Wahrheit, der so groß wie eine Abrissbirne war. Wenn man Biber, die Dämme bauen, mit Spinnen, die Netze spinnen, vergleicht, arbeiten Biber mit ziemlicher Sicherheit auf einer höheren Ebene der Allgemeinheit – schon allein deshalb, weil Biber viel größere Gehirne haben, die mehr Raum für Klugheit bieten.

Eine Spinne hat vielleicht fünfzigtausend Neuronen, und diese Neuronen müssen jedes Verhalten der Spinne abdecken. Ihr Netzrezept enthält wahrscheinlich viele Anweisungen, die, wenn auch nicht wörtlich "und dann hier links abbiegen", so doch zumindest mit den Strategien einer Sphex-Wespe vergleichbar sind.

Der Biber kann vielleicht (wir spekulieren hier, da wir keine Biber-Experten sind, aber es ist eine naheliegende Spekulation) ein aktuelles Leck in einem Damm als eine Art Disharmonie betrachten, die mit allen Mitteln vermieden werden muss. Der Biber verfügt über einen gesamten parietalen Kortex (den Teil des Großhirns von Säugetieren, der den Raum und die Dinge im Raum verarbeitet), mit dem er sich möglicherweise die Auswirkungen des Hinzufügens weiterer Zweige und Steine an bestimmten Stellen vorstellen kann.

Im Gehirn eines Bibers ist wahrscheinlich genug Platz für weitreichende mentale Ziele wie "eine große Struktur bauen" und "kein Wasser durchsickern lassen" und genug Leistung, um hochrangige, weitreichende Lösungen zu erwägen und untergeordnete Ziele wie "hier Zweige hinzufügen" zu verfolgen, die dann an den motorischen Kortex des Bibers weitergeleitet werden, der seine Muskeln und seinen Körper bewegt, um einige Zweige zu greifen.

Wenn die ersten Zweige, die der Biber greift, alle morsch sind und brechen, hat das Gehirn eines Bibers wahrscheinlich genug Platz, um diese Beobachtung zu verarbeiten, eine Verallgemeinerung über Zweige dieser Farbe und Beschaffenheit anzustellen, davon auszugehen, dass zukünftige Zweige, die so aussehen, ebenfalls brechen werden, und stattdessen anders aussehende Zweige zu holen.

Und dies (wir erwarten, dass jeder echte Ethologe mit Fachkenntnissen über Biber aufspringen und uns anschreien würde) ist eine enorme Untertreibung der intelligentesten Dinge, die ein Biber tun kann. Vielleicht springt auch ein Entomologe auf und sagt, dass das, was wir gerade beschrieben haben, etwas ist, was sein Lieblingsinsekt beim Bau eines Baus tun kann. Wir mussten ein Beispiel geben, das einfach genug ist, um in einem Absatz dargestellt zu werden, vielleicht ist also auch nichts, was so einfach ist, für eine Million Neuronen unerreichbar.

Der übergeordnete Gedanke ist einfach, dass ein System starke reale Vorteile für die Aufgabenausführung gewinnt, wenn es von eher reflexartigen Verhaltensweisen zu Kognitionen übergeht, die eher einer Aktualisierung eines Weltmodells aus Echtzeit-Erfahrungen ähneln, wobei die Folgen von Handlungen unter Verwendung dieses Weltmodells vorhergesagt werden, hilfreiche Zustände, in die die Welt gebracht werden könnte, imaginiert werden und hoch- und niedrigstufige Strategien gesucht werden, von denen vorhergesagt wird, dass sie diese imaginierten Zustände herbeiführen.

Wir haben diesen Punkt in Kapitel 3 angesprochen. Wenn ein Fahrer sich nur die Muster für Rechts- und Linksabbiegen merkt, um von Punkt A nach Punkt B zu gelangen, indem er Wenn-Dann-Regeln wie "an der Tankstelle scharf links abbiegen" anwendet, wird er viel weniger schnell generalisieren können als ein Fahrer, der sich einen Straßenplan einprägt und seine eigenen Wege zwischen neuen Punkten planen kann. Das Auswendiglernen von Richtlinien führt zu einer viel langsameren Verallgemeinerung als der Versuch, sie in ein lernbares Weltmodell und eine Plansuchmaschine mit einem Ergebnisbewerter zu destillieren.

Diese Destillation ist keine mentale Veränderung, bei der es um alles oder nichts geht. Der Unterschied zwischen "Sich eine Richtlinie merken" und "Aktualisieren und Planen" ist auch dann von Bedeutung, wenn die Lücke nur allmählich geschlossen wird. Wenn das Gehirn einer Maus nicht flexibler wäre als das Gehirn einer Spinne, wenn es keinen Sprung in der Nützlichkeit gäbe, bis man ganz zum Menschen gelangt, dann wäre das Gehirn der Maus spinnengroß geblieben und hätte den Energieaufwand eines Spinnengehirns beibehalten.

Kleine Teile von Vorstellungskraft und Planung beginnen schon lange vor Erreichen der menschlichen Kognition einen evolutionären Vorteil zu bieten. Sie müssen nicht perfekt sein. Wenn sie mindestens so gut sind wie ein Thermostat, können sie nützlich sein. Und je mehr solche nützlichen Mechanismen im Geist verankert werden, desto mehr ähnelt sein Verhalten dem eines Menschen.

* Die Verbreitung von thermostatähnlichen Mechanismen ist einer der Gründe, warum die Biochemie für Menschen so schwer zu verstehen ist. Wenn ein Wissenschaftler die Auswirkungen von kaltem Wetter auf ein Haus mit Thermostat beobachtet, ist die eigentliche Ursache, dass kaltes Wetter dazu führt, dass das Haus schneller Wärme verliert und der Thermostat dann die Heizung häufiger einschaltet. Der Hausbiologe, der Statistiken aufzeichnet, stellt jedoch fest, dass kaltes Wetter keinen sichtbaren statistischen Einfluss auf die Temperatur des Hauses hat, vielmehr verbrauchen Häuser bei kälterem Wetter mehr Erdgas?

Dann zeigen die Statistiken anderer Wissenschaftler eine große Bandbreite an Schwankungen beim Erdgasverbrauch im Laufe eines Wintertages, aber keinen korrelierten Unterschied bei den durchschnittlichen Haus-Temperaturen. Daraus schließen sie, dass es keinen Grund gibt, zu vermuten, dass der Erdgasverbrauch die Haus-Temperaturen beeinflusst. Unabhängig davon, wie viel Erdgas das Haus verbraucht, bleibt die Temperatur gleich (am unteren Ende des Thermostatbereichs).

Nein, aber Moment mal! Im Sommer sinkt der Erdgasverbrauch drastisch, und die Häuser sind messbar wärmer (am oberen Ende des Thermostatbereichs)! Vielleicht macht also die Verbrennung von Erdgas im Winter die Häuser kälter?

Und das ist ein Grund, warum die Medizin so ein riesiges Durcheinander ist. Thermostatähnliche Prozesse gibt es überall in der Biologie, und sie können es schwierig machen, zu erkennen, was genau eigentlich was verursacht.

† Es gibt einen externen Optimierer, einen menschlichen Ingenieur, der den Thermostat gebaut hat, und dieser menschliche Ingenieur hatte eine Vorhersage darüber im Kopf, was passieren würde, wenn der Thermostat die Heizung bei 70 °F automatisch einschaltet. Aber der Thermostat selbst weiß das nicht.

Das mentale Verfolgen und Unterscheiden verschiedener Optimierungsstufen ist eine grundlegende Fähigkeit für das Denken über KI. Als menschliche Ingenieure Deep Blue bauten, wollten sie Garry Kasparov schlagen, um wissenschaftlichen Ruhm zu erlangen, innerhalb von IBM befördert zu werden und die Grenzen des Wissens zu erweitern; Deep Blue durchsuchte den Baum der möglichen Schachzüge und steuerte das Schachbrett. Man wäre verwirrt, wenn man denken würde, dass die menschlichen Ingenieure selbst den Schachspielbaum durchsuchten oder dass Deep Blue wollte, dass die Menschen berühmt werden.

Ein Thermostat wählt Ein-Aus-Codes für eine Heizung so aus, dass er ein Haus innerhalb eines engen Temperaturbereichs hält; ein menschlicher Ingenieur wählt Komponenten so aus, dass sie einen Thermostat bilden.

In ähnlicher Weise wählt die natürliche Selektion Gene so aus, dass sie in der Vergangenheit eine Biochemie aufgebaut haben, die den Organismus am Leben erhielt. In einer neuen und anderen Umgebung können diese biochemischen Rückkopplungsschleifen den Organismus töten, und die Chemikalien und Gene selbst denken nicht darüber nach, was sie tun.

Notes

[1] Überspringen der Untersuchung: Eine Version dieser Anekdote, die sich vor dem Zeitalter des modernen Internets unter Informatikern verbreitete, basierte auf einer späteren Nacherzählung durch einen Ingenieur, der Fabres Vorbehalt darüber ausließ, dass Wespenkolonien derselben Art unterschiedliche Fähigkeiten zur Verhaltensänderung aufweisen. Siehe “Die Sphex-Geschichte: Wie die Kognitionswissenschaften eine alte und fragwürdige Anekdote immer wieder wiederholten" für weitere Details.

Ihre Frage wurde hier nicht beantwortet?Eine Frage einreichen.