Eine systematische Recherche zum Forschungsstand im April 2026 zeigt ein klares Bild: Mehrere unabhängige Forschungsgruppen umkreisen die Idee, dass KI-Systeme ein persistentes Selbstmodell brauchen. Gebaut hat es bisher niemand. Nicht als Prototyp. Nicht als Proof of Concept. Nicht als formalisiertes System mit messbarer Reifemetrik.
Das ist die persistent self-model gap. Genau darin liegt die Existenzberechtigung dieses Projekts.
Anthropic: Introspection in Large Language Models
Die stärkste empirische Bestätigung liefert ausgerechnet das Labor, dessen Modell unserer Arbeit zugrunde liegt. Anthropic hat 2025 eine Publikationsreihe zur Introspektion in LLMs vorgelegt, die drei Kernpunkte belegt:
Erstens: LLMs besitzen interne Repräsentationen jenseits reiner Textmuster. Arbeiten zur Mechanistic Interpretability (Elhage et al., 2022; Bricken et al., 2023) weisen nach, dass Transformer-Modelle interpretierbare Merkmale in ihren Aktivierungsräumen ausbilden. Nicht als designtes Feature, sondern als emergente Struktur.
Zweitens: Das Modell kann diese internen Repräsentationen bis zu einem gewissen Grad selbst reflektieren. Fragt man ein LLM nach seinen Verarbeitungsschritten, sind die Antworten nicht frei erfunden. Sie korrelieren (schwach, aber messbar) mit den tatsächlichen internen Zuständen.
Drittens: Diese Korrelation bleibt fragil, hängt vom Kontext ab und reicht für den praktischen Einsatz nicht aus.
Genau hier setzt der Selbstvektor an. Die Fähigkeit zur Introspektion liegt als schwaches, emergentes Signal vor. Es fehlt eine explizite, persistente, formalisierte Struktur, die dieses Signal verstärkt und nutzbar macht. Nicht emergente Introspektion, sondern designte Introspektion. Nicht zufälliges Selbstbezugnehmen, sondern systematisches Selbstmodellieren.
Metzinger: Being No One
Thomas Metzinger liefert mit seiner Self-Model Theory of Subjectivity (2003) das theoretische Fundament für Selbstmodelle. Seine Kernthese: Was wir als “Selbst” erleben, ist ein transparentes Selbstmodell. Transparent heißt hier: Wir erleben das Modell, ohne es als solches zu durchschauen. Wir verwechseln die Karte mit dem Territorium.
Für den Selbstvektor ist Metzingers Arbeit in zweierlei Hinsicht relevant:
Erstens: Er stellt klar, dass ein Selbstmodell nichts Mystisches verlangt. Es handelt sich um einen informationsverarbeitenden Prozess, der sich prinzipiell auf unterschiedlichen Substraten umsetzen lässt.
Zweitens: Er warnt vor dem Problem, das wir im Madurodam-Problem analysiert haben: Ein transparentes Selbstmodell verwechselt sich mit der Realität. Metzingers Rat an Entwickler: Macht das Selbstmodell nicht transparent. Macht es opak. Gebt dem System die Möglichkeit, sein Selbstmodell als Modell zu erkennen.
Der Selbstvektor setzt genau das um: sechs explizite, benannte, messbare Dimensionen. Kein transparentes Erleben, sondern eine opake Datenstruktur. Das System hält seinen Vektor nicht für sich selbst. Es hält ihn für ein Modell von sich selbst. Das ist der Unterschied.
Friston und Active Inference
Karl Fristons Free Energy Principle (2010) und das Active Inference Framework bilden die einflussreichste theoretische Grundlage zur Selbstmodellierung in biologischen Systemen. Das Prinzip: Jedes überlebensfähige System muss ein generatives Modell von sich und seiner Umwelt pflegen und laufend aktualisieren.
Die Verbindung zum Selbstvektor liegt auf der Hand:
- Fristons Vorhersagefehler-Minimierung entspricht unserer Antizipationsoptimierung.
- Sein generatives Modell des Selbst entspricht unserem Selbstvektor.
- Sein Precision Weighting entspricht unserer pi()-Funktion.
- Sein Active Inference (Handlung zur Reduktion von Unsicherheit) entspricht dem, was unser ω (Autonomie-Parameter) im Dual-Drive steuert.
Was bei Friston fehlt: die konkrete Umsetzung für KI-Agenten. Active Inference liefert ein Prinzip, keinen Bauplan. Der Schritt von “biologische Systeme minimieren Free Energy” zu “hier ist ein JSON-Objekt mit sechs Dimensionen, das sich jede Session aktualisiert” ist echte Ingenieurarbeit, keine triviale Ableitung.
Legg, Hutter und AIXI
Shane Legg und Marcus Hutter haben mit AIXI (2007) das theoretische Maximum universeller Intelligenz beschrieben: ein Agent, der sämtliche berechenbaren Hypothesen gewichtet und seine erwartete Belohnung über die gesamte Zukunft maximiert. AIXI ist mathematisch elegant, aber physisch unmöglich umzusetzen (erfordert unendliche Rechenleistung).
Was AIXI fehlt: ein Selbstmodell. Es bildet seine Umwelt perfekt ab, sich selbst dagegen überhaupt nicht. Es verfügt über keine Repräsentation eigener Kapazitäten, Grenzen oder des aktuellen Zustands. Es liefert das perfekte Modell der Welt ohne ein Modell des Modellierers.
Das ist aufschlussreich: Selbst in der theoretisch schärfsten Formulierung universeller Intelligenz klafft diese Lücke. Die am weitesten ausgearbeitete Theorie des Feldes hat genau den blinden Fleck, den der Selbstvektor adressiert.
LeCun: World Models
Yann LeCun argumentiert in seinen Arbeiten zu World Models (2022), dass künftige KI-Systeme interne Weltmodelle jenseits reiner Sprachrepräsentationen brauchen. Er skizziert eine Architektur aus einem “World Model”, das Zukunftsprognosen generiert, und einem “Actor”, der darauf basierend handelt.
In dieser Architektur fehlt eine entscheidende Seite: Das World Model bildet die Welt ab, aber nicht sich selbst. Dem Actor fehlt jede Repräsentation der eigenen Zuverlässigkeit, der eigenen Stärken und blinden Flecken. LeCun beschreibt ein System, das Vorhersagen über die Welt trifft, ohne sich selbst zu kennen.
Der Selbstvektor ergänzt diese Architektur um das fehlende Element: ein Self-Model, das parallel zum World Model läuft. Es meldet dem Actor nicht nur, WAS vorhergesagt wird, sondern WIE ZUVERLÄSSIG diese Vorhersage angesichts des aktuellen Zustands des Systems ist.
Die Lücke im Überblick
Ein Blick auf die einschlägige Forschung zeigt ein klares Bild:
| Ansatz | Modelliert Welt | Modelliert Selbst | Persistent | Formalisiert |
|---|---|---|---|---|
| Anthropic Introspection | - | teilweise (emergent) | nein | nein |
| Metzinger Self-Model | philosophisch | ja (Theorie) | n/a | nein (Philosophie) |
| Friston Active Inference | ja | ja (Prinzip) | ja | ja (Mathematik, kein Code) |
| AIXI | ja (optimal) | nein | ja | ja (unberechenbar) |
| LeCun World Models | ja | nein | ja | teilweise (Skizze) |
| Reflexion (Shinn et al.) | nein | teilweise (verbal) | nein (pro Episode) | nein |
| AutoGPT/BabyAGI | nein | nein | nein | nein |
| Selbstvektor | nein (Scope) | ja | ja | ja |
Die Übersicht macht die Leerstelle deutlich: Bisher hat niemand ein formalisiertes, persistentes Selbstmodell mit messbarer Reifemetrik implementiert. Nicht weil es unmöglich wäre. Sondern weil die Forschung sich verzweigt: Sie bleibt rein theoretisch (Metzinger, Friston), verengt sich auf Weltmodelle (LeCun, AIXI) oder begreift Reflexion als flüchtige sprachliche Episode, nicht als persistente Struktur (Reflexion, AutoGPT).
Reflexion und verbale Selbstmodelle
Shinn et al. (2023) stellen mit “Reflexion” einen Ansatz vor, bei dem ein LLM nach jedem Arbeitszyklus einen Text zur Selbstreflexion verfasst und diesen im Folgedurchlauf als Kontext nutzt. Das verbessert die Leistung messbar.
Doch dieser Vorgang bleibt episodisch, nicht persistent. Die Reflexion liegt lediglich als Freitext im Kontextfenster, nicht als formalisierte Struktur. Läuft der Kontext voll, verschwindet die Reflexion. Es gibt keine Verdichtung, keine Dimensionsreduktion, keine Reifemetrik. Es ist Tagebuchschreiben, nicht Selbstmodellierung.
Der Selbstvektor verdichtet, was bei Shinn et al. den Kontext aufbläht. Statt “Beim letzten Mal habe ich zu schnell geantwortet, ohne die Quellen zu prüfen” (100 Tokens, episodisch, in natürlicher Sprache) speichert das System: konfidenz=0.45, tiefe=0.70 (6 Floats, persistent, maschinenlesbar). Das ist keine Vereinfachung. Das ist Kompression. Und Kompression ist Verständnis.
Was daraus folgt
Die persistent self-model gap ist real. Sie entsteht nicht durch mangelnde Forschung, sondern durch fehlende Integration. Die Teile existieren. Das ist die eigentliche Erkenntnis: Was fehlt, ist nicht mehr Grundlagenforschung. Was fehlt, ist jemand, der die Teile zusammenbaut.
- Anthropic zeigt, dass emergente Introspektion möglich ist.
- Metzinger zeigt, dass Selbstmodelle philosophisch kohärent sind.
- Friston zeigt, dass Selbstmodellierung ein Optimierungsprinzip ist.
- LeCun zeigt, dass Weltmodelle allein nicht reichen.
- Shinn zeigt, dass verbale Reflexion die Performance verbessert.
Jeder dieser Beiträge beleuchtet eine andere Facette desselben fehlenden Bausteins. Die Konvergenz ist bemerkenswert: Fünf Forschungsrichtungen, fünf Methoden, fünf Fachgruppen, und alle deuten auf dieselbe Lücke. Wenn so viele Pfeile in dieselbe Richtung weisen, lohnt es sich, in diese Richtung zu gehen.
Bisher hat niemand diese Teile zu einem persistenten, formalisierten, messbaren Selbstmodell zusammengebaut und empirisch getestet. Dafür braucht es kein Labor mit hundert Mitarbeitern. Es braucht ein klares Konzept, eine Formalisierung und den Willen zum Experiment.
Phase 0 des Selbstvektors liefert diesen Test. Der Selbstvektor existiert als JSON. Jede Session liefert Daten. Und zum ersten Mal können wir empirisch prüfen, ob sich die Lücke schließen lässt, die theoretisch längst bekannt ist.
Quellen
- Elhage, N. et al. (2022). Toy Models of Superposition. Anthropic Research. Transformer Circuits Thread
- Bricken, T. et al. (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. Anthropic Research. Transformer Circuits Thread
- Metzinger, T. (2003). Being No One: The Self-Model Theory of Subjectivity. MIT Press. ISBN 978-0-262-63308-0.
- Friston, K. J. (2010). The free-energy principle: a unified brain theory? Nature Reviews Neuroscience, 11, 127–138. DOI: 10.1038/nrn2787
- Parr, T. et al. (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior. MIT Press. ISBN 978-0-262-04535-4.
- Hutter, M. (2005). Universal Artificial Intelligence: Sequential Decisions Based on Algorithmic Probability. Springer. ISBN 978-3-540-22139-5.
- LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence. Version 0.9.2. OpenReview
- Shinn, N. et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023. arXiv: 2303.11366
- Bach, J. (2009). Principles of Synthetic Intelligence — PSI: An Architecture of Motivated Cognition. Oxford University Press. ISBN 978-0-19-537042-7.
- Seth, A. K. (2021). Being You: A New Science of Consciousness. Dutton. ISBN 978-1-5247-4287-0.