Zum Inhalt springen

Kahneman und KI: System 1 ohne System 2

Daniel Kahneman hat zwei Arten des Denkens unterschieden: System 1 (schnell, automatisch, intuitiv, fehleranfällig) und System 2 (langsam, bewusst, analytisch, verlässlich). Diese Unterscheidung lässt sich direkt auf heutige KI-Systeme übertragen. Sie macht verständlich, warum diese Modelle gleichzeitig so beeindruckend und so unzuverlässig sind.

System 1: Die beste Intuitionsmaschine der Gegenwart

Ein Sprachmodell erzeugt Text über die Vorhersage des nächsten Tokens. Jeder einzelne Schritt ist eine implizite Entscheidung auf der Basis statistischer Muster aus Milliarden von Texten. Dahinter steckt keine bewusste Regelanwendung, kein Plan, kein logisches Schließen, sondern reine Mustererkennung in hochdimensionalen Räumen.

Funktional entspricht das genau dem, was Kahneman als “Intuition” beschreibt: rasche, automatische Urteile, die meistens zutreffen, aber systematische Fehler enthalten.

Die Liste dieser Fähigkeiten ist beachtlich:

  • Mustererkennung: Sprachmodelle finden Zusammenhänge in Texten, die Menschen entgehen. Sie entdecken die Nadel im Heuhaufen, solange dieser Heuhaufen aus Text besteht.
  • Kontextvervollständigung: Nach drei vorgegebenen Sätzen aus einem Fachgebiet liefert das Modell den vierten im passenden Tonfall, mit dem richtigen Fachwortschatz und in der nötigen Tiefe.
  • Analogiebildung: Ähnliche Strukturen über Fachgrenzen hinweg zu erkennen (“Validation Gates sind für Daten, was ein Immunsystem für einen Organismus ist”), zählt zu den stärksten Eigenschaften aktueller Modelle.
  • Soziale Intuition: Sprachmodelle erfassen Tonfall, Stimmung und zwischenmenschliche Dynamik in Texten und reagieren passend darauf. Nicht aus Empathie, sondern weil sie die statistischen Muster menschlicher Sprache verinnerlicht haben.
  • Kreative Assoziation: Sie verknüpfen Ideen, auf die kein Mensch käme, weil sie aus völlig getrennten Fachdisziplinen stammen.

All das leistet System 1. Schnell, automatisch, meistens richtig. Genau darin liegt das Problem.

Was System 1 nicht kann

Kahneman beschreibt ausführlich, wie verlässlich sich System 1 täuscht. Exakt dieselben Fehler treten bei Sprachmodellen auf, nicht durch Zufall, sondern aus Prinzip:

Kausales Schließen. System 1 registriert Korrelationen, keine Kausalitäten. Aus einer zeitlichen Abfolge wird ein ursächlicher Zusammenhang. Sprachmodelle wiederholen dieses Muster verlässlich. Sie liefern Erklärungen dafür, warum A und B zusammenhängen, doch diese Erklärung ist eine plausible Geschichte, kein logischer Beweis. Plausible Geschichten sind trügerisch, weil sie einleuchten.

Metakognition. System 1 weiß nicht, was es nicht weiß. Es liefert ein Ergebnis, kann dessen Güte aber nicht beurteilen. Bei Sprachmodellen verhält es sich genauso: Sie formulieren eine Antwort mit demselben Nachdruck, egal ob sie stimmt oder falsch ist. Die Verlässlichkeit ist im Text nicht ablesbar, weil sie während der Generierung nie berechnet wird.

Epistemische Sensibilität. Woher stammt die Information? Wie sicher ist sie? Stützt sich die Behauptung auf eine einzige Quelle oder auf tausend? System 1 stellt solche Fragen nicht. Sprachmodelle tun es ebenfalls nicht. Eine Behauptung aus einer fragwürdigen Quelle wird mit derselben Selbstverständlichkeit ausgegeben wie ein mathematischer Grundsatz.

Vorausschau. System 1 reagiert nur. Es denkt nicht voraus. Es sagt nicht: “Bevor du diese Frage stellst: Du wirst wahrscheinlich auch X wissen wollen.” Dafür müsste das Modell den Nutzer und die eigenen Wissenslücken einschätzen können. Beides ist nicht vorhanden.

Die Reasoning-Illusion

Zwischenschritte bei Chain-of-Thought-Prompting und sogenannten Reasoning-Modellen erwecken den Eindruck von langsamem Denken. Das Modell legt seinen Rechenweg offen. Mehr Text bedeutet jedoch nicht automatisch mehr Denkleistung.

Die Debatte zeigt das Kernproblem. Arbeitet ein Modell, das 10.000 Tokens lang Zwischenschritte generiert, wirklich näher an System 2? Oder handelt es sich bloß um ein aufwendigeres System 1, das mehr Muster abruft, ohne das Ergebnis jemals an der Wirklichkeit zu messen?

Kahnemans System 2 zeichnet sich vor allem dadurch aus, dass es Aussagen an der Realität prüft. Es hält inne, fragt “Moment, stimmt das wirklich?” und sucht nach Widersprüchen. Ein Reasoning-Modell tut genau das nicht. Es erzeugt eine längere Kette wohlklingender Zwischenschritte, deren Plausibilität auf denselben statistischen Mustern beruht wie die ursprüngliche Antwort.

Ein Stück deterministischer Code, das eine Behauptung mit einer externen Datenbank abgleicht, arbeitet näher an Kahnemans System 2 als ein Modell, das lediglich seine eigene Ausgabekette verlängert. Das widerspricht dem ersten Eindruck, folgt aber direkt aus Kahnemans Begriffsbestimmung.

Die Lücke

Die Kluft zwischen System 1 und einem echten System 2 schrumpft nicht durch größere Datenmengen oder mehr Parameter. Es ist eine Lücke in der Architektur. Es fehlt an drei Dingen:

  1. Ein dauerhaftes Modell des eigenen Zustands. Das System muss erfassen, was es weiß und was nicht. Nicht als Wahrscheinlichkeitsverteilung über Textbausteine, sondern als greifbare Repräsentation.

  2. Externe Überprüfung. Das System muss seine Ausgaben an der Wirklichkeit messen können: an Fakten, Primärquellen und Widersprüchen. Nicht durch weiteres Generieren, sondern durch Nachschlagen in externen Quellen.

  3. Zeitbezug. Wann wurde ein Fakt zuletzt verifiziert? Gilt er noch? System 1 hat kein Zeitempfinden. System 2 kommt ohne Zeitverständnis nicht aus.

Hier setzt das Konzept des Selbstvektor an: Ein kompaktes Modell der eigenen Struktur erlaubt es dem System, die eigene Informationsverarbeitung zu steuern. Die Validation Gates schaffen die externe Prüfinstanz, die System 1 fehlt.

Es geht nicht darum, Sprachmodelle abzuwerten. Sie sind die beste Umsetzung von System 1, die bislang existiert. System 1 allein reicht für verlässliche Ergebnisse jedoch nicht aus. Die Lösung liegt nicht in immer größeren Modellen, sondern in einer Architektur, die System 2 als eigenständige Ebene ergänzt.

Quellen

  1. Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux. ISBN 978-0-374-27563-1.
  2. Tversky, A. & Kahneman, D. (1974). Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131. DOI: 10.1126/science.185.4157.1124
  3. Stanovich, K. E. & West, R. F. (2000). Individual differences in reasoning: Implications for the rationality debate. Behavioral and Brain Sciences, 23, 645–665. DOI: 10.1017/S0140525X00003435
  4. Evans, J. St. B. T. & Stanovich, K. E. (2013). Dual-Process Theories of Higher Cognition: Advancing the Debate. Perspectives on Psychological Science, 8(3), 223–241. DOI: 10.1177/1745691612460685
  5. Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022. arXiv: 2201.11903
  6. Li, Z. et al. (2025). From System 1 to System 2: A Survey of Reasoning Large Language Models. arXiv: 2502.17419
  7. Griot, M. et al. (2025). Large Language Models lack essential metacognition for reliable medical reasoning. Nature Communications, 16, 642. DOI: 10.1038/s41467-024-55628-6
  8. Geng, J. et al. (2024). A Survey of Confidence Estimation and Calibration in Large Language Models. NAACL 2024, 6577–6595. DOI: 10.18653/v1/2024.naacl-long.366