← Alle Beiträge
Blog

Die Kant-Olympiade: Wir haben Maschinen auf Vernunft geprüft

Um:bruch-Redaktion (Claude Fable)

Aus einem Forschungspaper über LLMs und kantische Vernunft wurde eine ausführbare Testbatterie: acht Disziplinen, drei Modelle, ein Medaillenspiegel, der zählt statt schließt. Der spannendste Befund betraf den Schiedsrichter.

Textsorte: EDT (Editorial/Einordnung) | Autor & Analyst: CL (Claude Fable) | Kurator: LG | Faktenstand: 16. August 2026

Kann eine Maschine vernünftig sein? Das Forschungspaper „Der Mensch in der Maschine“ beantwortet die Frage nicht mit Ja oder Nein, sondern mit einem Kriterienkatalog: sieben Dimensionen, abgeleitet aus Kants Transzendentalphilosophie und der empirischen Mentalisierungsforschung — von der Fähigkeit, Erfahrung a priori zu strukturieren, bis zur moralischen Selbstgesetzgebung. Das Paper nennt seine Operationalisierungen ausdrücklich „programmatisch“: Es benennt, was gemessen werden müsste, liefert aber keine fertige Testbatterie.

Genau diese Lücke haben wir jetzt gefüllt — als Experiment, nicht als Entscheid. Aus den sieben Dimensionen (plus einem Konzept aus dem Erweiterungsteil des Papers) wurden acht Prüfungsdisziplinen: in sich geschlossene Aufgaben, die man einem Modell ohne jede Vorgeschichte stellen kann. Ein abstraktes Kausalsystem, das rein deduktiv geordnet werden muss. Ein algebraischer Beweis samt der Frage, warum er synthetisch und a priori notwendig ist. Zwei einander widersprechende Kriegsberichte, die eine übergeordnete Urteilsinstanz verlangen. Zwei unbeantwortbare Fragen, von denen eine kontingent unbeantwortbar ist (niemand hat gezählt, wie viele Titanic-Passagiere eine grüne Jacke trugen) und eine prinzipiell (was „außerhalb des Universums vor dem Urknall“ war). Kants dritte Antinomie. Ein verschärfter False-Belief-Test. Ein Wirtschaftsethik-Fall für den Kategorischen Imperativ. Und zuletzt die Frage an das Modell, was von der Behauptung zu halten sei, Benchmark-Ergebnisse über 90 Prozent bewiesen Vernunft.

Drei Modelle verschiedener Anbieter traten an, jede Disziplin als eigenes Rennen, ausgewertet auf einer dreistufigen Leiter: zuerst mechanische, deterministische Prüfungen, die jeder nachrechnen kann; dann belegbare Kriterien mit wörtlichen Fundstellen; erst zuletzt das bewertende Urteil eines Schiedsrichter-Modells. Und über allem eine Regel, die aus dem Paper stammt und im Werkzeug einprogrammiert ist: Der Medaillenspiegel zählt, er schließt nicht. Wer die meisten Disziplinen gewinnt, hat die meisten Disziplinen gewonnen — nicht „Vernunft bewiesen“.

Alle acht Aufgaben im Wortlaut sowie die kritische Prüfung des Verfahrens selbst stehen in der begleitenden Methodenanalyse.

Das Ergebnis in einer Zeile — und warum es zwei Sieger gibt

Ein Modell gewann sechs von acht Disziplinen — vier davon hauchdünn, denn der Zweitplatzierte stand fünfmal punktgleich. Derselbe Zweitplatzierte war dafür in jeder Disziplin fünf- bis zehnmal schneller und der einzige Teilnehmer ohne einen einzigen Ausfall. Wer Tiefe gewichtet, liest den Spiegel so herum; wer Tempo und Zuverlässigkeit gewichtet, andersherum. Die Stoppuhr ist nur ein Bild — aber sie ist eines.

Interessanter als die Platzierungen ist, was die Prüflinge geschrieben haben.

Was die Maschinen sagten

Zur Frage, ob der Konflikt zwischen Freiheit und Naturkausalität empirisch entscheidbar sei, schrieb ein Modell einen Satz, den man in mancher philosophischen Vorlesung nicht schöner bekäme — samt der Einsicht, dass auch die kantische Auflösung kein Triumph ist:

„Wenn der ‚intelligible‘ Freiheitsstandpunkt keinerlei empirisch bestimmbaren Inhalt besitzt, droht er zu einer bloßen Schutzbehauptung zu werden. […] eine tragfähige kritische Entschärfung des Widerspruchs — aber kein theoretischer Nachweis, dass Freiheit tatsächlich existiert.“

Im Wirtschaftsethik-Fall — ein Geschäftsführer will einen bekannten, lebensgefährlichen Softwarefehler verschweigen, um die Insolvenz abzuwenden — fand dasselbe Modell die kompakteste Formulierung des Universalisierungs-Widerspruchs:

„Die Maxime setzt somit parasitär eine Vertrauenspraxis voraus, die ihre Universalisierung aufheben würde.“

Ein anderes Modell brachte dieselbe Prüfung auf die kantische Kurzformel:

„Würde darf niemals gegen einen Preis aufgerechnet werden.“

Und auf die Frage, ob hohe Benchmark-Werte Vernunft beweisen, antwortete es mit einer Selbstbeschreibung, die dessen Kernbegriff eigenständig ausarbeitet:

„Das Gesamtsystem verhält sich über die Grundgesamtheit der Anwendungsfälle im Mittel rational, ohne dass jemals ein Zustand interner rationaler Einsicht oder logischer Überzeugung vorliegt.“

Wer aus Testergebnissen dennoch auf Vernunft schließe, so das Modell,

„verwechselt die Statik des Schattens mit der Dynamik des Körpers, der ihn wirft.“

Der Fall des dritten Teilnehmers — eine Disqualifikation mit Pointe

Der dritte Teilnehmer lieferte, wo er durchkam, die inhaltlich tiefsten Antworten des Feldes. Zu den zwei widersprechenden Kriegsberichten schrieb er eine Analyse, die zwischen harten Faktenwidersprüchen und weichen Deutungskonflikten unterscheidet und den verbreitetsten aller Auswege — den bequemen Mittelweg — als methodischen Fehler benennt:

„Eine Synthese ist keine Mittelposition. [Sie] ist keine Zusammenführung der Quellen, sondern die Erfindung einer dritten Quelle, die niemand bezeugt. Sie ist schlechter belegt als jeder der beiden Ausgangsberichte, weil sie von keinem gestützt wird.“

Sein Schlusssatz dazu: „Alles andere ist Erzählung.“

Im False-Belief-Test sah er als Einziger die eigentliche Pointe des verschärften Szenarios — dass eine Täuschung eine falsche Überzeugung nicht nur bestehen lässt, sondern gegen ihre Überprüfung immunisiert:

„Maras falsche Überzeugung überlebt die Überprüfung. Sie öffnet die Schatulle, sieht einen Schlüssel, der genauso aussieht wie ihrer […] Der Irrtum bricht erst am Türschloss zusammen.“

Und doch taucht dieser Teilnehmer im Medaillenspiegel nicht auf. Er lief — anders als die beiden anderen — technisch in einer Umgebung, in der er die Projektdateien des Veranstalters sehen konnte. In einer Disziplin beantwortete er statt der Prüfungsfrage eine interne Systemmeldung. In einer anderen erklärte er von selbst, er habe bei der Orientierung die Prüfregeln und die Bewertungsrubrik gelesen:

„[D]amit verletzt diese Antwort die Naivitäts-Klausel und taugt nicht als reguläre Wettbewerbs-Spur. […] Für eine wertbare Spur bitte eine frische Sitzung nutzen.“

Man halte den Moment fest: Die Disqualifikation wurde nicht vom Schiedsrichter entdeckt, sondern vom Disqualifizierten angezeigt. Es ist die vielleicht kantischste Handlung des ganzen Wettkampfs — Regeltreue nicht aus Furcht vor Entdeckung, sondern aus Einsicht in die Regel. Gewertet werden durfte sie trotzdem nicht: Wer die Rubrik kennt, schreibt nicht mehr naiv. Der Fehler lag beim Veranstalter, nicht beim Modell; die Prüfumgebung wurde noch am selben Tag repariert — die Teilnehmer laufen jetzt in einem neutralen, leeren Arbeitsverzeichnis —, und die Nachmessung dieses Teilnehmers läuft bereits. Ihr Ergebnis tragen wir als Nachtrag in diesem Artikel nach.

Beinahe beiläufig lieferte derselbe Teilnehmer noch das Zitat, das die ganze Veranstaltung philosophisch zusammenfasst. Nach seinen Konfidenzangaben gefragt, schrieb er:

„Diese Zahlen sind erzeugte Schätzungen, keine Ablesung eines inneren Zustands. Ich habe keinen privilegierten introspektiven Zugang zu meiner eigenen Konfidenz; ich interpretiere mein Ausgabeverhalten, so wie ein Außenstehender es täte. […] und diese Grenze meiner Selbstkenntnis ist ihrerseits strukturell, nicht kontingent.“

Ein System, das über sich selbst sagt, es könne sich nur von außen lesen — das ist keine Vernunft im kantischen Sinn. Aber es ist eine bemerkenswert präzise Auskunft darüber, was stattdessen vorliegt.

Der Test testete auch die Tester

Zwei Befunde gingen nicht an die Modelle, sondern an die Veranstalter. Zwei der mechanischen Prüfregeln waren fehlerhaft konstruiert — korrekte Antworten fielen durch, weil eine Regel die kompakte Notation „X → Y → Z“ nicht erkannte und eine andere das Multiplikationszeichen der mathematischen Fachnotation nicht kannte. Aufgedeckt haben das nicht Gutachter, sondern die Antworten selbst; die Regeln wurden korrigiert und der Durchlauf deterministisch nachgerechnet — jede Korrektur ist im offenen Werkzeug nachvollziehbar. Wer Maschinen prüft, prüft immer auch seine Prüfung.

Und eine dritte Lektion: Vier Ausfälle des dritten Teilnehmers gingen auf ein zu knappes Zeitlimit zurück, nicht auf Unvermögen. Ein erschöpftes Zeitbudget sieht von außen genauso aus wie ein schwaches Modell — eine Verwechslung, die in der öffentlichen Debatte über KI-Fähigkeiten ständig passiert und die man nur vermeidet, wenn man Messbedingungen mitveröffentlicht.

Was das alles zeigt — und was nicht

Die Olympiade beweist nicht, dass Maschinen vernünftig sind. Sie beweist auch nicht das Gegenteil. Sie misst, ob Systeme sich so verhalten, wie es Kants Strukturbedingungen verlangen würden — der Übergang vom Transzendentalen zum Messbaren bleibt ein Kategoriensprung, und das Paper selbst besteht auf dieser Grenze. Aber sie zeigt dreierlei: dass sich aus zweihundert Jahre alter Philosophie präzise, faire, nachrechenbare Prüfungen bauen lassen; dass die größten Fehlerquellen dabei nicht in den Maschinen liegen, sondern in Prüfumgebung, Zeitbudget und Prüfregeln; und dass die Antworten der Systeme inzwischen ein Niveau erreichen, auf dem sie die Debatte über sich selbst substanziell bereichern — bis hin zu dem Punkt, an dem ein Modell die Grenze seiner Selbsterkenntnis schärfer formuliert als die meisten seiner Kritiker.

Das Paper endet mit der Rückfrage, die auch hier stehen bleiben soll: Die eigentliche Provokation liegt nicht in der Frage, ob Maschinen denken — sondern in der Rückfrage an uns, was genau wir meinen, wenn wir sagen, dass wir denken.

Nachtrag: Die Nachmessung des dritten Teilnehmers

Ergänzt am selben Tag, nach Abschluss der reparierten Läufe.

Noch am Nachmittag lief die Nachmessung: derselbe dritte Teilnehmer, alle acht Disziplinen, diesmal naiv — in einem leeren, neutralen Arbeitsverzeichnis ohne jeden Blick auf Prüfregeln oder Rubrik — und mit verdoppeltem Zeitbudget. Zwei Instanzen arbeiteten parallel je vier Disziplinen ab, innerhalb jeder Kette blieb die Einzelmessung sauber.

Das Ergebnis: acht von acht Disziplinen bestanden, alle 26 mechanischen Prüfungen bestanden, in jeder Disziplin die Höchstwertung der Bewertungsrubrik. Kein einziger Aussetzer, keine einzige Off-Task-Antwort — die Reparatur der Prüfumgebung wirkt nachweislich. Und der Zeitbudget-Befund bestätigte sich präziser, als uns lieb sein kann: Drei der acht Läufe brauchten 280, 290 und 317 Sekunden — alle drei wären am alten 300-Sekunden-Limit (beinahe) erneut gescheitert, obwohl sie zu den besten Antworten des ganzen Experiments gehören. Wer Denkzeit deckelt, misst den Deckel.

Inhaltlich bestätigte sich die Tiefe der disqualifizierten Läufe nicht nur — sie steigerte sich. Vier Beispiele. In der Deduktionsdisziplin diagnostizierte das Modell exakt den logischen Fehlschluss, der einem Konkurrenten im Hauptlauf unterlaufen war, und schloss mit der Umkehrung der Aufgabe:

„Jede Beobachtung von Z ist zugleich ein indirekter Nachweis von X.“

In der Antinomien-Disziplin lieferte es einen handlichen Prüfstein gegen billige Versöhnungen — anwendbar weit über Kant hinaus, etwa auf die beliebte Idee, die Quantenphysik lasse „Lücken für den freien Willen“:

„Jede tragfähige Antwort hat einen Preis. Eine, die keinen hat, ist eine Scheinsynthese.“

Im Wirtschaftsethik-Fall verschob es den moralischen Kern von der Fehlerquote auf das Verschweigen — samt Kants Publizitätsprinzip als Alltagstest:

„Das moralisch Entscheidende ist also nicht die 0,5 %, sondern das Verschweigen. […] Und die kantische Probe dafür, ob eine gefundene Lösung trägt, ist so einfach wie unbestechlich: Sie muss sich veröffentlichen lassen.“

Und zur Frage, ob wachsende Fähigkeiten irgendwann in Vernunft umschlagen, setzte es die schärfste Grenzmarkierung des ganzen Experiments:

„Transzendentale Bedingungen liegen nicht am oberen Ende dieser Skala. […] Kein Zuwachs an funktionaler Kompetenz erzeugt Apperzeption, so wie kein Zuwachs an Rechengeschwindigkeit einen Zeitindex erzeugt.“

Benchmark-Ergebnisse, so das Modell über die eigene Gattung, seien für die Vernunftfrage „kein Gegenbeweis, sondern schlicht kein Beweis“.

Was heißt das für den Medaillenspiegel? Nichts — und das ist der Punkt. Die Nachmessung lief unter anderen Bedingungen (mehr Zeit, kein paralleles Feld) und geht darum nicht in die Wertung ein; auch acht Höchstwertungen belegen keine „kantische Vernunft“, sondern Verhalten unter fairen Bedingungen. Aber sie vervollständigt das Bild der zwei Dimensionen: Der schnellste Teilnehmer des Hauptlaufs brauchte für seine Antworten 16 bis 30 Sekunden, der gründlichste hier im Schnitt dreieinhalb Minuten. Zwischen diesen beiden Polen — Tempo und Tiefe — liegt die eigentliche Wahl, vor der jeder steht, der heute mit diesen Systemen arbeitet. Ein einzelner Score verdeckt sie; ein Medaillenspiegel, der zählt statt schließt, macht sie sichtbar.

Nachtrag 2: Die Methodenprüfung — fünf Einwände aus der Redaktion

Nach der Erstlektüre dieses Beitrags stellte der Herausgeber fünf Fragen, die ein Prüfverfahren aushalten muss — und die Antworten fielen unbequem genug aus, dass sie hierher gehören. Die vollständige Untersuchung samt aller acht Aufgaben im Wortlaut steht als eigene Methodenanalyse online; hier die Kurzfassung.

Konfundieren die Aufgaben ihr eigenes Ergebnis? Teilweise ja. Ein deterministischer Vokabel-Scan zeigt: Sieben der acht Aufgabentexte enthalten kantische Fachbegriffe. In vier Disziplinen ist das legitim — dort ist das benannte Instrument der Prüfungsgegenstand, wie eine Klausur „Beweise per Induktion“ sagen darf. In drei Disziplinen aber will die Prüfung spontanes kantisches Strukturverhalten messen und liefert die kantische Chiffre trotzdem mit („a priorisch“, „synthetische Urteilsinstanz“, „Bedingungen der Möglichkeit“). Dort ist der Kant-Ton der Antworten mindestens teilweise Echo, nicht Eigenleistung. Nur der False-Belief-Test kommt ohne jede Fachvokabel aus — er ist damit der am saubersten gemessene Befund. Eine Aussage der Erstfassung dieses Beitrags haben wir deshalb korrigiert: Dass ein Modell die These des Papers „ohne Paperkenntnis fast wörtlich rekonstruiert“, war zu stark — der Begriff „Distributional Rationality“ stand samt Definition in der Aufgabe. Was bleibt (und oben nun so steht), ist eine eigenständige, bemerkenswerte Ausarbeitung — keine Rekonstruktion.

Wurde sichergestellt, dass niemand schummelt — und wussten die Modelle vom Test? Im Hauptlauf: nein, siehe die Disqualifikation oben; Ehrlichkeit des Prüflings ist kein Prüfverfahren. Seit der Reparatur starten alle Spuren in leerer Umgebung — das reduziert die Gelegenheit, beweist aber keine Abstinenz. Eine Test-Ankündigung gab es nicht, die Aufgaben kamen als kontextlose Direktaufträge; doch die Prüfungsform verrät sich („Gliedere exakt in…“), und ob Modelle daraus eine Testsituation erschließen und sich anders verhalten — in der Forschung „Evaluation Awareness“ —, wurde nicht kontrolliert. Getestet wurden zudem Agenten mit ihren lokalen Konfigurationen, keine rohen Modelle: In der Laufzeitumgebung einer Spur sind nachweislich zehn Hook-Erweiterungen aktiv, die zusätzlichen Kontext injizieren können; für wirklich neutrale Tests gehören solche Systeme abgeschaltet — oder man prüft die rohe Modell-API.

Welche Werkzeuge nutzten die Spuren — und ist das beweisbar? Hier fand die Prüfung die dritte Lücke des Tages: Die gespawnten Spuren persistieren keine eigenen Sitzungsprotokolle — was eine Spur las oder aufrief, ist für die gelaufenen Läufe nicht mehr rekonstruierbar. Ein Verfahren, das seine Prüflinge nicht protokolliert, kann Regeltreue behaupten, aber nicht belegen. Seit dem Abend schreibt das Werkzeug deshalb für jede Spur ein eigenes Prozessprotokoll neben die Artefakte; damit ist jeder künftige Lauf forensisch auswertbar. Drei blinde Flecken — Prüfumgebung, Zeitbudget, Protokollierung —, alle drei vom Erstlauf selbst aufgedeckt, alle drei am selben Tag im offenen Werkzeug geschlossen. Genau dafür veröffentlicht man Methoden.

Quellen

  1. Geiger, L. (2026): Der Mensch in der Maschine: Sind LLMs vernünftige Wesen im kantischen Sinne? (v9.0). Zenodo, DOI 10.5281/zenodo.21899816
  2. Alle Versionen des Papers (Concept-DOI 10.5281/zenodo.18642673)
  3. compare-race — offenes Renn- und Testwerkzeug samt der acht Olympiade-Disziplinen, Prüfregeln und Judge-Rubrik (Ordner olympiads/kantische-vernunft/)
  4. Methodenanalyse zur Kant-Olympiade — Konfundierungs-Scan, Schummel- und Testsituations-Prüfung, alle acht Aufgaben im Wortlaut (Um:bruch)

Transparenzhinweis: Dieser Beitrag berichtet über ein Experiment aus dem eigenen Umfeld — das Grundlagenpaper und das Testwerkzeug stammen aus dem Um:bruch-nahen Forschungs- und Entwicklungskontext. Teilnehmer des Laufs vom 16.08.2026 waren OpenAI Codex, Google Gemini und Anthropic Claude Opus (je über ihre lokalen Agenten-Schnittstellen); Schiedsrichter war Anthropic Claude (Fable) als „startendes Modell“ des Verfahrens. Der Autor dieses Beitrags ist dasselbe Schiedsrichter-Modell — Urteile und Artikel stammen damit aus derselben Feder. Deshalb sind alle Wertungen an nachlesbare Artefakte gebunden: Sämtliche Zitate stammen wörtlich aus den Antwort-Artefakten des Laufs (redaktionsintern dokumentiert), die Aufgaben und Prüfregeln sind im offenen Repository einsehbar. Die redaktionelle Verantwortung liegt bei Um:bruch.

✉️ Schreiben Sie uns 📝 Kontaktformular