ISTARIUM

CONTEXT Urteilsfähigkeit

Urteilsfähigkeit kommt aus Wiederholung, nicht aus Information

Erfahrene Entscheider bewerten einen Plan in Minuten. Bei KI-Vorhaben bleibt dieser Reflex aus, und die Forschung nennt die Bedingungen, unter denen er überhaupt entsteht.

Michael Mai

Eine erfahrene Geschäftsführerin sieht einem Plan in Minuten an, wo er reißen wird. Warum bleibt dieser Reflex ausgerechnet bei Vorhaben mit künstlicher Intelligenz aus? Und woraus entsteht so ein Urteil überhaupt?

Die Forschung nennt zwei Bedingungen: eine Umgebung, die immer wieder dieselben Anzeichen liefert, und viele eigene Durchläufe mit schneller Rückmeldung. Bei KI ist heute beides schwach erfüllt. Was voriges Jahr ein gültiges Anzeichen war, taugt heute nicht mehr. Und ob sich eine Investition gelohnt hat, sagen selbst die Beteiligten kaum eindeutig. Es fehlt also Übung und nicht Verstand.

Unbequem ist der Rest. Ein tragendes und ein haltloses Bauchgefühl fühlen sich gleich an. Dass Schulung das Urteil über solche Vorhaben verbessert, ist für Führungskräfte bisher nirgends belegt, und eine kurze Einführung half im größten Versuch dazu nichts.

Wie holt man dann nach, was anderswo über Jahre nebenbei entsteht?

Eine erfahrene Geschäftsführerin sieht einem Plan in Minuten an, wo er reißen wird. Warum bleibt dieses Urteil ausgerechnet bei KI-Vorhaben aus? Woraus entsteht es überhaupt, und lässt es sich nachholen? Die Forschung gibt darauf eine unbequeme Antwort. Verlässliches Bauchgefühl braucht zweierlei: eine Umgebung, die immer wieder dieselben Anzeichen liefert, und viele eigene Durchläufe mit schneller Rückmeldung. Bei KI ist heute beides schwach erfüllt, und deshalb schweigt der Reflex, der sonst trägt. Darin steckt die gute Nachricht: Hier fehlt Übung und kein Verstand. Was also hilft, solange die Erfahrung fehlt?

Was uns in Projektgesprächen auffällt

Eine Meisterin hört an der Maschine, dass ein Lager bald ausfällt. Das Messgerät zeigt zu diesem Zeitpunkt noch nichts an. Sie hat dieses Geräusch über Jahre oft gehört und jedes Mal erlebt, was danach kam. Genau dieses Geräusch ist das Thema dieses Artikels, und bei KI-Vorhaben fehlt es bisher.

In Gesprächen mit Geschäftsführern und Bereichsleitern begegnet uns ein wiederkehrendes Muster. Bei Themen, die sie seit Jahren verantworten, urteilen sie in Sekunden: das kann grundsätzlich nicht sein, das ergibt keinen Sinn, hier sehe ich ein Risiko. Bei KI kommt dieses Urteil zögerlich oder gar nicht. Was möglich ist, was Sinn ergibt, wo ein Risiko entsteht und wo keines: die Antworten bleiben offen.

Die Gründe, die uns dabei genannt werden, stehen gleichberechtigt nebeneinander:

  • das Feld ist neu und bewegt sich zu schnell
  • Zugangsängste und Ressentiments bzgl. KI
  • fehlende Informationsfilter
  • die fehlende Zeit, sich selbst damit zu beschäftigen

Das ist eine Beobachtung aus unseren Gesprächen. Sie führt auf die Frage, um die es hier geht: Woraus entsteht ein belastbares Urteil?

Bauchgefühl ist Wiedererkennen

In Entscheidungskreisen heißt die Sache Urteilsfähigkeit oder Kritikfähigkeit: etwas bewerten können, ohne tief einzutauchen. Die Forschung ist weniger romantisch.

Gary Klein hat ab 1985 untersucht, wie erfahrene Fachleute unter Zeitdruck entscheiden. Er begleitete Feuerwehr-Einsatzleiter, Rettungssanitäter und Piloten bei der Arbeit und ließ sie ihre Einsätze Schritt für Schritt nacherzählen. In der bekanntesten dieser Untersuchungen befragte er 26 Einsatzleiter mit durchschnittlich 23 Jahren Erfahrung. Bei weniger als 12 Prozent der Entscheidungspunkte fand sich überhaupt eine Abwägung zwischen zwei Möglichkeiten. Der Erfahrene vergleicht also so gut wie nie Optionen. Er erkennt ein Muster wieder. Mit dem Muster kommen die passenden Anzeichen und die erste plausible Handlung gleich mit, und die spielt er im Kopf einmal durch.

Die verbreitetste Definition stammt von Herbert Simon (1992). Daniel Kahneman und Gary Klein haben sie gemeinsam unterschrieben: Eine Situation liefert ein Anzeichen, dieses Anzeichen öffnet dem Fachmann den Zugang zu Gespeichertem, und daraus ergibt sich die Antwort. „Intuition ist nicht mehr und nicht weniger als Wiedererkennen." Die beiden fügen an: das entzaubere die Intuition, Magie sei keine im Spiel.

Darin steckt die gute und die schlechte Nachricht zugleich. Bauchgefühl ist Erfahrung in verdichteter Form. Wo die Erfahrung fehlt, fehlt auch das Muster. Der Vorteil daran: Erfahrung lässt sich beschaffen.

Zwei Bedingungen, und beide müssen erfüllt sein

Kahneman und Klein standen jahrelang für gegensätzliche Schulen. Der eine erforschte das schnelle Urteil als Quelle systematischer Fehler, der andere als Leistung von Könnern. 2009 setzten sie sich zusammen und schrieben in einer gemeinsamen Arbeit auf, worauf sie sich einigen konnten.

Gemeinsame Arbeiten von erklärten Gegnern sind selten, weil sie beiden Seiten Zugeständnisse abverlangen. Genau das macht sie belastbar und was geschrieben steht, hat die Prüfung aus zwei entgegengesetzten Richtungen überstanden. Sie ordnet vorhandene Forschung und zieht daraus einen gemeinsamen Schluss.

Ihr Ausgangspunkt lautet: fachliche Intuition sei manchmal großartig und manchmal fehlerhaft. Die eigentliche Frage ist damit, wann welches von beidem gilt. Ihre Antwort nennt zwei Bedingungen:

  1. Die Umgebung muss brauchbare Anzeichen liefern. Ein Anzeichen ist ein wahrnehmbares Signal, das etwas über den weiteren Verlauf verrät: der Klang eines Lagers, der Tonfall eines Kunden, die Zahl im Wochenbericht. Zwischen dem Anzeichen und dem, was danach geschieht, muss ein stabiler Zusammenhang bestehen.
  2. Man muss Gelegenheit gehabt haben, diese Anzeichen zu lernen. Dazu gehören lange eigene Praxis und Rückmeldung, die schnell kommt und eindeutig ist. Wer erst nach 3 Jahren erfährt, ob seine Einschätzung richtig war, lernt daraus wenig.

Bei Feuerwehreinsätzen und bei vielen ärztlichen Aufgaben ist beides erfüllt. Dieselben Berufe führen die Autoren im selben Aufsatz jedoch auch auf der Gegenliste, für andere Aufgaben. Sie nennen das die Zerlegung des Könnens: Fachliche Sicherheit hängt an der einzelnen Aufgabe und nicht am Berufsstand. Eine Anästhesistin bekommt binnen Minuten Rückmeldung, eine Radiologin oft erst sehr viel später, und beide tragen denselben Doktortitel.

Die Auswahl einzelner Aktien und politische Langfristprognosen erfüllen die Bedingungen praktisch gar nicht, und dort ist das Bauchgefühl nach dieser Arbeit wertlos. Unsicherheit allein ist dabei kein Ausschlussgrund: Poker und Krieg führen die Autoren als Umgebungen an, die stabile Anzeichen liefern und trotzdem hochgradig unsicher sind. Fehlende Regelmäßigkeit ist das Problem, nicht das Risiko. Das ist die praktische Ausbeute dieses Abschnitts: Man kann einer Aufgabe ansehen, ob ein Bauchgefühl dazu überhaupt etwas taugen kann.

Wie KI in diesem Raster abschneidet

Legt man diese zwei Prüfpunkte an das Beurteilen von KI-Vorhaben an, fällt das Ergebnis dreimal ungünstig aus.

  1. Die Anzeichen sind instabil. Ein kontrollierter Feldversuch mit 758 Beratern fand eine ausgefranste Fähigkeitsgrenze. Ein Feldversuch ist ein Test im echten Arbeitsalltag: Die Teilnehmer werden per Los in zwei Gruppen geteilt, eine arbeitet mit dem neuen Werkzeug und eine ohne. Innerhalb der Grenze hob KI die Leistung deutlich, um 12,2 Prozent mehr erledigte Aufgaben bei 25,1 Prozent weniger Zeit. Bei einer Aufgabe, die bewusst außerhalb lag, kamen die KI-Nutzer 19 Prozentpunkte seltener zur richtigen Lösung als die Vergleichsgruppe. Man stelle sich einen Schlüssel vor, der bei einer Schraube perfekt greift und bei der Schraube daneben rundläuft, ohne dass man ihm das ansieht. Wo die Grenze verläuft, ist von außen schwer zu erkennen. Der Versuch wurde gemeinsam mit der Unternehmensberatung BCG und an deren eigenen Beratern durchgeführt, und 3 der 9 Autoren arbeiten dort.
  2. Die Umgebung bewegt sich. Im Jahr 2025 erschienen allein in den USA 59 nennenswerte KI-Modelle, in China 35. Ein Modell ist das Rechenwerk hinter einem KI-Werkzeug. Nennenswert heißt hier, dass die Zähler des AI Index es als bedeutsam eingestuft haben. Beim jeweils besten Modell stieg ein verbreiteter Prüfsatz von Programmieraufgaben binnen eines Jahres von etwa 60 auf über 90 Prozent. Solche Prüfsätze sind feste Aufgabensammlungen, an denen alle Modelle gemessen werden, vergleichbar mit einem Prüfstand in der Fertigung. Über alle 83 dort bewerteten Modelle lag der Wert im April 2026 jedoch bei 63,4 Prozent. Die Spitze rennt also, das Feld folgt langsamer. Was voriges Jahr ein gültiges Anzeichen war, taugt heute schon nicht mehr.
  3. Die Rückmeldung kommt spät und mehrdeutig. In der 29. CEO-Befragung von PwC sagten von 4.454 Vorstandsvorsitzenden 56 Prozent, ihre KI-Investitionen hätten binnen 12 Monaten weder den Umsatz erhöht noch die Kosten gesenkt. Nur 12 Prozent berichteten beides. Das sind Selbstauskünfte und keine Messung, und genau darin liegt der Punkt: Selbst die Beteiligten können den Erfolg kaum eindeutig zuordnen.

Damit liegt die Beurteilung von KI näher bei der Aktienauswahl als bei der Feuerwehr. Diese Einordnung ist unsere Schlussfolgerung aus drei Quellen und kein Satz von Kahneman und Klein. 2009 stellte sich die Frage in dieser Form noch nicht. Für die Praxis folgt daraus etwas Entlastendes: Wer bei KI unsicher urteilt, erlebt die absehbare Folge einer schwierigen Umgebung und kein persönliches Defizit.

Der unangenehme Teil

Das Bauchgefühl schweigt in so einer Lage leider nicht. Es meldet sich wie immer, nur eben unzuverlässig. Die beiden Autoren beschreiben den Fall ausdrücklich: Fachleute mit echtem Können in einem Bereich werden regelmäßig gebeten, in einem anderen zu urteilen. Die Grenze der eigenen Expertise sei schwer zu bestimmen, für die Fachleute selbst wie für ihre Beobachter.

Dazu kommt der für die Praxis wichtigste Satz der Arbeit: subjektive Sicherheit ist ein unzuverlässiger Hinweis darauf, ob ein intuitives Urteil belastbar ist. Ein getragenes und ein haltloses Bauchgefühl fühlen sich gleich an. Das ist der Grund, warum hier eine Regel hilft und kein Gespür.

Ein Experiment mit rund 500 Teilnehmern aus dem Oktober 2025 zeigt, wie das mit KI zusammenwirkt. Die Teilnehmer lösten Logikaufgaben, die eine Gruppe mit einem KI-Chat und die andere ohne. Beide Gruppen überschätzten ihre eigene Leistung. Bemerkenswert ist die Richtung: Sonst überschätzen sich gerade die Schwächeren am stärksten, ein seit Jahrzehnten bekannter Befund. Bei der Arbeit mit KI drehte sich das um. Am deutlichsten verschätzte sich, wer sich selbst für besonders KI-kundig hielt.

Was die Zahlen aus den Chefetagen hergeben

Hier wird die Quellenlage dünn, und das gehört dazugesagt. Brauchbare Zahlen stammen fast ausschließlich aus Eigenstudien von Beratungen und Verbänden. Eine davon wurde im Mai 2026 veröffentlicht und befragte 351 Vorstandsvorsitzende sowie 274 Mitglieder von Aufsichts- und Verwaltungsräten. In den meisten befragten Ländern gibt es statt des deutschen Aufsichtsrats einen einheitlichen Verwaltungsrat, in dem Leitung und Kontrolle zusammensitzen. Wann genau erhoben wurde, nennt die Veröffentlichung nicht.

Vier Ergebnisse stehen nebeneinander:

  • 75 Prozent der Ratsmitglieder halten ihr eigenes KI-Wissen für gleich gut oder besser als das ihrer Kollegen.
  • 63 Prozent der Vorstandsvorsitzenden meinen, die Gremien überschätzten, was KI leisten kann.
  • Rund 40 Prozent halten den Blick ihres Gremiums auf KI und Wachstumsstrategie für uninformiert.
  • 35 Prozent sehen die Gremien im Irrtum darüber, wie viel menschliche Arbeit KI ersetzen kann.

Gemessen ist damit zweierlei: Die Gremien sind mit ihrem eigenen Wissensstand zufrieden, und die Vorstandsvorsitzenden halten deren Bild von KI für zu optimistisch. Eine Aussage darüber, ob die Gremien sich selbst überschätzen, enthält die Befragung nicht. Der Unterschied ist wichtig genug, um ihn auszuschreiben: Das eine ist ein Urteil über die Technik, das andere wäre ein Urteil über die Person.

Objektiv nachzählbar ist allein die Ausgangslage. Eine Auswertung von The Conference Board zeigt für den S&P 500, den Index der 500 großen börsennotierten US-Unternehmen: Der Anteil der Direktoren mit ausgewiesener KI-Expertise stieg zwischen 2021 und 2025 von 1,5 auf 2,7 Prozent. Gezählt wird dabei, was die Unternehmen in ihren Pflichtunterlagen selbst angeben. Dem tatsächlich vorhandenen Wissen muss das nicht entsprechen. Zum Vergleich aus derselben Auswertung: Technologie-Expertise wuchs im selben Zeitraum von 20 auf 51 Prozent, Cybersicherheit von 15 auf 27 Prozent. Die Gremien haben also durchaus aufgerüstet, bei KI beginnt das gerade erst.

Die Beobachtung aus unseren Gesprächen belegen diese Zahlen nicht. Sie zeigen eine Lücke zwischen dem Bild der Gremien von sich selbst und dem Bild, das die Vorstandsvorsitzenden von ihnen haben. Eine akademische Erhebung zur Urteilssicherheit von Führungskräften speziell bei KI haben wir nicht gefunden, und diese Leerstelle ist selbst ein Ergebnis.

Warum die Unsicherheit selten ausgesprochen wird

Für diese Leerstelle gibt es eine Erklärung, und sie stammt wieder aus unseren Gesprächen. Über eigene Schwächen wird in Führungsrollen kaum geredet. In einer Position, in der Sicherheit erwartet wird, fragt niemand gern nach halb Verstandenem. Das gilt sogar in der Runde unter Gleichrangigen, denn auch dort läuft ein Wettbewerbsgedanke mit. Das Verhalten ist nachvollziehbar. Zugegebenes Nichtwissen ist in dieser Rolle teuer.

Daraus folgt zweierlei.

  1. Darauf kann niemand reagieren. Was unausgesprochen bleibt, lässt sich schwer bearbeiten. Es bleibt eine Dunkelziffer.
  2. Entschieden wird trotzdem. Jeden Tag, über Budgets, Vorhaben und Partner. Die Unsicherheit bleibt unsichtbar, die Entscheidungen sind es nicht.

Damit ist auch klar, warum sich dazu kaum etwas messen lässt. Eine Dunkelziffer ist ihrer Natur nach schwer erhebbar. Wer sein Nichtwissen für sich behält, taucht in keiner Befragung auf, die genau danach fragt. Sichtbar wird so etwas allein im Blick der anderen, und dort liegt der einzige Anhaltspunkt, den die Zahlen hergeben. Gemessen hat jene Befragung allerdings die Einschätzung von KI und nicht, wie offen jemand über eigene Unsicherheit spricht.

Woraus solches Urteil entsteht

Die Bedingung aus der Arbeit von 2009 ist unbequem: viel eigene Wiederholung plus Rückmeldung, die schnell kommt und eindeutig ist. Lesen erfüllt das nicht, Zuhören ebenso wenig. Vier Befunde füllen das aus, und jeder hat seine Grenze.

  • Eigene Durchläufe schlagen Zuschauen. Eine Auswertung von mehr als 6.500 Eingriffen bei 71 Herzchirurgen zeigt: aus eigenen Erfolgen lernt man mehr als aus eigenen Misserfolgen, aus fremden Misserfolgen mehr als aus fremden Erfolgen. Zuschauen taugt vor allem dafür, zu sehen, wie etwas schiefgeht. Die Autoren sind Kc, Staats und Gino.
  • Übungsumgebungen wirken messbar. Eine Zusammenfassung von 609 Studien aus der medizinischen Ausbildung findet starke Effekte von Simulation auf Wissen und Handgriffe. Eine solche Zusammenfassung rechnet die Ergebnisse vieler Einzelstudien zu einem Gesamtbild zusammen. Beim Ergebnis am Patienten fällt der Effekt kleiner aus, bleibt jedoch vorhanden. Verglichen wurde Simulation dabei mit gar keiner Ausbildungsmaßnahme. Ob Üben dem Lesen und Zuhören überlegen ist, sagt diese Arbeit deshalb nicht. Dieser Schluss stützt sich hier auf die Bedingung von 2009.
  • Treffsicherheit ist trainierbar. In einem mehrjährigen Prognoseturnier verbesserten kurzes Training und wiederholte Prognosen mit anschließender Auflösung die Treffsicherheit um 6 bis 11 Prozent. Auflösung heißt: Die Teilnehmer erfuhren jedes Mal, was tatsächlich eintrat. Das gelang bei geopolitischen Fragen mit einem Zeithorizont von Monaten bis rund einem Jahr. Für die Mehrjahres-Prognosen, die Kahneman und Klein als wertlos einstufen, ist damit nichts gezeigt.
  • Für schwache Umgebungen gibt es Werkzeuge. Beim Premortem nimmt das Team schon vor dem Start an, das Vorhaben sei gescheitert, und sammelt die Gründe dafür. Diese Blickrichtung erhöhte in einer Untersuchung von 1989 die Zahl der genannten Gründe um rund 30 Prozent. Die Autoren sind Mitchell, Russo und Pennington. Ob dabei auch die richtigen Gründe häufiger genannt werden, hat diese Untersuchung offen gelassen. Für die Sitzung bleibt der Wert dennoch: Mehr benannte Risiken sind mehr Risiken, über die gesprochen wird.

Für Führungskräfte und KI ist nichts davon belegt. Wir haben keine Studie gefunden, die zeigt, dass Training oder eigene Nutzung das Urteil über KI-Vorhaben verbessert. Der Schluss von Chirurgie und Prognoseturnier auf die Geschäftsleitung ist jedoch eine plausible Analogie. Im Beraterexperiment verhinderte eine kurze Einführung die Fehlleistung jenseits der Fähigkeitsgrenze zudem nicht. Kurzes Training ersetzt Erfahrung also nicht.

Was wir daraus machen

Genau dort setzt unser AI Enabled Executive Programm an. Es holt nach, was anderswo über Jahre nebenbei entsteht: eigene Durchläufe an einer KI-Arbeitsumgebung. Sie läuft auf einem abgeschotteten eigenen Server, auf dem Fehler folgenlos bleiben. Wiederholung und Rückmeldung innerhalb der Programmlaufzeit statt verteilt über Jahre. Es gilt dabei dieselbe Bedingung wie überall sonst, und die haben Kahneman und Klein aufgeschrieben. Das Geräusch der Maschine lernt man am Band und nicht im Handbuch.

Stand: 2026-09. Die zwei Bedingungen stammen aus einer Übersichts- und Konsensarbeit von Kahneman und Klein (American Psychologist, 2009) und beruhen auf einer Auswertung vorhandener Forschung statt auf einer eigenen Messung. Die Einordnung von KI als Umgebung mit schwachen Anzeichen ist unsere Schlussfolgerung daraus, gestützt auf das Beraterexperiment von Dell'Acqua und Kollegen (2023) und den AI Index 2026. Dieses Beraterexperiment wurde gemeinsam mit der Unternehmensberatung BCG und an deren Beratern durchgeführt, und 3 der 9 Autoren arbeiten dort; eine von BCG unabhängige Quelle ist es damit nicht. Die Befragungszahlen aus den Chefetagen (BCG, PwC) sind Eigenstudien von Akteuren mit eigenem Interesse und ohne Zufallsstichprobe. Die Zahlen von The Conference Board stammen dagegen aus der Auswertung veröffentlichter S&P-500-Pflichtunterlagen mit Stand Dezember 2025 und geben die ausgewiesene, nicht die tatsächliche Expertise wieder. Das Fehlen des Bauchgefühls bei KI ist eine Beobachtung aus unseren Projektgesprächen und keine Erhebung. Die Übertragung der Befunde zu Übung und Simulation auf Führungskräfte und KI ist eine Analogie, für die belastbare Evidenz fehlt.

CONTEXT ist die Artikelreihe von AI Enabled Executive (AIEE), dem KI-Praxisprogramm der ISTARIUM Consulting Group. Hier wird eingeordnet, damit Sie selbst entscheiden können.

Irrtum und Änderungen vorbehalten. Dieser Artikel dient der Information und stellt keine Rechtsberatung dar. Er ist in Zusammenarbeit mit KI entstanden und wurde redaktionell geprüft.

Alle Artikel ›

Platz verbindlich sichern

AI Enabled Executive

Wir ziehen die Rechnungsinformationen aus dem Impressum.

 AGB & Teilnahmebedingungen (PDF)

Teilnehmer-Login

Ihre Teilnehmernummer steht in Ihrer Willkommens-E-Mail.

Die Anmeldung selbst erfolgt auf Ihrem eigenen KI-Server, nicht hier.

Dokumente

Unterlagen zu AI Enabled Executive als PDF.

Die Dateien werden als PDF geladen.