ISTARIUM

CONTEXT Steuerung

4 Kennzahlen, an denen sich ein KI-Vorhaben steuern lässt

Nutzung, Ersparnis, Qualität, Kosten. Was jede Zahl vorgibt zu messen, woran sie beim naiven Ablesen scheitert, und wie wir sie im AIEE-Programm erheben.

Michael Mai

Viele Unternehmen arbeiten mit KI, ohne sagen zu können, was sie bringt. 4 grobe Zahlen schließen diese Lücke: Nutzung, Ersparnis, Qualität, Kosten. Entscheidend ist dabei, wie man sie erhebt. Nutzung heißt mehr als Anmeldungen zu zählen. Interessant ist, wie oft ein Gespräch mit der KI hin und her geht, bis etwas fertig ist. Viele Durchgänge sind dabei kein Beweis für Nutzen, sondern oft ein Zeichen für Mühe. Bei der Ersparnis gilt: 20 Minuten mal 20 Vorgänge sind keine eingesparte Stelle. Gewonnene Zeit ist zunächst verstreute Zeit. Sie zählt erst, wenn jemand entscheidet, wofür sie verwendet wird. Dafür gibt es genau 2 Richtungen: weniger Kosten oder mehr Umsatz. Qualität zeigt sich weniger am einzelnen Fehler als an dem Fehler, der zum zweiten Mal auftritt. Und Kosten muss man je Arbeitsschritt sehen, sonst findet man den teuren Schritt nie. Wer diese Fragen vor dem Start stellt, kann ein KI-Vorhaben später an Zahlen führen.

Der Einsatz von KI im Unternehmen ist an dem Punkt angekommen, an dem sich die Frage nach dem Ertrag stellen lässt. Das ist eine gute Nachricht: Wo gemessen wird, lässt sich auch verhandeln und nachsteuern. Eine aktuelle weltweite Befragung* unter rund 1.700 Führungskräften zeigt zugleich, wo die Gelegenheit liegt: 37 Prozent der Unternehmen berichten überhaupt einen positiven Beitrag von KI zum Betriebsergebnis. Die übrigen arbeiten mit der Technik, ohne ihren Beitrag beziffern zu können. Genau diese Lücke lässt sich mit 4 Zahlen schließen, die jeder Betrieb ohne eigenes Projekt erheben kann.

Warum fällt das Beziffern so schwer? Der Grund liegt selten in der Technik. Ein KI-Werkzeug liefert seine Ergebnisse zuverlässig. Es fehlt jemand, der mitschreibt, was es bringt und was es kostet. In jedem anderen Bereich ist dieses Mitschreiben selbstverständlich: Zählerstände für Strom, Gas und Wasser werden abgelesen und verglichen. Dafür beauftragt niemand ein Projekt. Es geht schnell, weil man sich vorher auf wenige Zähler geeinigt hat und immer dieselben abliest. Ein KI-Vorhaben verträgt dieselbe Behandlung.

4 Größen reichen dafür aus, und sie sind bewusst grob: Nutzung, Ersparnis, Qualität, Kosten. Eine Zahl, die sich jeden Monat nebenbei ablesen lässt, ist mehr wert als eine Kennzahl mit eigener Auswertung. Das ist unsere Position und kein Standard: Es gibt bislang kein Rahmenwerk und keine Studie, die genau diese 4 Größen als ausreichend ausweisen. Sie stammen aus der Beobachtung, welche Zahlen in Betrieben ein Jahr lang durchgehalten werden.

Über die 4 Zahlen zu reden ist jedoch das eine, sie zu erheben das andere. Deshalb bekommt hier jede Größe denselben Dreischritt: was sie vorgibt zu messen, woran sie beim naiven Ablesen scheitert, und wie wir sie im AIEE-Programm erheben.

1. Nutzung

Wie viele Menschen benutzen die Sache freiwillig, und wie oft? Diese Zahl ist schwerer schönzureden als die anderen 3, allerdings unter einer Bedingung: Gezählt werden müssen tatsächliche Arbeitsvorgänge, also abgeschlossene Angebote, bearbeitete Reklamationen, erzeugte Prüfberichte. Die Anzahl vergebener Lizenzen oder täglicher Anmeldungen ist hierfür nicht nutzbar. Logins zählen heißt Parkplätze zählen statt Fahrten. Der Bericht The GenAI Divide des MIT-Projekts NANDA aus dem Jahr 2025 macht den Unterschied zwischen erfolgreichen und erfolglosen Vorhaben genau daran fest: Die Vorhaben mit Ertrag maßen Veränderungen im Arbeitsablauf, die anderen meldeten die Zahl der ausgegebenen Lizenzen.

Ein Werkzeug, das nach 8 Wochen von 3 der 40 vorgesehenen Personen benutzt wird, hat ein Problem. Das gilt unabhängig davon, wie gut es funktioniert. Ein häufiger Grund dafür ist zugleich der unangenehmste: Das Werkzeug löst eine Aufgabe, die niemand als drängend empfindet. In den Erhebungen steht jedoch ein anderer Grund weiter vorn, nämlich der Bruch im Arbeitsablauf. Wer für 3 Handgriffe das Programm wechseln und Daten von Hand herüberkopieren muss, lässt es nach der dritten Woche bleiben.

Wie wir Nutzung im AIEE-Programm erheben

Jeder Teilnehmer arbeitet auf einer eigenen Serverumgebung, und die Nutzung dieser Umgebung lässt sich zählen. Angesehen werden 4 Größen:

  • Turns je Sitzung. Ein Turn ist ein Zug im Gespräch mit der KI: eine Anweisung und die Antwort darauf. Die Frage dahinter lautet, wie oft ein Gespräch hin und her geht, bis etwas fertig ist.
  • Anfragen je Woche und Teilnehmer. Sie zeigen, ob das Werkzeug im Arbeitsrhythmus liegt oder in einzelnen Schüben benutzt wird.
  • Verbrauchte Tokens. Ein Token ist die Abrechnungseinheit, in der ein Modell Text misst, ungefähr ein Wortteil. Die Zahl sagt, wie viel Text tatsächlich durch das Werkzeug gelaufen ist.
  • Wiederholungsschleifen. Sie zeigen, wie oft dieselbe Sache neu angefasst wird, bis sie steht.

Hier liegt der Kniff dieser Kennzahl: Viele Turns sind kein Nutzungsbeweis. Sie sind häufig ein Qualitätsproblem, weil jemand 9-mal nachfassen musste. Dieselbe Rohzahl zeigt je nach Blickwinkel Erfolg oder Mühe. Deshalb steht neben jeder Nutzungszahl die Frage, ob am Ende ein brauchbares Arbeitsergebnis herauskam. Wer beides nebeneinander liest, erkennt früh, worüber zu reden ist: über den Zuschnitt der Aufgabe oder über den Einbau in den Ablauf.

2. Ersparnis

Wie viel Zeit spart ein Durchgang, mal wie oft er vorkommt? Die zweite Hälfte der Frage entscheidet alles. Eine Ersparnis von 20 Minuten bei einem Vorgang, der 2-mal im Monat anfällt, bleibt eine Anekdote. Gerechnet an einem Beispiel sieht der andere Fall so aus: Ein Vorgang fällt 20-mal am Tag an und spart jedes Mal 20 Minuten. Das ergibt 400 Minuten am Tag oder 6 Stunden und 40 Minuten.

Und genau hier beginnt der Denkfehler. 400 Minuten am Tag sind keine Stelle. Sie sind 20 Minuten mal 20 Vorgänge, verteilt über mehrere Menschen und über den ganzen Tag. Gewonnene Zeit ist zunächst verstreute Zeit. Sie zählt erst, wenn sie gebündelt und bewusst umgewidmet wird. Sonst verdampft sie im Tagesgeschäft.

Umgewidmet werden kann sie in genau 2 Richtungen: weniger Kosten oder mehr Umsatz. Alles andere ist eine Zwischenstation. Die eigentliche Frage lautet deshalb weniger „wie viel sparen wir" als „was tun die Leute mit der gewonnenen Zeit, und wie reduzieren wir dadurch Kosten oder schaffen Umsatz für das Unternehmen".

Wie wir Ersparnis im AIEE-Programm erheben

Am Anfang steht der Vergleichswert, also die Dauer vor dem Start. Er wird einmal gemessen, so grob er auch sein mag. Wer ihn erst hinterher erhebt, bekommt die Antwort, die zum gewünschten Ergebnis passt. Beim Einzug in eine Halle liest jeder den Zählerstand ab. Bei KI-Vorhaben wird derselbe Handgriff regelmäßig übersprungen.

Festmachen lässt sich die Ersparnis an Vorgängen, die jeder im Betrieb kennt:

  • ein Angebot geht am selben Tag hinaus statt am dritten;
  • ein Vorgang läuft ohne Zwischenstopp durch, weil die Rückfrage entfällt;
  • eine Auswertung entsteht ohne Zuarbeit aus einer anderen Abteilung.

Dazu gehört die zweite Hälfte der Erhebung, und sie ist die unbequemere: Wofür wurde die gewonnene Zeit verwendet, und wer hat darüber entschieden? Eine Ersparnis ohne Antwort auf diese Frage bleibt eine Rechnung auf dem Papier. Eine Ersparnis mit Antwort ist eine Entscheidung über Kosten oder Umsatz.

3. Qualität

Wie oft muss ein Mensch das Ergebnis nachbessern, und wie tief? Die Nacharbeitsquote ist der Anteil der Ergebnisse, an denen jemand noch Hand anlegt. Diese Größe ist die einzige der 4, die laufend Aufmerksamkeit kostet. Sie ist es wert: Nutzung und Kosten zeigen erst im Rückblick an, dass etwas schiefläuft. Die Qualität zeigt es, während es passiert.

Eine steigende Nacharbeitsquote bei gleichbleibender Nutzung hat mehrere mögliche Ursachen, und die Unterscheidung lohnt sich. Erstens kann sich die Aufgabe verändert haben, während das Werkzeug hinterherhinkt. Zweitens kann sich das Modell verändert haben. Modell heißt hier das aus Daten trainierte Programm, das die Ergebnisse erzeugt. Dass ein einmal trainiertes Modell an Güte verliert, sobald sich die eingehenden Daten ändern, ist untersucht. Eine Arbeit in Scientific Reports prüfte 2022 insgesamt 128 Kombinationen aus Modell und Datensatz aus 4 Bereichen und fand in 91 Prozent der Fälle eine Verschlechterung über die Zeit. Dazu kommt, dass Anbieter die Version ihres Modells im laufenden Betrieb austauschen. Drittens kann es an den Anwendern liegen: Nach der Anfangsphase trauen sie dem Werkzeug die schwierigeren Fälle zu.

Wie wir Qualität im AIEE-Programm erheben

In unserer eigenen Umgebung entsteht Qualität an derselben Stelle wie im Betrieb: bei der Arbeit mit einem Werkzeug, das etwas herstellt. Angesehen werden 3 Größen:

  • Nacharbeitsquote. Wie oft muss ein Ergebnis neu angefordert werden, bis es taugt.
  • Wiederkehrende Korrektur. Derselbe Fehler zum zweiten Mal. Das ist die teuerste Zahl von allen, weil sie zeigt, dass die Anleitungsdatei nicht greift. Die Anleitungsdatei ist die Datei, in der die dauerhaften Regeln für die Zusammenarbeit mit der KI stehen.
  • Selbstfund. Wie oft die KI einen eigenen Fehler findet, bevor ein Mensch ihn sieht. Das ist die einzige der 3, die steigen darf.

Ein Fehler, der einmal passiert, ist normal. Ein Fehler, der wiederkehrt, ist ein Konstruktionsfehler. Er sitzt selten im Modell und meist in der Anleitung.

Dazu kommt ein Punkt, der selten gesagt wird: Jedes erneute Anfassen erzeugt neue Fehlerrisiken. Wer ein Ergebnis zum 4. Mal überarbeiten lässt, bekommt 4 Gelegenheiten für einen neuen Fehler dazu. Ab einem gewissen Grad ist Nachbessern keine Qualitätssicherung mehr, sondern das Gegenteil. Der Wert dieser Zahlen liegt darin, den Punkt zu erkennen, bevor ihn ein Kunde bemerkt.

4. Kosten

Was kostet der Betrieb im Monat, alles zusammen? In die Aufstellung gehören 4 Posten: Modellaufrufe, Server, Lizenzen und die Arbeitszeit für die Pflege. Ein Modellaufruf ist jede einzelne Anfrage an das Programm, abgerechnet meist nach der verarbeiteten Textmenge. Der letzte Posten fehlt in den meisten Aufstellungen und wird regelmäßig unterschätzt. Pflege heißt hier: Vorlagen anpassen, Fehlern nachgehen, neue Fälle einarbeiten, Nutzer begleiten.

Sichtbar ist im Regelfall nur die eine Hälfte. Implementierungskosten sieht jeder: Beratung, Programmierung, Hardware, Mieten für Rechenleistung aus der Cloud. Die laufenden Kosten sieht niemand, bis die Rechnung kommt. Dann fällt auf, dass ein erheblicher Betrag an KI- und Cloud-Anbieter geflossen ist. Und dann fehlt die Zuordnung: welches System, welche Anwendung, welcher Prozess, welcher einzelne Arbeitsschritt. Dazu kommt eine unangenehme Eigenschaft dieser Zahl: Wo nach Nutzung abgerechnet wird, wächst sie mit dem Erfolg.

Wie wir Kosten im AIEE-Programm erheben

Daraus folgt eine Anforderung an den Bau eines KI-Vorhabens, und sie hat 2 Teile. Ein Vorhaben muss nachvollziehbar sein und änderbar.

  • Nachvollziehbar heißt: Die Kosten sind je Arbeitsschritt sichtbar. Wer sie nur als Monatssumme kennt, findet den teuren Schritt nie.
  • Änderbar heißt: Der teure Schritt lässt sich austauschen. Dafür gibt es 3 Wege: ein anderes Modell, ein besseres Handling des Kontexts, oder ein Skript an der Stelle, an der gar kein Modell nötig war.

Kontext heißt hier die Textmenge, die ein Modell bei jeder Anfrage mitliest. Sie wächst im Betrieb schnell, und bezahlt wird sie bei jedem Aufruf erneut. Genau deshalb steht die Kostenzahl neben der Nutzung und nicht in einer eigenen Tabelle: Erst das Verhältnis der beiden sagt, ob aus Zuspruch auch Wirtschaftlichkeit wird.

Was die 4 zusammen ergeben

Einzeln sagt jede Zahl wenig, nebeneinander sagen sie viel. Hohe Nutzung bei steigenden Kosten und fallender Qualität ist ein anderes Bild als niedrige Nutzung bei glänzenden Einzelergebnissen. Das erste Bild verlangt eine Entscheidung über Geld: Der Zuschnitt stimmt, der Preis gehört verhandelt oder die Technik gewechselt. Das zweite verlangt eine Entscheidung über die Aufgabe.

Der naheliegende Einwand lautet, 4 grobe Zahlen seien zu wenig für eine Entscheidung über 6-stellige Beträge. Er hat etwas für sich: Eine saubere Wirtschaftlichkeitsrechnung sieht anders aus. Sie setzt jedoch voraus, dass jemand sie erstellt und wiederholt. Eine grobe Zahl, die 12 Monate lang jeden Monat vorliegt, schlägt eine genaue aus 2 Erhebungen. Wer später eine feinere Rechnung braucht, hat mit den 4 Werten bereits die Reihe, auf der sie aufsetzt.

Der Nutzen liegt dabei auf beiden Seiten des Tisches. Die Geschäftsführung bekommt eine Grundlage, auf der sich ein Vorhaben verlängern oder beenden lässt. Die Abteilung bekommt Zahlen, mit denen sie ihren Erfolg belegen kann. Und ein Anbieter, der diese 4 Zahlen von sich aus mitliefert, steht in der nächsten Verhandlung mit dem stärkeren Argument da.

Die 4 Kennzahlen im AIEE-Programm

Zusammengezogen sieht die Erhebung so aus:

  1. Nutzung: Turns je Sitzung, Anfragen je Woche und Teilnehmer, verbrauchte Tokens, Wiederholungsschleifen. Angenommen, dieselbe Auswertung braucht bei einem Teilnehmer 40 Turns und bei einem anderen 6: dann ist die erste Zahl ein Hinweis auf Mühe und die zweite einer auf Übung.
  2. Ersparnis: Dauer vor dem Start, Dauer danach, Häufigkeit des Vorgangs, Entscheidung über die gewonnene Zeit. Beispiel: Ein Angebot geht am selben Tag hinaus statt am dritten und verkürzt damit die Zeit bis zur Antwort des Kunden.
  3. Qualität: Nacharbeitsquote, wiederkehrende Korrektur, Selbstfund. Beispiel: Derselbe Formatfehler in 3 Ergebnissen hintereinander ist ein Auftrag an die Anleitungsdatei und keiner an den Teilnehmer.
  4. Kosten: Kosten je Arbeitsschritt, Kosten je Vorgang, Anteil der Pflege. Beispiel: Ein Schritt, der bei jedem Aufruf denselben langen Text mitliest, ist der erste Kandidat für einen Austausch.

Dazu gehört ein ehrlicher Satz: In echten Projekten wird diese Erhebung bis heute selten von Anfang an eingeplant. Sie kommt meist dann auf den Tisch, wenn die Rechnung überrascht. Mit steigenden Kosten wächst jedoch der Druck, und das gilt besonders für die Server. Mit dem Druck wachsen Anspruch und Anforderung.

Genau dort setzt AIEE an. Das Programm beginnt weniger bei der Frage, welches Modell man nimmt, als bei den Fragen vor dem Start: Was wird gezählt, wogegen wird verglichen, und wie wird die gewonnene Zeit genutzt? Wer diese Fragen früh stellt, hat später Steuerung und Transparenz. Wer sie später stellt, hat eine Rechnung.

* Zum Stand der Quellen: Die 37 Prozent stammen aus der weltweiten Erhebung The State of AI in 2026 der Unternehmensberatung McKinsey. Befragt wurden 1.719 Personen in 97 Ländern zwischen dem 4. Mai und dem 8. Juni 2026. Es handelt sich um Selbstauskünfte von Führungskräften und nicht um geprüfte Geschäftszahlen. Eine gesonderte Auswertung für Deutschland vom September 2026 weist aus, dass 43 Prozent der befragten Unternehmen mit KI-Einsatz den Beitrag zum Betriebsergebnis nicht beziffern können; diese Zahl steht in der deutschen Auswertung und nicht im weltweiten Bericht. Der Bericht „The GenAI Divide" des MIT-Projekts NANDA von 2025 liegt ohne dauerhafte offizielle Adresse vor und wird deshalb ohne Link genannt. Die Arbeit in Scientific Reports untersuchte klassische Lernverfahren auf Tabellendaten und keine Sprachmodelle; sie belegt das Muster der Modellalterung und nicht dessen Ausmaß bei heutigen KI-Assistenten. Zu den Kostenanteilen einzelner Posten liegen belastbare unabhängige Zahlen bislang nicht vor. Die statistische Erhebung im Programm richtet sich nach § 16 (4) der Teilnahmebedingungen; Inhalte der Eingaben und Arbeitsergebnisse werden dafür ausdrücklich nicht ausgewertet. Die Auswahl gerade dieser 4 Kennzahlen ist unsere Einschätzung: Die einzelnen Befunde zu Nutzungsmessung, Modellalterung und Abrechnungsmodellen sind belegt, ihre Zusammenfassung zu genau 4 Größen ist es nicht.

CONTEXT ist die Artikelreihe von AI Enabled Executive (AIEE), dem KI-Praxisprogramm der ISTARIUM Consulting Group. Hier wird eingeordnet, damit Sie selbst entscheiden können.

Irrtum und Änderungen vorbehalten. Dieser Artikel dient der Information und stellt keine Rechtsberatung dar. Er ist in Zusammenarbeit mit KI entstanden und wurde redaktionell geprüft.

Alle Artikel ›

Platz verbindlich sichern

AI Enabled Executive

Wir ziehen die Rechnungsinformationen aus dem Impressum.

 AGB & Teilnahmebedingungen (PDF)

Teilnehmer-Login

Ihre Teilnehmernummer steht in Ihrer Willkommens-E-Mail.

Die Anmeldung selbst erfolgt auf Ihrem eigenen KI-Server, nicht hier.

Dokumente

Unterlagen zu AI Enabled Executive als PDF.

Die Dateien werden als PDF geladen.