← Wissen

Einordnung

Was prüft ein zweites KI-Modell wirklich?

Zwei Modelle stimmen überein. Welche Fehler bleiben trotzdem bestehen? Eine Studie und eine fiktive Rechnung helfen, zusätzliche KI-Prüfungen vor dem Einkauf zu beurteilen.

Von Dr. Sven JungmannVeröffentlicht: · Geprüft:
Zwei Spiegel zeigen eine Birne; ein kleiner blauer Stein dahinter bleibt außerhalb ihrer Spiegelbilder.

Auf einen Blick

  • Der Nutzen einer zweiten KI-Prüfung lässt sich an entdeckten und durchgelassenen Fehlern beurteilen.
  • Der Anteil übersehener Fehler und die Fehlerquote unter freigegebenen Dokumenten haben unterschiedliche Bezugsgrößen.
  • Ein aussagekräftiger Vergleich erfasst auch unnötige Beanstandungen, ungeklärte Fälle und den Prüfaufwand.

Ein Unternehmen ergänzt ein zweites KI-Modell, das die Arbeit des ersten prüfen soll. Das eine verfasst eine Entscheidungsvorlage, das andere gibt sie frei. Für die Kaufentscheidung wird damit eine scheinbar einfache Frage entscheidend: Woran lässt sich erkennen, dass der zusätzliche Schritt folgenreiche Fehler entdeckt?

Angenommen, eine interne Investitionsvorlage verwechselt eine heutige Fähigkeit eines Anbieters mit einer Funktion, die erst für nächstes Jahr angekündigt ist. Zwei flüssig formulierte Darstellungen derselben falschen Annahme lassen die Entscheidung weiterhin angreifbar. Dieses Beispiel ist fiktiv. Für die Unternehmensleitung stellt sich die Frage, wie sie das Prüfverfahren vor seinem Einsatz untersuchen kann.

Was die Forschung tatsächlich misst

Kim und Kollegen untersuchten in ihrer ICML-Studie von 2025 im HELM-Datensatz 71 Modelle. Bei Fragen, die beide Modelle falsch beantworteten, wählten Modellpaare durchschnittlich in rund 60 Prozent dieselbe falsche Antwortoption. Dieser bedingte Befund aus Auswahlaufgaben erlaubt keine Fehlerprognose für betriebliche Dokumentenprüfungen oder heutige Modelle.[1]

Für eine Kaufentscheidung würde ich Übereinstimmung als Beobachtung behandeln, die weitere Prüfung verdient. Eine zweite Antwort kann nützliche Informationen ergänzen. Ihr Wert als Kontrolle hängt davon ab, welche Fehler sie entdeckt und welche sie passieren lässt. Die Zahl der Freigaben allein beantwortet diese Frage noch nicht.

Bei den freigegebenen Dokumenten anfangen

Betrachten wir eine ausdrücklich fiktive Prüfung von 100 Entscheidungsvorlagen. Fachkundige Prüfer:innen stellen anhand der zugrunde liegenden Unterlagen fest, dass 20 einen folgenreichen sachlichen Fehler enthalten. Das zweite Modell beanstandet 15 dieser fehlerhaften Vorlagen und zusätzlich fünf korrekte. Die übrigen 80 gibt es frei.

Damit haben fünf fehlerhafte Vorlagen die Prüfung bestanden. Das entspricht 25 Prozent der ursprünglichen Fehler, denn fünf geteilt durch 20 ergibt ein Viertel. Unter den 80 freigegebenen Vorlagen beträgt die Fehlerquote 6,25 Prozent, denn fünf geteilt durch 80 ergibt 0,0625. Diese Prozentwerte beantworten unterschiedliche Fragen. Keiner stammt aus der Studie.

Der Prüfschritt hat in diesem Beispiel relevante Fehler gefunden. Zugleich hat er 20 Vorlagen zur weiteren Bearbeitung zurückgegeben, darunter fünf korrekte. Ob sich das lohnt, hängt von den Folgen der verbliebenen Fehler und vom Aufwand zur Klärung der Beanstandungen ab. Weder die Zeitersparnis noch die Qualität einer anschließenden Korrektur wurden hier gemessen.

Die Rechnung erklärt auch, weshalb ein hoher Anteil an Freigaben täuschen kann. Ein System, das alles freigibt, erreicht 100 Prozent und entdeckt keinen einzigen Fehler. Zur Beurteilung gehört deshalb, was seine Freigabe übersteht.

Einen Prüfauftrag für die zusätzliche Kontrolle formulieren

Der freiwillige NIST-Rahmen für das KI-Risikomanagement, Version 1.0, sieht vor, Kontrollen zu bewerten und unter einsatznahen Bedingungen zu prüfen. Seine Vorgaben zur Messung umfassen auch die Dokumentation der Prüfmethoden und ihrer Grenzen. Das bietet einen sinnvollen Ausgangspunkt für die Bewertung des zusätzlichen Prüfschritts.[2]

Die folgende Übertragung ist mein methodischer Vorschlag. Für die Wirksamkeit genau dieses Vorgehens liegt hier keine eigene Untersuchung vor.

Zuerst wird festgelegt, welcher Fehler eine Entscheidung verändern würde. Bei einer Investitionsvorlage könnte das eine unbelegte Umsatzangabe, eine falsch datierte Fähigkeit oder eine ausgelassene Einschränkung sein. Folgenreiche Fehler werden getrennt von sprachlichen Vorlieben erfasst. Eine benannte Person verantwortet diese Definition.

Dann werden Fälle zusammengestellt, für die geeignete Prüfer:innen anhand maßgeblicher Unterlagen Referenzantworten bestimmen können. Offene Meinungsverschiedenheiten bleiben sichtbar, statt in eine erzwungene Richtig-oder-falsch-Zuordnung zu verschwinden. Gewöhnliche Fälle gehören ebenso dazu wie plausible Ausnahmen, etwa widersprüchliche Dokumentfassungen. Die Nähe zur vorgesehenen Arbeit wird dokumentiert.

Anschließend wird das tatsächliche Verfahren geprüft. Modellfassungen, Anweisungen und verfügbare Quellen bleiben konstant. Es wird festgehalten, ob das Prüfmodell die erste Antwort sofort sieht oder zunächst die Belege untersucht. Ergebnisse mit und ohne zusätzliche Kontrolle werden an denselben Fällen verglichen. Eine Änderung des Verfahrens ergibt eine andere Prüfung.

Der Bericht enthält die Fallzahlen hinter den Prozentwerten: entdeckte Fehler, durchgelassene Fehler, beanstandete korrekte Dokumente und ungeklärte Fälle. Hinzu kommen der Anteil freigegebener Dokumente, die Schwere der Fehler und der Prüfaufwand. Eine kleine Prüfung ohne beobachtete Fehler lässt Unsicherheit über seltene Fehler bestehen; sie erteilt keinen allgemeinen Sicherheitsnachweis.

Schließlich bleiben neue Fälle für die Bewertung nach der Entwicklung zurück. Ändern sich Modelle, Dokumente oder Aufgaben, folgt eine erneute Prüfung. Ein gutes Ergebnis trägt eine begrenzte Entscheidung über das untersuchte Verfahren.

Als Gründer von aiomics hilft mir diese Betrachtung, die Führungsfrage zu präzisieren: Wer legt fest, welcher verbleibende Fehler akzeptabel ist, und welche Belege betrachtet diese Person? Im nächsten Beschaffungsgespräch lässt sich ein Vergleich auf Fallebene anfordern: Was hat die zweite Prüfung entdeckt, was hat sie übersehen und welche zusätzliche Arbeit haben ihre Beanstandungen verursacht?

Quellen und weiterführende Lektüre

  1. Kim: ModellfehlerPMLR

    Bedingte Übereinstimmung.

  2. NIST: Risikomanagement, Version 1.0NIST

    Bewertung von Kontrollen.

Ausgangspunkt dieser Einordnung

Kim: Modellfehler

Perspektive und Interessen

Dieser Beitrag wurde mit KI-Unterstützung erarbeitet. Beide Unternehmensbeispiele und sämtliche Zahlen des Rechenbeispiels sind fiktiv. Das vorgeschlagene Prüfverfahren ist eine eigene methodische Ableitung; seine Wirksamkeit wurde hier nicht untersucht.

Ich bin Gründer und Geschäftsführer von aiomics und habe ein wirtschaftliches Interesse an verantwortlicher KI-Einführung in der Medizin.

Weiterlesen

Worum soll es bei Ihrer Veranstaltung gehen?

Nennen Sie Publikum, Anlass und Termin. Im Vorgespräch klären wir, welche Veränderungen Ihre Organisation beschäftigen und was der Vortrag dazu beitragen soll.

Vortrag anfragen