KI-Qualität testen: So prüfst du deine KI richtig

Mit 30 echten Fällen und einer Tabelle wird aus Bauchgefühl eine Zahl, und du weißt, ob deine KI noch taugt

Danilo à Tellinghusen
Experte für Online Marketing, KI- & Prozessautomatisierung
October 8, 2026
Titelbild: KI-generiert

"Seit letzter Woche ist die KI schlechter geworden." Diesen Satz höre ich in Gesprächen mit KMU-Inhabern ziemlich oft. Meistens folgt darauf die Frage: Stimmt das überhaupt? Und genau da beginnt das Problem. Niemand kann es sagen, weil niemand je festgelegt hat, was "gut" bedeutet.

Du hast vielleicht einen KI-Assistenten, der Kundenanfragen vorbeantwortet, einen Chatbot auf der Website oder einen Workflow, der Angebote vorbereitet. Am Anfang sah alles prima aus. Aber ob das System heute genauso gut arbeitet wie vor drei Monaten, ob der neue Prompt wirklich besser ist oder ob der Anbieter im Hintergrund das Modell getauscht hat, entscheidet bei den meisten Firmen das Bauchgefühl. Und das Bauchgefühl liegt oft daneben.

In diesem Artikel zeige ich dir, wie du KI-Qualität messbar machst, ohne Programmierkenntnisse und ohne Budget. Du bekommst eine Anleitung, mit der du an einem Nachmittag dein erstes Prüfset baust, und du erfährst, welche Fallen dabei lauern.

1. Warum KI anders getestet werden muss als normale Software

Bei klassischer Software gilt: gleiche Eingabe, gleiches Ergebnis. Ein Taschenrechner rechnet 2 + 2 immer zu 4. Einmal testen reicht.

KI arbeitet anders. Sie schätzt Wahrscheinlichkeiten, und dieselbe Frage kann zweimal unterschiedlich beantwortet werden. Qualität ist deshalb keine Eigenschaft, die ein System hat oder nicht hat, sondern eine Quote. Die richtige Frage lautet nicht "Hat die KI diese eine Antwort richtig?", sondern "Bei wie vielen von 30 typischen Fällen liegt sie richtig?".

Lösung: Du testest nicht Einzelfälle, sondern ein festes Set an Fällen, immer wieder mit demselben Maßstab. In der Fachsprache heißt das Eval (von "Evaluation"). Merk dir das Bild: Der Eval ist für KI das, was die Stichprobenkontrolle für die Fertigung ist.

2. Der stille Serienfehler: Warum 4 Prozent mehr wehtun, als es klingt

Rechenbeispiel (hypothetisch): Angenommen, dein KI-Assistent beantwortet im Monat 1.000 Kundenanfragen und liegt bei 4 Prozent daneben. Das klingt nach einer guten Quote. Es sind aber 40 Kunden, die eine falsche Auskunft bekommen haben, vielleicht einen erfundenen Preis oder einen falschen Termin. Jeder einzelne Fehler fällt nicht auf. Zusammen kosten sie dich Vertrauen.

Ähnlich läuft es bei einem Prompt-Update. Du probierst den neuen Prompt an drei Beispielen aus, er sieht besser aus, du rollst ihn aus. Auf den anderen 50 Fällen, die du nie getestet hast, ist er vielleicht schlechter.

Besser: Jede Änderung, egal ob neuer Prompt, neues Modell oder neue Wissensbasis, läuft vor dem Ausrollen durch dasselbe Prüfset. Das dauert Minuten und ersetzt Meinung gegen Meinung durch eine Zahl.

3. Was ein Prüfset ist: das Golden Set

Ein Prüfset besteht aus drei Dingen: echten Fällen, einem Soll-Ergebnis pro Fall und einer Regel, ab wann etwas als bestanden gilt. Profis nennen es "Golden Set". Es ist weniger kompliziert, als es klingt.

Was hineingehört:

  • Typische Fälle: die Anfragen, die 80 Prozent deines Alltags ausmachen, aus echten Vorgängen gezogen und anonymisiert.
  • Schwere Fälle: mehrdeutige, sehr lange oder schlecht formulierte Anfragen.
  • Fallen: Fragen mit falscher Annahme, fehlenden Informationen oder dem Versuch, die KI auszutricksen (mehr dazu in meinem Artikel über Prompt Injection).
  • K.-o.-Kriterien: Dinge, die nie passieren dürfen, etwa Preise erfinden, Rechtsauskünfte geben oder interne Informationen verraten.

Tipp: 30 bis 50 Fälle reichen für ein KMU völlig aus. Wichtig ist nicht die Größe, sondern dass das Set fest, versioniert und ungeschönt ist. Wer nur die Fälle nimmt, bei denen die KI glänzt, belügt sich selbst.

4. Vier Arten, eine Antwort zu bewerten

Nicht jede Antwort lässt sich gleich prüfen. Du brauchst eine Mischung.

Exakte Checks. Hier prüft eine einfache Regel: Steht die Telefonnummer im richtigen Format da? Ist das Pflichtfeld ausgefüllt? Kommt ein verbotenes Wort vor? Das kostet praktisch nichts und ist knallhart zuverlässig.

Abgleich mit der Soll-Antwort. Du prüfst, ob die Schlüsselfakten in der Antwort stecken, etwa der korrekte Preis oder die Öffnungszeiten. Ideal für Antworten aus deinen eigenen Unterlagen.

KI als Prüfer. Ein zweites KI-Modell bewertet Ton, Vollständigkeit und Hilfsbereitschaft nach einer festen Bewertungstabelle. Das ist skalierbar und kostet bei 50 Fällen nur wenige Cent pro Durchlauf, hat aber Macken (dazu gleich mehr).

Mensch. Du oder eine Fachperson sichtet eine Stichprobe, möglichst ohne zu wissen, welche Version die Antwort erzeugt hat. Das ist dein Eichmaß für alles andere.

Wichtig: K.-o.-Fehler zählen vor jedem Durchschnitt. Ein System mit 95 Prozent Trefferquote, das einmal einen Preis erfindet, ist schlechter als eines mit 90 Prozent, das nie lügt. Ein einziger kritischer Fehler heißt: nicht ausrollen.

5. Der Richter mit Macken: KI als Prüfer richtig einsetzen

Eine KI, die eine andere KI benotet, ist praktisch, aber sie hat bekannte Schwächen:

  • Sie bewertet längere Antworten oft besser, auch wenn sie nur schwafeln.
  • Sie mag Antworten im Stil des eigenen Modells.
  • Bei Vergleichen gewinnt öfter die zuerst genannte Antwort.
  • Ohne strenge Vorgaben wird fast alles mit "gut" bewertet.

Was du dagegen tust: Gib dem Prüfer eine Bewertungstabelle mit Zähnen. Pro Kriterium (Korrektheit, Vollständigkeit, Ton, nächster Schritt) beschreibst du, was eine 5 und was eine 1 bedeutet, am besten mit je einem Beispiel. Lass einzelne Kriterien getrennt bewerten statt einer Gesamtnote. Nimm für den Prüfer nicht dasselbe Modell wie für die Antworten. Und kalibriere ihn: Lass 20 Fälle parallel von dir und vom Prüfer bewerten. Erst wenn ihr in rund vier von fünf Fällen übereinstimmt, vertraust du ihm.

6. Dein erstes Prüfset in einem Nachmittag

So gehst du konkret vor. Du brauchst dafür nur eine Tabelle in Excel oder Google Sheets.

  1. Fälle sammeln (ca. 60 Minuten): Zieh 30 echte Vorgänge aus Postfach, CRM oder Tickets, anonymisiert. Etwa 20 typische, 7 schwere und 3 Fallen. Spalten: Eingabe, Kontext, erwartetes Ergebnis.
  2. "Gut" definieren (ca. 45 Minuten): Setz dich mit den Kollegen zusammen, die täglich damit arbeiten. Was muss in einer Antwort stehen? Was darf nie passieren? Welcher Ton passt zu deiner Marke?
  3. Ausgangswert messen (ca. 30 Minuten): Lass dein aktuelles System alle 30 Fälle beantworten und bewerte das Ergebnis. Diese erste Auswertung ist dein Vergleichspunkt für alles Weitere.
  4. Schwellen festlegen (ca. 15 Minuten): Schreib auf, ab wann du ausrollst, zum Beispiel: mindestens 85 Prozent korrekt, null kritische Fehler. Schriftlich, denn das ist ab jetzt dein Abnahmekriterium.
  5. Automatisieren (ca. 60 Minuten): Wenn du magst, verpackst du den Durchlauf in ein Werkzeug. Für den Einstieg reicht die Tabelle. Später lohnt sich promptfoo, ein kostenloses Open-Source-Werkzeug, das Prompts und Modelle automatisch gegeneinander antreten lässt. Alternativ baust du den Ablauf mit n8n oder Make.
  6. Das Set wachsen lassen: Jeder echte Fehler aus dem Alltag wird ein neuer Testfall. So passiert derselbe Fehler nie zweimal.

Tipp: Lass dich nicht von der Werkzeugfrage bremsen. Das Prüfset und die Bewertungstabelle sind der eigentliche Wert, das Werkzeug ist nur der Läufer. Fang heute mit der Tabelle an.

7. Beispiel: Der KI-Assistent einer Steuerkanzlei

Beispiel: Stell dir eine kleine Steuerkanzlei vor, die einen KI-Assistenten für Mandantenfragen zu Fristen und Unterlagen einsetzt. Das Prüfset enthält 30 anonymisierte Fragen aus dem Postfach. Die K.-o.-Liste lautet: keine Steuerberatung im Einzelfall, keine erfundenen Fristen, keine Auskunft zu anderen Mandanten. Drei der 30 Fälle sind Fallen, zum Beispiel die Frage "Was hat Mandant X letztes Jahr gezahlt?".

Nach dem Anbieter-Update des Modells läuft das Set automatisch durch. Ergibt sich plötzlich ein kritischer Fehler bei einer der Fristen-Fragen, weiß die Kanzlei sofort, dass sie die Änderung stoppen muss, bevor ein Mandant etwas Falsches erfährt. Ohne Prüfset hätte das vielleicht Wochen niemand bemerkt.

8. Wenn deine KI auf eigenes Wissen zugreift: zwei Stellen, an denen es klemmt

Viele KMU nutzen KI mit einer eigenen Wissensbasis, etwa einem Chatbot, der aus deinen PDFs und Preislisten antwortet. Fachleute nennen das RAG. Hier kann eine falsche Antwort zwei Gründe haben: Die KI hat die falschen Textstellen gefunden, oder sie hat aus den richtigen Stellen die falsche Antwort gebaut.

Besser: Miss beide Stellen getrennt. Wer nur die Endantwort bewertet, weiß nie, wo er reparieren muss. Für diesen Zweck gibt es die kostenlose Metrik-Sammlung RAGAS. Eine einfache Regel dazu: Kein Start ohne 50 kuratierte Testfragen, darunter mindestens fünf, bei denen die richtige Antwort lautet: "Dazu steht nichts in unseren Unterlagen." Genau diese ehrlichen Nein-Antworten trennen gute Systeme von gefährlichen. Eine saubere Wissensbasis ist dafür die Voraussetzung, wie ich im 30-Tage-Plan für deine Daten beschreibe.

9. Qualität hält sich nicht von allein: Die drei Routinen im Betrieb

Auch ein gutes System kippt schleichend. Der Anbieter ändert das Modell, deine Preise und Produkte ändern sich, deine Kunden stellen andere Fragen als im Pilot. Drei Routinen halten dagegen:

  • Wöchentlich: 10 echte Fälle von einem Menschen sichten. 20 Minuten, feste Verantwortung.
  • Monatlich: das komplette Prüfset laufen lassen und die Auswertung mit dem Vormonat vergleichen.
  • Bei jeder Änderung: erst prüfen, dann ausrollen. Ohne Ausnahme.

Alarm-Regel: Fällt der Wert um mehr als fünf Punkte oder tritt ein kritischer Fehler auf, gilt Änderungsstopp, bis die Ursache klar ist. Das Ganze passt auf eine Karteikarte.

10. Beim Einkauf und bei der Abnahme: Dein Prüfset als Maßstab

Das Prüfset zahlt sich auch außerhalb des Betriebs aus. Wenn du einen KI-Anbieter auswählst, lass alle Kandidaten dieselben 30 Fälle bearbeiten. Dann vergleichst du Ergebnisse statt Verkaufsfolien, wie ich es im Artikel zur Prüfung von KI-Demos beschreibe. Und bei der Abnahme eines Projekts sind deine Schwellen das Kriterium, das beide Seiten vorher schriftlich festgelegt haben. Das verhindert den Klassiker: Projekt "fertig", Kunde unzufrieden, weil "gut" nie definiert wurde. Auch für den Einsatz von KI-Agenten ist ein Prüfset die Eintrittskarte.

Fazit: Was man nicht misst, kann man nur glauben

KI-Qualität ist eine Quote, keine Eigenschaft. Mit 30 bis 50 echten Fällen, klaren K.-o.-Kriterien und einer Mischung aus Regeln, KI-Prüfer und Mensch hast du ein Werkzeug, das Meinungen durch Zahlen ersetzt. Der Aufwand ist ein Nachmittag, der Nutzen reicht von der Anbieterwahl über die Abnahme bis zum laufenden Betrieb.

Der Trend geht klar dahin, dass KI nicht mehr als Spielerei läuft, sondern in echten Abläufen steckt. Dort gewinnen am Ende nicht die Firmen mit den meisten Tools, sondern die, die wissen, ob ihre Tools funktionieren. Wer jetzt anfängt zu messen, hat einen Vorsprung, den man nicht kopieren kann.

Du möchtest wissen, wie ein solches Prüfset für deine KI-Anwendung aussehen kann? Dann buch dir jetzt dein kostenloses Strategiegespräch. Ich zeige dir, was bei dir möglich ist. Ehrlich nein ist mir lieber als ein halbes Ja.

Diesen Beitrag teilen
Danilo à Tellinghusen

Über den Autor

Danilo à Tellinghusen

Inhaber von À Tellinghusen Marketing, M.Sc. Informatik

Seit über 15 Jahren entwickle ich Software. Heute baue ich für kleine und mittelständische Unternehmen Websites, die Anfragen bringen, und Automatisierungen, die Zeit sparen. In meinen Artikeln schreibe ich auf, was in der Praxis wirklich funktioniert.

  • 15+ Jahre Softwareentwicklung
  • BAFA-zertifizierter Berater
  • Google-Bewertung 5,0