
"Seit letzter Woche ist die KI schlechter geworden." Diesen Satz höre ich in Gesprächen mit KMU-Inhabern ziemlich oft. Meistens folgt darauf die Frage: Stimmt das überhaupt? Und genau da beginnt das Problem. Niemand kann es sagen, weil niemand je festgelegt hat, was "gut" bedeutet.
Du hast vielleicht einen KI-Assistenten, der Kundenanfragen vorbeantwortet, einen Chatbot auf der Website oder einen Workflow, der Angebote vorbereitet. Am Anfang sah alles prima aus. Aber ob das System heute genauso gut arbeitet wie vor drei Monaten, ob der neue Prompt wirklich besser ist oder ob der Anbieter im Hintergrund das Modell getauscht hat, entscheidet bei den meisten Firmen das Bauchgefühl. Und das Bauchgefühl liegt oft daneben.
In diesem Artikel zeige ich dir, wie du KI-Qualität messbar machst, ohne Programmierkenntnisse und ohne Budget. Du bekommst eine Anleitung, mit der du an einem Nachmittag dein erstes Prüfset baust, und du erfährst, welche Fallen dabei lauern.
Bei klassischer Software gilt: gleiche Eingabe, gleiches Ergebnis. Ein Taschenrechner rechnet 2 + 2 immer zu 4. Einmal testen reicht.
KI arbeitet anders. Sie schätzt Wahrscheinlichkeiten, und dieselbe Frage kann zweimal unterschiedlich beantwortet werden. Qualität ist deshalb keine Eigenschaft, die ein System hat oder nicht hat, sondern eine Quote. Die richtige Frage lautet nicht "Hat die KI diese eine Antwort richtig?", sondern "Bei wie vielen von 30 typischen Fällen liegt sie richtig?".
Lösung: Du testest nicht Einzelfälle, sondern ein festes Set an Fällen, immer wieder mit demselben Maßstab. In der Fachsprache heißt das Eval (von "Evaluation"). Merk dir das Bild: Der Eval ist für KI das, was die Stichprobenkontrolle für die Fertigung ist.
Rechenbeispiel (hypothetisch): Angenommen, dein KI-Assistent beantwortet im Monat 1.000 Kundenanfragen und liegt bei 4 Prozent daneben. Das klingt nach einer guten Quote. Es sind aber 40 Kunden, die eine falsche Auskunft bekommen haben, vielleicht einen erfundenen Preis oder einen falschen Termin. Jeder einzelne Fehler fällt nicht auf. Zusammen kosten sie dich Vertrauen.
Ähnlich läuft es bei einem Prompt-Update. Du probierst den neuen Prompt an drei Beispielen aus, er sieht besser aus, du rollst ihn aus. Auf den anderen 50 Fällen, die du nie getestet hast, ist er vielleicht schlechter.
Besser: Jede Änderung, egal ob neuer Prompt, neues Modell oder neue Wissensbasis, läuft vor dem Ausrollen durch dasselbe Prüfset. Das dauert Minuten und ersetzt Meinung gegen Meinung durch eine Zahl.
Ein Prüfset besteht aus drei Dingen: echten Fällen, einem Soll-Ergebnis pro Fall und einer Regel, ab wann etwas als bestanden gilt. Profis nennen es "Golden Set". Es ist weniger kompliziert, als es klingt.
Was hineingehört:
Tipp: 30 bis 50 Fälle reichen für ein KMU völlig aus. Wichtig ist nicht die Größe, sondern dass das Set fest, versioniert und ungeschönt ist. Wer nur die Fälle nimmt, bei denen die KI glänzt, belügt sich selbst.
Nicht jede Antwort lässt sich gleich prüfen. Du brauchst eine Mischung.
Exakte Checks. Hier prüft eine einfache Regel: Steht die Telefonnummer im richtigen Format da? Ist das Pflichtfeld ausgefüllt? Kommt ein verbotenes Wort vor? Das kostet praktisch nichts und ist knallhart zuverlässig.
Abgleich mit der Soll-Antwort. Du prüfst, ob die Schlüsselfakten in der Antwort stecken, etwa der korrekte Preis oder die Öffnungszeiten. Ideal für Antworten aus deinen eigenen Unterlagen.
KI als Prüfer. Ein zweites KI-Modell bewertet Ton, Vollständigkeit und Hilfsbereitschaft nach einer festen Bewertungstabelle. Das ist skalierbar und kostet bei 50 Fällen nur wenige Cent pro Durchlauf, hat aber Macken (dazu gleich mehr).
Mensch. Du oder eine Fachperson sichtet eine Stichprobe, möglichst ohne zu wissen, welche Version die Antwort erzeugt hat. Das ist dein Eichmaß für alles andere.
Wichtig: K.-o.-Fehler zählen vor jedem Durchschnitt. Ein System mit 95 Prozent Trefferquote, das einmal einen Preis erfindet, ist schlechter als eines mit 90 Prozent, das nie lügt. Ein einziger kritischer Fehler heißt: nicht ausrollen.
Eine KI, die eine andere KI benotet, ist praktisch, aber sie hat bekannte Schwächen:
Was du dagegen tust: Gib dem Prüfer eine Bewertungstabelle mit Zähnen. Pro Kriterium (Korrektheit, Vollständigkeit, Ton, nächster Schritt) beschreibst du, was eine 5 und was eine 1 bedeutet, am besten mit je einem Beispiel. Lass einzelne Kriterien getrennt bewerten statt einer Gesamtnote. Nimm für den Prüfer nicht dasselbe Modell wie für die Antworten. Und kalibriere ihn: Lass 20 Fälle parallel von dir und vom Prüfer bewerten. Erst wenn ihr in rund vier von fünf Fällen übereinstimmt, vertraust du ihm.
So gehst du konkret vor. Du brauchst dafür nur eine Tabelle in Excel oder Google Sheets.
Tipp: Lass dich nicht von der Werkzeugfrage bremsen. Das Prüfset und die Bewertungstabelle sind der eigentliche Wert, das Werkzeug ist nur der Läufer. Fang heute mit der Tabelle an.
Beispiel: Stell dir eine kleine Steuerkanzlei vor, die einen KI-Assistenten für Mandantenfragen zu Fristen und Unterlagen einsetzt. Das Prüfset enthält 30 anonymisierte Fragen aus dem Postfach. Die K.-o.-Liste lautet: keine Steuerberatung im Einzelfall, keine erfundenen Fristen, keine Auskunft zu anderen Mandanten. Drei der 30 Fälle sind Fallen, zum Beispiel die Frage "Was hat Mandant X letztes Jahr gezahlt?".
Nach dem Anbieter-Update des Modells läuft das Set automatisch durch. Ergibt sich plötzlich ein kritischer Fehler bei einer der Fristen-Fragen, weiß die Kanzlei sofort, dass sie die Änderung stoppen muss, bevor ein Mandant etwas Falsches erfährt. Ohne Prüfset hätte das vielleicht Wochen niemand bemerkt.
Viele KMU nutzen KI mit einer eigenen Wissensbasis, etwa einem Chatbot, der aus deinen PDFs und Preislisten antwortet. Fachleute nennen das RAG. Hier kann eine falsche Antwort zwei Gründe haben: Die KI hat die falschen Textstellen gefunden, oder sie hat aus den richtigen Stellen die falsche Antwort gebaut.
Besser: Miss beide Stellen getrennt. Wer nur die Endantwort bewertet, weiß nie, wo er reparieren muss. Für diesen Zweck gibt es die kostenlose Metrik-Sammlung RAGAS. Eine einfache Regel dazu: Kein Start ohne 50 kuratierte Testfragen, darunter mindestens fünf, bei denen die richtige Antwort lautet: "Dazu steht nichts in unseren Unterlagen." Genau diese ehrlichen Nein-Antworten trennen gute Systeme von gefährlichen. Eine saubere Wissensbasis ist dafür die Voraussetzung, wie ich im 30-Tage-Plan für deine Daten beschreibe.
Auch ein gutes System kippt schleichend. Der Anbieter ändert das Modell, deine Preise und Produkte ändern sich, deine Kunden stellen andere Fragen als im Pilot. Drei Routinen halten dagegen:
Alarm-Regel: Fällt der Wert um mehr als fünf Punkte oder tritt ein kritischer Fehler auf, gilt Änderungsstopp, bis die Ursache klar ist. Das Ganze passt auf eine Karteikarte.
Das Prüfset zahlt sich auch außerhalb des Betriebs aus. Wenn du einen KI-Anbieter auswählst, lass alle Kandidaten dieselben 30 Fälle bearbeiten. Dann vergleichst du Ergebnisse statt Verkaufsfolien, wie ich es im Artikel zur Prüfung von KI-Demos beschreibe. Und bei der Abnahme eines Projekts sind deine Schwellen das Kriterium, das beide Seiten vorher schriftlich festgelegt haben. Das verhindert den Klassiker: Projekt "fertig", Kunde unzufrieden, weil "gut" nie definiert wurde. Auch für den Einsatz von KI-Agenten ist ein Prüfset die Eintrittskarte.
KI-Qualität ist eine Quote, keine Eigenschaft. Mit 30 bis 50 echten Fällen, klaren K.-o.-Kriterien und einer Mischung aus Regeln, KI-Prüfer und Mensch hast du ein Werkzeug, das Meinungen durch Zahlen ersetzt. Der Aufwand ist ein Nachmittag, der Nutzen reicht von der Anbieterwahl über die Abnahme bis zum laufenden Betrieb.
Der Trend geht klar dahin, dass KI nicht mehr als Spielerei läuft, sondern in echten Abläufen steckt. Dort gewinnen am Ende nicht die Firmen mit den meisten Tools, sondern die, die wissen, ob ihre Tools funktionieren. Wer jetzt anfängt zu messen, hat einen Vorsprung, den man nicht kopieren kann.
Du möchtest wissen, wie ein solches Prüfset für deine KI-Anwendung aussehen kann? Dann buch dir jetzt dein kostenloses Strategiegespräch. Ich zeige dir, was bei dir möglich ist. Ehrlich nein ist mir lieber als ein halbes Ja.

