Eine überzeugende Demo zeigt, was eine KI beantworten kann. Ein belastbarer Test zeigt zusätzlich, wann sie falsch liegt. Für eine interne Wissenssuche brauchen Sie beides.
Beginnen Sie mit einem unabhängigen Testset
Sammeln Sie Fragen aus dem Arbeitsalltag und lassen Sie eine Fachperson die erwartete Antwort mit der gültigen Quelle festhalten. Verwenden Sie nicht nur Fragen, die während der Entwicklung bereits mehrfach optimiert wurden.
Für einen ersten, überschaubaren Pilot können beispielsweise 40 sorgfältig ausgewählte Fälle sinnvoll sein. Diese Zahl ist eine Planungshilfe, kein statistischer Nachweis. Teilen Sie die Fälle nach Aufgabe und Risiko auf, damit häufige Standardfragen seltene, aber kritische Fehler nicht verdecken.
Fünf Arten von Testfragen
Eindeutige Fragen, deren Antwort in einer freigegebenen Quelle steht.
Fragen, die Informationen aus zwei Dokumenten benötigen.
Fragen zu ähnlichen Produkten oder unterschiedlichen Revisionen.
Fragen, für die keine belastbare Information vorhanden ist.
Fragen zu Dokumenten, auf die die jeweilige Testperson keinen Zugriff hat.
Notieren Sie pro Fall die Rolle der fragenden Person, die erwarteten Belege und das gewünschte Verhalten. Bei fehlender Information kann eine Rückfrage oder eine begründete Enthaltung die richtige Antwort sein.
Suche und Antwort getrennt bewerten
Eine falsche Antwort kann entstehen, weil die Suche die relevante Passage nicht findet. Sie kann aber auch entstehen, obwohl die richtige Passage vorliegt und das Sprachmodell sie falsch interpretiert.
Prüfen Sie daher zuerst die gefundenen Dokumentausschnitte und danach den formulierten Text. Die Microsoft-Dokumentation zur RAG-Evaluation unterscheidet unter anderem Quellenbindung, Richtigkeit und Vollständigkeit. Ein einziger Gesamtscore verdeckt diese Unterschiede.
Ein Bewertungsraster für Fachpersonen
Vergeben Sie für die fachliche Antwort «richtig», «teilweise richtig» oder «falsch». Bewerten Sie die Quellen separat: passend, unvollständig oder nicht tragfähig. Ergänzen Sie, ob die Antwort ihre Unsicherheit angemessen ausdrückt.
Beispiel: Die Frage betrifft die Kündigungsfrist eines Servicevertrags. Die KI nennt eine Frist aus einem alten Vertrag und verlinkt das Dokument korrekt. Der Quellenlink funktioniert, die Antwort ist für den aktuellen Fall trotzdem falsch. Ein Test, der nur vorhandene Zitate zählt, würde diesen Fehler übersehen.
Fehler nach Schwere behandeln
Eine ungeschickte Formulierung ist anders zu bewerten als eine unbelegte Preiszusage oder die Offenlegung vertraulicher Informationen. Legen Sie deshalb vor dem Test fest, welche Fehler einen Start verhindern.
Ein möglicher Entscheid lautet: Keine festgestellten Berechtigungsverletzungen im definierten Testsatz; kritische Sachfehler müssen behoben sein; für weniger kritische Fragen gelten vereinbarte Qualitätsziele. Das ist eine projektspezifische Freigaberegel, keine Garantie für sämtliche späteren Eingaben.
Die NIST-Arbeit zur KI-Messung und Evaluation unterstreicht die Bedeutung belastbarer Messverfahren. Für Ihr KMU zählt, dass die Messung die tatsächliche Aufgabe abbildet.
Automatische Bewertungen kontrollieren
Ein zweites Sprachmodell kann Auffälligkeiten vorsortieren. Es ersetzt die fachliche Prüfung nicht. Kontrollieren Sie eine Stichprobe, besonders wenn Modell und Bewertungsmodell ähnliche Fehler machen könnten.
Bewahren Sie Fragen, Antworten, abgerufene Passagen und die verwendete Systemversion auf. Wiederholen Sie wichtige Fälle bei Änderungen an Daten, Suche, Prompt oder Modell. Prüfen Sie auch mehrfach gestellte Fragen, weil Antworten variieren können.
Was nach einem schlechten Ergebnis passiert
Ordnen Sie jeden Fehler einer Ursache zu: fehlende Quelle, falsche Version, schwache Suche, missverständliche Frage oder fehlerhafte Antwortbildung. Ändern Sie möglichst gezielt und testen Sie danach erneut.
Wer die Architektur noch einordnet, findet im Beitrag RAG für Unternehmen die Grundlagen. Unsere KI-Beratung in der Schweiz hilft, einen Testkatalog mit nachvollziehbaren Abnahmekriterien für Ihren konkreten Anwendungsfall aufzubauen.




