Eine falsche oder langsame KI-Antwort kann an verschiedenen Stellen entstehen. Tracing hilft der technischen Betreuung, den Weg eines konkreten Auftrags nachzuvollziehen und die Ursache gezielter zu untersuchen.
Die sichtbare Antwort ist nur der letzte Schritt
Ein Mitarbeiter meldet, dass der Assistent eine veraltete Lieferbedingung nennt. Möglicherweise hat die Suche ein altes Dokument gefunden. Vielleicht wurde das richtige Dokument gefunden, aber falsch verarbeitet. Ebenso könnte eine früher erzeugte Antwort aus einem Cache stammen.
Ohne passende Messpunkte sehen diese Ursachen in der Oberfläche ähnlich aus. Die Agentur muss dann raten oder zusätzliche Diagnosen nachträglich einbauen. Ein sinnvoll instrumentierter Ablauf liefert bereits die Informationen, mit denen sich die wichtigsten Hypothesen unterscheiden lassen.
OpenTelemetry erläutert verteiltes Tracing als Nachverfolgung einer Anfrage über mehrere Verarbeitungsschritte. Für das Unternehmen ist vor allem der Nutzen relevant: Der gemeldete Vorgang lässt sich als zusammenhängender Ablauf untersuchen, auch wenn mehrere Dienste beteiligt sind.
Welche Stationen sichtbar sein sollten
Erstellen Sie mit der Agentur eine einfache Ablaufskizze. Bei einer Wissenssuche könnte sie aus Annahme, Berechtigungsprüfung, Suche, Modellverarbeitung und Antwort bestehen. Bei einer schreibenden Assistenz kommen fachliche Prüfung, Freigabe und Übermittlung an das Zielsystem hinzu.
Für jede Station wird festgelegt, welche Beobachtung eine Fehlersuche unterstützt. Häufig sind Dauer, Ergebnisstatus, verwendete Konfiguration und eine geeignete Referenz ausreichend. Nicht jede Zwischenantwort muss vollständig gespeichert werden.
Wichtig ist die gemeinsame Vorgangskennung. Wenn ein Hintergrundauftrag später weiterläuft, soll er dem ursprünglichen Auftrag zugeordnet bleiben. Lassen Sie auch prüfen, wie Wiederholungen und parallel ausgeführte Schritte dargestellt werden, damit Zeitmessungen nicht irreführend addiert werden.
Ein fiktiver Ablaufbericht
Angenommen, eine künstliche Testfrage benötigt insgesamt neun Sekunden. Der Bericht zeigt eine kurze Eingangsprüfung, sechs Sekunden Suche, zwei Sekunden Modellverarbeitung und weitere Zeit für Ausgabe und Übertragung. Die Zahlen sind frei erfunden und dienen nur der Illustration.
Eine pauschale Optimierung des Modells würde in diesem Beispiel den grössten Warteanteil nicht lösen. Zuerst wäre zu untersuchen, weshalb die Suche so lange benötigt. Vielleicht ist eine Datenquelle langsam, vielleicht wird unnötig viel gesucht. Der Trace liefert den Ansatzpunkt, aber noch keine automatische Erklärung.
Für den Abnahmebericht empfehlen wir folgende Angaben:
Vorgangskennung und Testfall, zu dem der Ablauf gehört.
Start und Ende der relevanten Verarbeitungsschritte.
Status jedes Schritts, einschliesslich Wiederholungen und Abbrüchen.
aktive Konfigurationsstände und geeignete Quellenreferenzen.
beobachtete Auffälligkeit und daraus abgeleitete Untersuchung.
verbleibende Lücke, wenn eine externe Komponente keine Details liefert.
Qualität braucht zusätzliche fachliche Prüfungen
Eine technisch schnelle Verarbeitung beweist keine richtige Antwort. Ein Trace kann zeigen, welches Dokument verwendet wurde, aber die fachliche Eignung dieses Dokuments muss weiterhin beurteilt werden. Ebenso ist ein erfolgreicher Modellaufruf noch kein Nachweis, dass ein Betrag korrekt übernommen wurde.
Verknüpfen Sie deshalb ausgewählte Testfälle mit fachlichen Sollwerten. Wenn eine Antwort falsch ist, lässt sich dann prüfen, an welcher Station die notwendige Information verloren ging oder eine unbelegte Ergänzung entstand. Diese Verbindung macht die Diagnose konkreter als eine reine Sammlung von Geschwindigkeitsdiagrammen.
Trennen Sie ausserdem Diagnosedaten von einem geschäftlichen Auditnachweis. Für eine Fehlersuche dürfen technische Details relevant sein, während die Rekonstruktion einer Freigabe andere Ereignisse benötigt. Beide können dieselbe Vorgangskennung nutzen, müssen aber nicht dieselben Inhalte speichern.
Nicht alles protokollieren
Eine schnelle Diagnose rechtfertigt keine unkontrollierte Kopie sämtlicher Kundengespräche. Der OWASP-Leitfaden für Logging behandelt die bewusste Auswahl und den Schutz erfasster Daten. Klären Sie deshalb, welche Personen technische Einblicke erhalten und wann Diagnosedaten entfernt werden.
Manchmal genügt eine künstliche Testreferenz zur Reproduktion. Für einen echten Vorfall kann eine zeitlich begrenzte, gezielt freigegebene Detailerfassung sinnvoll sein. Der Umfang sollte vom konkreten Untersuchungszweck abhängen und danach wieder auf den normalen Stand zurückgehen.
Wenn aus Kostengründen nur ein Teil der Abläufe erfasst wird, gehört diese Einschränkung in die Dokumentation. Die Agentur darf dann nicht versprechen, jeden beliebigen historischen Einzelfall vollständig rekonstruieren zu können. Prüfen Sie besonders, welche Fehlerfälle trotz Auswahlverfahren erhalten bleiben.
Den Nutzen im Abnahmetest zeigen lassen
Lassen Sie zwei ungefährliche Fehler in der Testumgebung simulieren, etwa eine langsame Suche und einen fehlgeschlagenen Zielaufruf. Die Betreuung soll anhand der vorhandenen Messpunkte erklären, welche Station betroffen ist. So prüfen Sie die Diagnosefähigkeit praktisch.
Die fachliche Ergänzung liefert unser Leitfaden zur Prüfung von RAG-Antworten. einclick als KI-Agentur aus Zürich kann mit Ihnen festlegen, welche Messpunkte und Nachweise für die spätere Betreuung Ihrer Anwendung notwendig sind.




