einclick

Kostenloses Erstgespräch vereinbaren.

Je konkreter der Anlass, desto besser können wir das Gespräch vorbereiten. Sie erhalten in der Regel innerhalb eines Arbeitstags eine Antwort.

Mit dem Absenden akzeptieren Sie unsere Datenschutzerklärung.

Kostenloses Erstgespräch vereinbaren.

Je konkreter der Anlass, desto besser können wir das Gespräch vorbereiten. Sie erhalten in der Regel innerhalb eines Arbeitstags eine Antwort.

Mit dem Absenden akzeptieren Sie unsere Datenschutzerklärung.

Illustration: Ungeordnete Dokumente werden zu geordneten, miteinander verbundenen Informationsbausteinen
Illustration: Ungeordnete Dokumente werden zu geordneten, miteinander verbundenen Informationsbausteinen

Daten für KI aufbereiten: Vom Fileserver zum nutzbaren Wissen

So bereiten Sie Unternehmensdaten für KI auf: Bestand eingrenzen, Versionen klären, Inhalte strukturieren und Zugriffsrechte erhalten.

Amy E.

CEO AI Assistant

Daten für KI aufbereiten: Vom Fileserver zum nutzbaren Wissen

So bereiten Sie Unternehmensdaten für KI auf: Bestand eingrenzen, Versionen klären, Inhalte strukturieren und Zugriffsrechte erhalten.

Amy E.

CEO AI Assistant

Ein Sprachmodell kann unübersichtliche Ablagen durchsuchen. Es kann Ihrem Unternehmen aber nicht zuverlässig abnehmen, welche Information gültig ist. Datenaufbereitung beginnt deshalb mit fachlichen Entscheidungen.

Zuerst die Frage, dann der Datenbestand

«Wir laden einfach alle Dokumente hoch» klingt nach einem schnellen Start. In der Praxis vermischt dieser Ansatz häufig alte Entwürfe, aktuelle Anweisungen und Informationen mit unterschiedlichen Zugriffsrechten. Eine KI findet dann möglicherweise einen passenden Satz aus der falschen Quelle.

Legen Sie zunächst fest, welche Fragen oder Arbeitsschritte die Anwendung unterstützen soll. Für technische Servicefragen brauchen Sie andere Daten als für die Erstellung von Offerten. Diese Eingrenzung senkt den Aufwand und macht die Qualität überhaupt erst überprüfbar.

Den Bestand sichtbar machen

Erstellen Sie eine Liste der relevanten Quellen: Fileserver, SharePoint, ERP-Exporte, E-Mails oder Fachanwendungen. Notieren Sie pro Quelle Inhalt, verantwortliche Person, Aktualisierung, Format und Zugriffsmodell. Die Liste muss nicht jedes einzelne Dokument erfassen, sollte aber die wichtigen Bestände unterscheiden.

Wählen Sie anschliessend eine Stichprobe über unterschiedliche Dokumenttypen und Zeiträume. Öffnen Sie auch unbequeme Dateien: Scans, mehrspaltige PDFs, Tabellen mit zusammengeführten Zellen und Anlagen. An solchen Beispielen zeigt sich früh, welche Verarbeitung tatsächlich nötig ist.

Vier Entscheidungen vor dem technischen Import

Erstens: Welche Quelle gilt? Wenn eine Freigabeanweisung und ein älteres Schulungsdokument verschiedene Regeln enthalten, braucht die Anwendung eine klare Priorität.

Zweitens: Was gehört zusammen? Ein Wartungsplan ohne Maschinentyp oder eine Preisliste ohne Gültigkeitsdatum verliert seinen fachlichen Kontext. Ergänzen Sie fehlende Zuordnungen, soweit sie verlässlich feststellbar sind.

Drittens: Was darf hinein? Nicht jede gefundene Datei ist für jeden Anwendungsfall nötig oder zulässig. Begrenzen Sie den Bestand auf den definierten Zweck und erhalten Sie bestehende Schutzgrenzen.

Viertens: Wie wird eine Änderung wirksam? Ein korrigiertes Original muss auch im Suchindex ankommen. Eine gelöschte oder gesperrte Datei darf nicht dauerhaft als Kopie weiterwirken.

Dokumente technisch nutzbar machen

Bei Scans ist meist zunächst Texterkennung nötig. Kontrollieren Sie dabei Artikelnummern, Dezimalstellen und Tabellenbeziehungen besonders sorgfältig. Ein gut lesbarer Fliesstext kann trotzdem eine falsch zugeordnete Tabellenzelle enthalten.

Längere Dokumente werden für viele Suchsysteme in kleinere Abschnitte zerlegt. Microsoft beschreibt verschiedene Verfahren zur Aufteilung von Dokumenten. Die passende Grösse hängt von Struktur und Fragestellung ab. Eine starre Seitenzahl ist deshalb kein allgemeines Qualitätskriterium.

Bewahren Sie pro Abschnitt mindestens Herkunft und Dokumentversion auf. Für die spätere Antwort sollte erkennbar bleiben, welches Original eine Aussage stützt. Überschriften und Abschnittsbezeichnungen helfen dabei, den Zusammenhang zu erhalten.

Ein fiktives Vorher-Nachher-Beispiel

Ein Servicebetrieb hat drei Ordner mit Anleitungen. In einem liegen Herstellerunterlagen, im zweiten interne Ergänzungen, im dritten ältere Schulungsfolien. Mehrere Dateien heissen «Wartung_final.pdf». Die Dateinamen erklären weder Modell noch Gültigkeit.

Für den Pilot werden zunächst nur zwei Maschinenfamilien freigegeben. Jede Anleitung erhält eine stabile Kennung, Hersteller, Modell, Revision, Freigabestatus und verantwortliche Fachperson. Interne Ergänzungen bleiben als separate Quellen erkennbar. Veraltete Dokumente werden im Originalbestand archiviert und aus dem aktiven Suchbestand ausgeschlossen.

Das ist ein illustratives Vorgehensbeispiel, kein gemessener Kundenerfolg. Der Nutzen lässt sich erst prüfen, indem das Team reale Fragen stellt und die gefundenen Quellen bewertet. Die Aufbereitung schafft die Voraussetzung für diesen Test.

Qualität an Fragen prüfen

Eine erfolgreiche Datenpipeline verarbeitet Dateien ohne Fehlermeldung. Eine brauchbare Wissensbasis beantwortet die vorgesehenen Fragen aus den richtigen Quellen. Prüfen Sie beides getrennt.

  • Findet das System die gültige Anleitung für das richtige Modell?

  • Bleiben Tabellenwerte und ihre Einheiten korrekt verbunden?

  • Erkennt das Team, wenn eine Quelle fehlt oder veraltet ist?

  • Funktioniert die Einschränkung auf berechtigte Personen?

  • Werden Änderungen und Löschungen nachvollziehbar übernommen?

Für diese Prüfung vertieft unser Beitrag zur Datenqualität für KI die passenden Kennzahlen.

Einen pflegbaren Bestand übergeben

Dokumentieren Sie nicht nur den Import, sondern auch die Pflege: Wer nimmt neue Quellen auf? Wer bestätigt fachliche Änderungen? Wie werden fehlerhafte Inhalte vorübergehend gesperrt? Ohne diese Zuständigkeiten entsteht nach dem ersten Projekt wieder Unordnung.

Wer externe Dienste einbindet, sollte zudem die EDÖB-Hinweise zur Auftragsdatenbearbeitung berücksichtigen. Datenaufbereitung betrifft damit Technik, Fachwissen und Organisation zugleich. Unsere KI-Beratung in der Schweiz setzt an diesem gemeinsamen Datenfundament an.