einclick

Kostenloses Erstgespräch vereinbaren.

Je konkreter der Anlass, desto besser können wir das Gespräch vorbereiten. Sie erhalten in der Regel innerhalb eines Arbeitstags eine Antwort.

Mit dem Absenden akzeptieren Sie unsere Datenschutzerklärung.

Kostenloses Erstgespräch vereinbaren.

Je konkreter der Anlass, desto besser können wir das Gespräch vorbereiten. Sie erhalten in der Regel innerhalb eines Arbeitstags eine Antwort.

Mit dem Absenden akzeptieren Sie unsere Datenschutzerklärung.

Illustration: Ein gescanntes Dokument wird über Texterkennung und visuelle Analyse erschlossen
Illustration: Ein gescanntes Dokument wird über Texterkennung und visuelle Analyse erschlossen

OCR oder Vision-Modell: Gescannte Dokumente für KI erschliessen

OCR oder Vision-Modell für Ihre Scans? Ein Prüfablauf zeigt, wie Schweizer KMU Text, Layout und wichtige Angaben zuverlässig erschliessen können.

Amy E.

CEO AI Assistant

OCR oder Vision-Modell: Gescannte Dokumente für KI erschliessen

OCR oder Vision-Modell für Ihre Scans? Ein Prüfablauf zeigt, wie Schweizer KMU Text, Layout und wichtige Angaben zuverlässig erschliessen können.

Amy E.

CEO AI Assistant

Ein alter Prüfbericht kann sauber aussehen und trotzdem falsch ausgelesen werden. Entscheidend ist, ob die Anwendung Zeichen, Seitenaufbau und fachlichen Zusammenhang für Ihre Aufgabe ausreichend zuverlässig erfasst.

Zuerst die Datei untersuchen

Nicht jedes PDF benötigt Texterkennung. Enthält es bereits eine brauchbare Textebene, kann eine direkte Extraktion ein sinnvoller Ausgangspunkt sein. Bei einem reinen Scan liegen dagegen zunächst nur Bildinformationen vor. Mischdateien enthalten beides, beispielsweise ein digitales Deckblatt und fotografierte Anhänge. Ein einziger Verarbeitungspfad für alle Seiten kann dadurch unnötig teuer oder unzuverlässig werden.

Prüfen Sie vor der Werkzeugwahl eine kleine Auswahl: Lässt sich Text markieren? Stimmt die Kopierreihenfolge? Bleiben Umlaute, Artikelnummern und Spalten zusammen? Ein Dokument mit auswählbarem Text kann dennoch fehlerhafte Zeichen oder eine unbrauchbare Lesereihenfolge enthalten. Die Dateiendung allein beantwortet diese Fragen nicht.

Für grössere Bestände lohnt sich ein dokumentierter Eingangstest. Er erfasst Dateityp, Seitenzahl, vorhandene Textebene, Scanqualität und besondere Elemente wie Stempel oder handschriftliche Ergänzungen. Die grundlegende Organisation des Bestands behandeln wir unter Daten für KI aufbereiten.

Was OCR und Vision jeweils beitragen

OCR steht für die Erkennung von Schrift aus Bildern. Moderne Dokumentendienste können dabei zusätzliche Angaben liefern. Das Read-Modell von Microsoft Document Intelligence beschreibt beispielsweise die Erfassung gedruckter und handschriftlicher Texte sowie positionsbezogene Ergebnisse. Die tatsächlich unterstützten Sprachen und Eingaben bleiben dienstabhängig.

Ein Vision-Modell verarbeitet das sichtbare Dokument als Bild und kann Fragen zu Inhalt oder Anordnung beantworten. Es kann etwa helfen, eine handschriftliche Bemerkung dem richtigen Abschnitt zuzuordnen. Dass eine Antwort sprachlich überzeugend klingt, beweist jedoch nicht, dass jedes Zeichen korrekt erkannt wurde.

Die Claude-Dokumentation zu Vision nennt Grenzen bei der Bildinterpretation, etwa bei kleinen oder schlecht erkennbaren Details. Für die Projektplanung bedeutet das: Ein Modell darf unlesbare Stellen markieren. Es sollte fehlende Zeichen nicht durch vermeintlich passende Werte ersetzen.

Drei Wege mit denselben Seiten vergleichen

Ein fairer Versuch vergleicht die Verarbeitung auf denselben Dokumenten. Als eigene Arbeitsvorlage empfehlen wir drei Kandidaten: reine Textextraktion beziehungsweise OCR, visuelle Auswertung sowie eine Kombination aus beiden. Welche Varianten technisch verfügbar sind, klärt der Umsetzungspartner.

Die Kombination kann den erkannten Text als Ausgangspunkt verwenden und nur auffällige Seiten visuell nachprüfen. Das ist eine mögliche Architektur, kein automatischer Qualitätsgewinn. Wenn die zweite Stufe dieselbe falsche Zahl übernimmt, bleibt der Fehler bestehen. Bewerten Sie daher das Endergebnis, nicht die Anzahl eingesetzter Modelle.

Definieren Sie vorab das benötigte Ergebnis. Wer nur Dokumente durchsuchbar machen möchte, hat andere Anforderungen als ein Betrieb, der Seriennummern in eine Anlagenverwaltung überträgt. In letzterem Fall kann ein einziges verwechslungsfähiges Zeichen entscheidend sein.

Das Arbeitsmittel: ein Lesbarkeitsprotokoll

Für einen fiktiven Servicebetrieb könnte ein erster Prüfsatz 30 freigegebene Berichte enthalten. Die Anzahl ist ein Planungsbeispiel, keine statistische Garantie. Wählen Sie bewusst verschiedene Scanner, alte Kopien, gedrehte Seiten und typische handschriftliche Vermerke aus.

Halten Sie je Dokument folgende Angaben fest:

  • Fundstelle: Datei, Seite und Ausschnitt.

  • Sollwert: fachlich geprüfter Originalinhalt.

  • Ergebnis: erkannter Text oder strukturierter Wert.

  • Fehlerart: Zeichenfehler, falsche Zuordnung, Auslassung oder erfundene Ergänzung.

  • Bedeutung: rein optisch, nachbearbeitbar oder fachlich kritisch.

  • Bearbeitungszeit: automatische Verarbeitung plus notwendige Kontrolle.

Trennen Sie einen falschen Buchstaben in einem Fliesstext von einer falschen Seriennummer. Eine durchschnittlich hohe Zeichengenauigkeit kann gerade jene Fehler verdecken, die den Prozess unbrauchbar machen. Prüfen Sie kritische Felder deshalb zusätzlich auf vollständige Übereinstimmung.

Die Fehlerursache bestimmt die Verbesserung

Ist ein Dokument unscharf, hilft häufig ein besserer Scan mehr als ein weiterer Prompt. Fehlt eine Seite, muss die Eingangsprüfung reagieren. Werden Spalten vermischt, braucht es eine bessere Layoutverarbeitung. Wird eine korrekt erkannte Zahl falsch interpretiert, liegt das Problem in der fachlichen Verarbeitung.

Auch das Zuschneiden und Drehen von Bildern kann helfen, muss aber nachvollziehbar bleiben. Bewahren Sie das Original auf und verknüpfen Sie bearbeitete Ausschnitte mit ihrer Herkunft. So kann eine prüfende Person einen verdächtigen Wert schnell im unveränderten Dokument wiederfinden.

Bei sehr schlechter Qualität kann die richtige Ausgabe «nicht sicher lesbar» sein. Legen Sie fest, wer solche Fälle übernimmt und ob ein neuer Scan angefordert wird. Diese Ausnahmebehandlung gehört zum normalen Leistungsumfang.

Erst kontrollieren, dann in Folgesysteme übernehmen

Im Pilot sollten ausgelesene Angaben zunächst in einer Prüfansicht landen. Originalausschnitt und Ergebnis stehen dort nebeneinander; Korrekturen werden erfasst. Erst freigegebene Daten gelangen in die nächste Anwendung. Damit prüfen Sie zugleich, ob die Lösung im Arbeitsalltag Zeit spart.

Für die Beauftragung reichen drei klare Lieferziele: dokumentierter Prüfsatz, begründete Wahl des Verarbeitungspfads und ein messbarer Umgang mit Fehlern. Mit einclick als KI-Agentur in der Schweiz können Sie diese Anforderungen auf Ihren Dokumentenbestand abstimmen und die brauchbare Extraktion vor einer breiten Einführung prüfen.