- Überblick
- Document Understanding-Prozess
- Schnellstart-Tutorials
- Framework-Komponenten
- Digitalisierung – Übersicht
- OCR-Engines
- Digitalisierung – verwandte Aktivitäten
- ML-Pakete
- Pipelines
- Data Manager
- OCR-Dienste
- Document Understanding – in der Automation Suite bereitgestellt
- Document Understanding – im eigenständigen AI Center bereitgestellt
- Deep Learning
- Erstellen eines leistungsstarken ML-Modells
- Lizenzierung
- Referenzen
- UiPath.Abbyy.Activities
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Aktivitäten (UiPath.IntelligentOCR.Activities)
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.Omnipage.Activities
- UiPath.PDF.Aktivitäten (UiPath.PDF.Activities)
Was ist Digitalisierung
Digitalisierung ist der Prozess zum Erhalt von maschinenlesbarem Text aus einer bestimmten eingehenden Datei, sodass ein Roboter dann seinen Inhalt verstehen und darauf reagieren kann. Das ist der erste Schritt, der auf Dateien angewendet wird, die über das Document Understanding-Framework verarbeitet werden müssen.
Der Digitalisierungsschritt hat zwei Ausgaben:
- Den Text von der verarbeiteten Datei, der in einer String-Variablen gespeichert wird und
- Das Dokumentobjektmodell dieser Datei – JSON-Objekt, das grundlegende Informationen wie Name, Inhaltstyp, Textlänge, Anzahl der Seiten sowie detaillierte Informationen wie Seitenrotation, erkannte Sprache, Inhalt und Koordinaten für jedes in der Datei identifizierte Wort enthält.
Im Dokumentverarbeitungs-Framework wird die Digitalisierung mit der Aktivität Digitize Document durchgeführt.
Was Digitalisierung nicht ist
Der Digitalisierungsschritt hängt damit zusammen, ist aber keine OCR.
Oft handelt es sich bei den Dateien, die verarbeitet werden müssen, um native PDF-Dateien (nicht gescannt), die vom Roboter programmgesteuert ohne OCR gelesen werden können.
Wann wird OCR in der Digitalisierung verwendet
The Digitize Document activity requires, as part of its configuration, the selection of an OCR engine — so that, at need, it can be used, but only executes OCR on
- Dateien, die Bilder sind
- unterstützte Bildformate sind .png, .gif, .jpe, .jpg, .jpeg, .tiff, .tif, .bmp
- bei mehrseitigen TIFF-Dateien wird OCR für jede Seite angewendet
- PDF-Seiten, die
- keine maschinenlesbaren Inhalte verfügbar machen
- Bilder enthalten, die einen erheblichen Bereich der Seite abdecken.
OCR wird auch immer dann angewendet, wenn die Aktivität Digitize Document so konfiguriert ist, dass die ForceApplyOCR-Flag auf True gesetzt ist. Diese Option wird normalerweise für Anwendungsfälle empfohlen, in denen ein signifikanter Prozentsatz von Dateien nativen Inhalt zu enthalten scheint, aber der nativ gelesene Inhalt nicht dem entspricht, was ein Benutzer in diesen Dateien sehen kann.
Wie Sie Ihr OCR-Modul auswählen
As each use case has its own particularities, it is strongly recommended to test all available OCR Engines with different settings, to determine which one works best for your project. Another recommendation is to pay particular attention to the OCR engine arguments, such as Profile, Scale, Language etc. (may vary from one engine to another), so that you can identify the best settings for each use case.