- Erste Schritte
- Framework-Komponenten
- Übersicht zur Dokumentklassifizierung
- „Klassifizierer konfigurieren“-Assistent von Classify Document Scope
- Schlüsselwortbasierte Classifier (Keyword Based Classifier)
- Intelligenter Schlüsselwortklassifizierer
- FlexiCapture Classifier
- Machine Learning Classifier
- Dokumentklassifizierung – verwandte Aktivitäten
- ML-Pakete
- Pipelines
- Data Manager
- OCR-Dienste
- Document Understanding – in der Automation Suite bereitgestellt
- Document Understanding – im eigenständigen AI Center bereitgestellt
- Deep Learning
- Lizenzierung
- Referenzen
- UiPath.Abbyy.Activities
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Aktivitäten (UiPath.IntelligentOCR.Activities)
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.Omnipage.Activities
- UiPath.PDF.Aktivitäten (UiPath.PDF.Activities)
Kontrollkästchen
Im Kontext eines ML-Extraktionsmodells ist ein Kontrollkästchen kein tatsächlicher Wert, sondern eine Möglichkeit, einen bestimmten Textteil auszuwählen.
Deshalb wird das Wort daneben zum Fokuspunkt und nicht das Kontrollkästchen. Und genau dies ist der Zweck des Kontrollkästchens: als Anker für ein bestimmtes Wort zu fungieren.
Um ein ML-Modell zu trainieren, müssen Sie daher das Wort und nicht das Kontrollkästchen beschriften.
In einigen Fällen wird das Kontrollkästchen nicht erkannt. Zum Beispiel könnte der OCR es als X lesen, oder vielleicht ist es nur ein handgeschriebenes Zeichen, das überhaupt nicht aufgenommen wird. Das ML-Modell kann diese Situationen lernen und mit dem Wort neben der Markierung verknüpfen.
Es ist also robuster, ein Modell so zu trainieren, dass ein Wort erkannt wird, unabhängig davon, wie es ausgewählt wird: mit einem Kontrollkästchen, mit einem X oder mit einem handschriftlichen Zeichen (eingekreist, unterstrichen usw.).
Kontrollkästchen mit einzelnen Optionen
Im obigen Beispiel können Sie zwei Felder in Data Manager wie folgt erstellen:
- Erkrankung-Beschäftigung (das Wort JA beschriften)
- Erkrankung-Selbstunfall (das Wort JA beschriften)
The ML model learns to recognize those words whether they are marked by checkboxes, X’s, or just circled in pen. To do so, you could use UiPath Document OCR which can recognize even checkboxes.
Kontrollkästchen ohne Beschriftung
Es gibt Fälle, in denen einem Kontrollkästchen keine Beschriftung zugeordnet ist. Zum Beispiel, wenn Kontrollkästchen Teil von Tabellen sind.
Hier ist ein typisches Beispiel:
In diesem Fall müssen die Kästchen beschriftet werden. Der Extraktor gibt den Zeichenfolgenwert des Kontrollkästchens zurück, das eines dieser beiden Zeichen ist:
- ☒
- ☐
These two characters can be copied and pasted like any other and can be used in workflows to verify if a checkbox was returned as checked or unchecked. Moreover, the IntelligentOCR framework knows how to recognize these, especially if a field is defined as Boolean:
- wenn der Extraktor ☒ zurückgibt, entspricht dies JA
- wenn der Extraktor ☐ zurückgibt, entspricht dies NEIN.
In cases where an unchecked box is returned as O or D, or when a checked box is returned as X,V,K or R, these can also be included in the RPA workflow logic to make the workflow more robust when these kinds of OCR errors occur.
Signaturerkennung
Signaturen sind visuelle Funktionen, die von keiner OCR Engine erkannt werden, sodass ein ML-Modell sie nicht direkt erkennen kann.
UiPath ML-Modelle lernen jedoch, indem sowohl Wörter als auch Pixel auf dem Bild erfasst werden. Dies kann zur Signaturerkennung eingesetzt werden.
Nehmen wir als Beispiel das folgende Formular.
At the end of the page, next to the signature, there is the text Signature of U.S. person. It does not matter what the text is, as long as it is close enough to the signature (whenever the signature exists). Dealing with a signature is similar to dealing with a checkbox - see the Checkboxes section above.
Sie können ein Textfeld mit dem Namen Signatur erstellen und wenn das Dokument eine Signatur hat, beschriften Sie die Wörter Unterschrift der US-Person als Signaturfeld. Wenn das Dokument keine Signatur hat, lassen Sie das Feld leer.
Dann müssen Sie sicherstellen, dass ungefähr auf der Hälfte der Dokumente Ihres Satzes eine Signatur ist und auf der anderen Hälfte keine. Es kann auch 60/40 % sein, aber nicht 80/20 % oder 90/10 %. Außerdem müssen Sie jeweils mindestens 20-30 Beispiele haben, damit das Modell dies lernen kann.
So können Sie das ML-Modell für die Signaturerkennung verwenden.