Document Understanding
Neuestes
False
Bannerhintergrundbild
Document Understanding-Benutzerhandbuch für die moderne Umgebung
Letzte Aktualisierung 16. Mai 2024

Grundlegende Funktionen

Um die Dokumentverarbeitung zu automatisieren, sind vier grundlegende Funktionen erforderlich: Digitalisierung, Klassifizierung und Aufteilung, Extraktion und Validierung.

Abbildung 1. Grundlegende Funktionen docs image

Digitalisierung

Bei der Digitalisierung wird ein physisches Dokument in maschinenlesbaren Text umgewandelt, der dann digital verarbeitet werden kann. Obwohl Optical Character Recognition (OCR) ein wichtiger Bestandteil der Digitalisierung ist, ist der Digitalisierungsprozess komplexer und umfasst verschiedene Schritte, einschließlich OCR.

Bei PDF-Dokumenten kann der Digitalisierungsalgorithmus beispielsweise zwischen gescannten und nativen PDF-Dokumenten oder hybriden PDF-Dokumenten unterscheiden, die gescannte Bilder und nativen Text enthalten. Der größte Teil des Texts kann direkt aus einem nativen PDF-Dokument extrahiert werden, aber in einigen Fällen müssen einige Logos möglicherweise mit OCR gelesen werden. Der Digitalisierungsprozess kann alle diese Situationen bewältigen, um maximale Genauigkeit bei der Texterkennung sicherzustellen und gleichzeitig schnell und effizient zu arbeiten.

Klassifizierung

In most use cases, documents need to be sorted into logical categories so different processing methods can be applied to them.

Das Ziel einer Klassifizierung ist es, ein Dokument zu scannen und zu entscheiden, zu welchem Dokumenttyp es gehört. Es ist wichtig, den Dokumenttyp zu kennen, da unterschiedliche Dokumenttypen unterschiedliche Verarbeitungstechniken erfordern. Beispielsweise muss eine Rechnung von einem Rechnungsextraktionsmodell verarbeitet werden, um sicherzustellen, dass alle relevanten Felder extrahiert werden.

Figure 2. Document classifier docs image

Extraktion

Bei der Datenextraktion werden nur die relevanten Informationen aus einem Dokument ausgewählt und abgerufen. Das Extrahieren bestimmter Daten aus einem langen Dokument mithilfe der String-Manipulation kann schwierig sein. Document UnderstandingTM bietet jedoch verschiedene Extraktionsmethoden für unterschiedliche Dokumenttypen und -formate. Beispielsweise möchten wir nur die Felder Anbietername, Abrechnungsname, Fälligkeitsdatum und Gesamtbetrag aus einer Rechnung extrahieren.

Figure 3. Data extraction docs image

Validierung

Bei der Klassifizierung und Extraktion verwenden Softwareroboter das Konzept der Konfidenz, die den Grad der Sicherheit misst, dass eine bestimmte Aufgabe gut ausgeführt wurde. Die Aufgabe kann entweder das Erkennen eines Dokumenttyps, das Identifizieren eines Felds oder das Lesen der darin enthaltenen Daten sein. In diesen Fällen können Sie mit dem Document Understanding-Framework einen menschlichen Benutzer damit beauftragen, die Roboterausgabe zu überprüfen und zu validieren. Im besten Fall wird die menschliche Eingabe verwendet, um die Genauigkeit des Roboters durch Machine Learning zu trainieren.

  • Digitalisierung
  • Klassifizierung
  • Extraktion
  • Validierung

War diese Seite hilfreich?

Hilfe erhalten
RPA lernen – Automatisierungskurse
UiPath Community-Forum
UiPath Logo weiß
Vertrauen und Sicherheit
© 2005-2024 UiPath. All rights reserved.