UiPath Documentation
document-understanding
2020.10
false
Document Understanding-Benutzerhandbuch.
Wichtig :
Es kann 1–2 Wochen dauern, bis die Lokalisierung neu veröffentlichter Inhalte verfügbar ist.

Über ML-Pakete

Die Verwendung eines ML-Pakets für Document Understanding umfasst die folgenden Schritte:

  • Sammeln Sie Dokumentbeispiele und die Anforderungen der zu extrahierenden Datenpunkte.

  • Label documents using Data Manager.

    Data Manager itself will connect to an OCR Service.

  • Exportieren Sie beschriftete Dokumente als Trainings-Dataset, und laden Sie den exportierten Ordner in den AI Center-Speicher hoch.

  • Exportieren Sie beschriftete Dokumente als Test-Dataset, und laden Sie den exportierten Ordner in den AI Center-Speicher hoch.

  • Führen Sie eine Trainingspipeline im AI Center aus.

  • Bewerten Sie die Modellleistung mit einer Auswertungspipeline in AI Center.

  • Stellen Sie das trainierte Modell als ML-Fähigkeit im AI Center bereit.

  • Query the ML Skill from an RPA workflow using the UiPath.DocumentUnderstanding.ML activity package.

    Hinweis:

    Denken Sie daran, dass die Verwendung von Document Understanding-ML-Paketen erfordert, dass die Maschine, auf der AI Center installiert ist, auf https://du-metering.uipath.com zugreifen kann.

    Wichtig:

    Beim Erstellen eines UiPath.DocumentUnderstanding.ML.Activities-Pakets im AI Center darf der Paketname kein reserviertes Python-Schlüsselwort also class, break, from, finally, global, None usw. Beachten Sie, dass diese Liste nicht vollständig ist, da der Paketname für class <pkg-name> und import <pkg-name> verwendet wird.

Dabei handelt es sich um vorgefertigte Machine-Learning-Modelle zum Klassifizieren und Extrahieren aller häufig vorkommenden Datenpunkte aus halbstrukturierten oder unstrukturierten Dokumenten, einschließlich regulärer Felder, Tabellenspalten und Klassifizierungsfeldern als Teil eines vorlagenfreien Ansatzes.

Document Understanding enthält mehrere ML-Pakete, die in vier Hauptkategorien unterteilt sind:

UiPath Document OCR

This is a non-retrainable model which can be used with the UiPath Document OCR engine activity as part of the Digitize Document activity. To be used, it must first be made public so that a URL can be copy-pasted into the UiPath Document OCR engine activity.

UiPathDocumentOCR erfordert Zugriff auf den Messungsserver von Document Understanding unter https://du.uipath.com/metering wenn die ML-Fähigkeit in einer regulären lokalen Installation des AI Center ausgeführt wird. Es ist kein Internetzugang für lokale Air Gap-Installationen des AI Center erforderlich.

Das UiPathDocumentOCR-ML-Paket im AI Center ist für die Ausführung auf GPU optimiert, daher empfehlen wir dringend, es auf GPU zu verwenden. Wenn keine GPU verfügbar ist, empfehlen wir die Verwendung des eigenständigen Docker-Containers.

Document Understanding

Dies ist ein generisches, erneut trainierbares Modell zum Extrahieren häufig vorkommender Datenpunkte aus jeder Art strukturierter oder halbstrukturierter Dokumente, wobei ein Modell von Grund auf neu aufgebaut wird. Dieses ML-Paket muss trainiert werden. Wenn es zunächst ohne Training bereitgestellt wird, kommt es bei der Bereitstellung zu einem Fehler, der angibt, dass das Modell nicht trainiert ist.

Out-of-the-box Pre-trained ML Packages

Dabei handelt es sich um erneut trainierbare ML-Pakete, die Kenntnisse verschiedener Machine Learning-Modelle enthalten.

Sie können angepasst werden, um zusätzliche Felder zu extrahieren oder zusätzliche Sprachen mithilfe von Pipeline-Ausführungen zu unterstützen. Mithilfe modernster Lerntransferfunktionen kann dieses Modell an zusätzlich beschrifteten Dokumenten erneut trainiert und auf einen bestimmten Anwendungsfall zugeschnitten oder erweitert werden, um zusätzliche Sprachen mit lateinischem, kyrillischem oder griechischem Alphabet zu unterstützen.

Das verwendete Dataset kann dieselben Felder, eine Teilmenge der Felder oder zusätzliche Felder haben. Sie müssen Felder mit den gleichen Namen wie im out-of-the-box Modell verwenden, um von den bereits integrierten Erkenntnissen im vortrainierten Modell zu profitieren.

Diese ML-Pakete sind:

  • Invoices: The fields extracted out-of-the-box can be found here.
  • InvoicesAustraliaPreview: The fields extracted out-of-the-box can be found here.
  • InvoicesIndiaPreview: The fields extracted out-of-the-box can be found here.
  • InvoicesJapanPreview: The fields extracted out-of-the-box can be found here.
  • Receipts: The fields extracted out-of-the-box can be found here.
  • PurchaseOrdersPreview: The fields extracted out-of-the-box can be found here.
  • UtilityBillsPreview: The fields extracted out-of-the-box can be found here.

Bei diesen Modellen handelt es sich um Deep Learning-Architekturen, die von UiPath erstellt wurden. Eine GPU kann zur Ausgabe- und auch zur Trainingszeit verwendet werden, ist jedoch nicht obligatorisch. Mit einer GPU wird die Geschwindigkeit mehr als verzehnfacht, insbesondere für das Training.

Andere out-of-the-box ML-Pakete

Dabei handelt es sich um nicht erneut trainierbare Pakete, die für Nicht-ML-Komponenten der Document Understanding Suite erforderlich sind.

Diese ML-Pakete sind:

  • FormExtractor: Deploy as Public Skill and paste the URL into the Form Extractor activity.
  • IntelligentFormExtractor: Deploy as Public Skill and paste the URL into the Intelligent Form Extractor activity. Make sure to first deploy the HandwritingRecognition ML Skill and configure that as the OCR for this package.
  • IntelligentKeywordClassifier: Deploy as Public Skill and paste the URL into the Intelligent Keyword Classifier activity.
  • HandwritingReognition: Als öffentliche Fähigkeit bereitstellen und als OCR beim Erstellen des Pakets IntelligentFormExtractor verwenden.

War diese Seite hilfreich?

Verbinden

Benötigen Sie Hilfe? Support

Möchten Sie lernen? UiPath Academy

Haben Sie Fragen? UiPath-Forum

Auf dem neuesten Stand bleiben