UiPath Documentation
document-understanding
2022.4
true
Document Understanding-Benutzerhandbuch.
Wichtig :
Es kann 1–2 Wochen dauern, bis die Lokalisierung neu veröffentlichter Inhalte verfügbar ist.

Mit einem zusätzlichen Feld erneut trainierte Rechnungen

Wichtig:

Das Ziel dieser Seite ist es, neuen Benutzern zu helfen, sich mit Document Understanding vertraut zu machen.

For scalable production deployments, we strongly recommend using the Document Understanding Process available in UiPath Studio under the Templates section.

Dieser Schnellstart zeigt Ihnen, wie Sie das out-of-the-box ML-Modell Invoices erneut trainieren, um ein weiteres Feld zu extrahieren.

Let’s use the same workflow we used for the receipts in the previous quickstart and modify it so it can support invoices.

Dazu müssen wir in unserem Workflow die folgenden Schritte ausführen:

  1. Die Taxonomie ändern
  2. Einen Klassifizierer hinzufügen
  3. Einen Machine Learning Extractor hinzufügen
  4. Die Daten beschriften
  5. Das ML-Modell für Rechnungen (Invoices) erneut trainieren

Sehen wir uns nun jeden Schritt im Detail an.

1. Die Taxonomie ändern

In diesem Schritt müssen wir die Taxonomie ändern, um den Rechnungsdokumenttyp hinzuzufügen.

To do so, open Taxonomy Manager and create group named "Semi Structured Documents", a category named "Finance", a document type named "Invoices". Create the above listed fields with user-friendly names along with respective data types.

  • name (Name) – Text
  • vendor-addr (Lieferantenadresse) – Adresse
  • billing-name (Rechnungsname) – Text
  • billing-address (Rechnungsadresse) – Adresse
  • shipping-address (Lieferadresse) – Adresse
  • invoice-no (Rechnungsnummer) – Text
  • po-no (Auftragsnummer) – Text
  • vendor-vat-no (Umsatzsteuer Lieferant) – Text
  • date (Datum) – Datum
  • tax (Steuer) – Zahl
  • total (gesamt) – Zahl
  • payment-terms (Zahlungsbedingungen) – Text
  • net-amount (Nettosumme) – Zahl
  • due-date (Fälligkeitsdatum) – Datum
  • Rabatt – Number
  • Versandkosten - Number
  • payment-addr – Address
  • description (Beschreibung) – Text
  • items (Posten) – Tabelle
    • description (Beschreibung) – Text
    • quantity (Menge) – Zahl
    • unit-price (Stückpreis) – Zahl
    • line-amount (Zeilensumme) – Zahl
    • item-po-no – Text
    • line-no – Text
    • teil-nein – Text
    • billing-vat-no (Umsatzsteuernummer) – Text

2. Einen Klassifizierer hinzufügen

In diesem Schritt müssen wir einen Klassifizierer hinzufügen, damit wir sowohl Belege als auch Rechnungen mit unserem Workflow verarbeiten können.

Da unser Workflow jetzt zwei Dokumenttypen unterstützt, „Belege“ und „Rechnungen“, müssen wir den Klassifizierer hinzufügen, um zwischen verschiedenen Dokumenttypen zu unterscheiden, die als Eingabe kommen:

  1. Add a Classify Document Scope after the Digitize Document activity and provide the DocumentPath,DocumentText, DocumentObjectModel, and Taxonomy as input arguments and capture the ClassificationResults in a new variable. We need this variable to check what document(s) we are processing.

  2. We also need to specify one or more classifiers. In this example, we are using the Intelligent Keyword Classifier. Add it to the Classify Document Scope activity.

    This page helps you take an educated decision on what classification method you should use in different scenarios.

  3. Train the classifier as described here.

  4. Konfigurieren Sie den Klassifizierer, indem Sie ihn für beide Dokumenttypen aktivieren.

  5. Depending on your use case, you might want to validate the classification. You can do that using the Present Classification Station or the Create Document Classification Action and Wait For Document Classification Action And Resume activities.

3. Einen Machine Learning Extractor hinzufügen

In this step, we need to add a Machine Learning Extractor to the Data Extraction Scope activity and connect it to the Invoices public endpoint.

Das Verfahren ist das gleiche wie bei dem vorherigen Machine Learning Extractor für Belege, den wir zuvor hinzugefügt haben:

  1. Fügen Sie neben dem Machine Learning Extractor für Belege die Aktivität Machine Learning Extractor hinzu.

  2. Provide the Invoices public endpoint, namely https://du.uipath.com/ie/invoices/, and an API key to the extractor.

  3. Konfigurieren Sie den Extraktor so, dass er mit Rechnungen arbeitet, indem Sie die im Taxonomiemanager erstellten Felder den im ML-Modell verfügbaren Feldern zuordnen:

  4. Vergessen Sie nicht, die vom Classify Document Scope ausgegebene Variable ClassificationResults als Eingabe für den Data Extraction Scope zu verwenden, anstatt eine DocumentTypeId anzugeben.

    Am Ende sollte es ungefähr so aussehen:

  5. Führen Sie den Workflow aus, um zu testen, dass er mit Rechnungen ordnungsgemäß funktioniert.

4. Die Daten beschriften

Wir müssen die Daten beschriften, bevor das ML-Basismodell für Invoices erneut trainiert wird, damit es das neue IBAN-Feld unterstützen kann.

  1. Sammeln Sie die Anforderungen und Stichprobendokumente in ausreichendem Umfang, um die Komplexität des Anwendungsfalls zu bewältigen.

    Label 50 pages, as explained on this documentation page.

  2. Gain access to an instance of Document Manager either on premises or in AI Center in the Cloud. Make sure you have the permissions to use Document Manager.

  3. Erstellen Sie ein AI Center-Projekt, wechseln Sie zu Datenbeschriftung -> UiPath Document Understanding und erstellen Sie eine Datenbeschriftung-Sitzung.

  4. Configure an OCR Engine as described here, try importing a diverse set of your production documents and make sure that the OCR engine reads the text you need to extract.

    More suggestions in this section. Only proceed to next step after you have settled on a OCR engine.

  5. Create a fresh Document Manager session, and import a Training set and an Evaluation set, while making sure to check the Make this a Test set checkbox when importing the Evaluation set.

  6. Erstellen und konfigurieren Sie das IBAN-Feld.

    More advanced guidelines are available in this section.

  7. Label a Training dataset and an Evaluation dataset as described here.

    Die Vorbeschriftungsfunktion von Document Manager kann die Beschriftung viel einfacher machen.

  8. Exportieren Sie zuerst den Auswertungssatz und dann den Trainingssatz in das AI Center, indem Sie sie im Filter-Dropdownmenü oben in der Document Manager-Ansicht auswählen.

Als Nächstes erstellen wir unser Modell, trainieren es erneut und stellen es bereit.

5. Das ML-Modell für Rechnungen (Invoices) erneut trainieren

Da unser Workflow jetzt die Verarbeitung von Rechnungen unterstützt, müssen wir die IBAN aus unseren Rechnungen extrahieren. Das ist ein Feld, das standardmäßig nicht vom out-of-the-box ML-Modell für Rechnungen (Invoices) aufgenommen wird. Das bedeutet, dass wir ein neues Modell erneut trainieren müssen, beginnend mit dem Basismodell.

  1. Create an ML Package as described here. If your document type is different from the ones available out-of-the-box, then choose the DocumentUnderstanding ML Package. Otherwise, use the package closest to the document type you need to extract.

  2. Create a Training Pipeline as described here using the Input dataset which you exported in the previous section from Document Manager.

  3. Wenn das Training abgeschlossen ist und Sie die Nebenversion 1 des Pakets haben, führen Sie eine Auswertungspipeline für diese Nebenversion aus und überprüfen Sie den direkten Nebeneinander-Vergleich der evaluation.xlsx.

    Use the detailed guidelines here.

  4. If the evaluation results are satisfactory, go to the ML Skills view and create an ML Skill using the new minor version of the ML Package. If you want to use this to do prelabeling in Document Manager, you need to click on the Modify Current Deployment button at the top right of the ML Skill view and toggle on the Make ML Skill Public.

  5. Nach der Erstellung der ML-Fähigkeit müssen wir sie nun in Studio nutzen. Der einfachste Weg hierfür ist, die ML-Fähigkeit wie hier beschrieben öffentlich zu machen. Dann müssen Sie nur noch den öffentlichen Endpunkt des ML-Modells Invoices, den wir ursprünglich dem Machine Learning Extractor in unserem Workflow hinzugefügt haben, durch den öffentlichen Endpunkt der ML-Fähigkeit ersetzen.

  6. Führen Sie den Workflow aus. Sie sollten nun sehen, dass das neu hinzugefügte IBAN-Feld zusammen mit den Standardrechnungen extrahiert wird.

Beispiel herunterladen

Laden Sie dieses Beispielprojekt unter diesem Link herunter . Sie müssen den Machine Learning Extractor für Rechnungen vom Endpunktmodus in Ihre trainierte ML-Fähigkeit ändern.

War diese Seite hilfreich?

Verbinden

Benötigen Sie Hilfe? Support

Möchten Sie lernen? UiPath Academy

Haben Sie Fragen? UiPath-Forum

Auf dem neuesten Stand bleiben