UiPath Documentation
document-understanding
2021.10
false
Document Understanding-Benutzerhandbuch.
Wichtig :
Es kann 1–2 Wochen dauern, bis die Lokalisierung neu veröffentlichter Inhalte verfügbar ist.

Intelligenter Schlüsselwortklassifizierer

Zweck des Intelligent Keyword Classifier

The Intelligent Keyword Classifier is a classifier that uses the word vector it learns from files of certain document types to perform document classification.

Der Algorithmus basiert auf dem Konzept der Wiederholung von Inhalten für den gleichen Dokumenttyp und beginnt mit der Annahme, dass Dokumenttypen eine Reihe von Wörtern haben, die normalerweise in diesen Dokumenttypen vorkommen, wodurch eine Vektorähnlichkeitsberechnung möglich ist.

Beim Klassifizieren einer Datei in einen Dokumenttyp führt der Intelligent Keyword Classifier folgende Aktionen aus:

  • Er findet den nächsten Wortvektor, dem eine Datei ähnlicher ist,
  • Er meldet den Dokumenttyp mit der höchsten Bewertung für die zugrundeliegenden übereinstimmenden Hauptwörter.

Der Intelligent Keyword Classifier verfügt auch über Funktionen zur Aufteilung von Dateien, was bedeutet, dass er mehr als eine Klasse für eine bestimmte Datei bei separaten Seitenbereichen melden kann.

Einsatzbereich

Dieser Klassifizierer eignet sich, wenn:

  • Ihre Dateien einen oder mehrere Dokumenttypen in einer einzelnen Datei enthalten.
  • Ihre Dokumenttypen sich relativ einfach durch den Inhalt unterscheiden lassen.

Spezielle Anforderungen

Sie müssen Ihren Automation Cloud Document Understanding API-Schlüssel verwenden oder Ihre eigene Instanz des Intelligent Keyword Classifier im lokalen AI Center hosten, um diesen Klassifizierer zu verwenden.

Wie zur Entwurfszeit konfiguriert wird

Sie können den Intelligent Keyword Classifier zur Entwurfszeit konfigurieren, indem Sie einfach auf den Assistenten Lernfunktion verwalten der Aktivität zugreifen. Der gleiche Assistent kann zum Überprüfen von Daten verwendet werden, die während der Trainingsphase für die Dokumentklassifizierung gesammelt wurden, indem der gleiche Assistent mit einem aktualisierten Lerndateipfad geöffnet wird.

Mit diesem Assistenten können Sie die Trainingsdaten konfigurieren und verwalten, die von dieser Aktivität zum Identifizieren des Dokumenttyps und zum Klassifizieren der Dokumente verwendet werden. Er wurde für die Bearbeitung eines Dateipfads entwickelt. Wenn stattdessen eine Lerndaten-Option mit einer Variablen verwendet wird, werden Sie gefragt, ob Sie entweder einen bestimmten Dateipfad bearbeiten oder diesen Vorgang abbrechen möchten.

Hinweis:

The Manage Learning wizard only works when the activity is configured with a Learning File Path string. It does not work with a Learning File Path set as a variable input, or with a LearningData string input.

  1. Fügen Sie Ihrem Workflow eine Aktivität vom Typ Intelligent Keyword Classifier/Intelligent Keyword Classifier Trainer hinzu.

  2. Konfigurieren Sie Ihre Intelligent Keyword Classifier-Aktivität, indem Sie den Pfad einer .json-Datei hinzufügen.

    • Wenn kein Pfad angegeben ist und die Option Lernfunktion verwalten geklickt wird, wird ein Popup angezeigt, in dem nach einer Eingabe des Lerndateipfads gefragt wird. Sobald der Pfad angegeben ist, wird der Assistent geöffnet.
    • Eine Variable kann anstelle einer .json-Datei hinzugefügt werden, aber da der Assistent das Lernmuster nicht auf eine LearningData-Variable anwenden kann, wird nach einem bestimmten Dateipfad gefragt, der bearbeitet werden kann.
  3. Klicken Sie auf die Option Lernfunktion verwalten.

    • Das Fenster Assistent wird geöffnet.

  4. Wenn kein Pfad angegeben ist und die Option „Lernfunktion verwalten“ geklickt wird, wird ein Popup angezeigt, in dem nach einem Lerndateipfad gefragt wird. Sobald der Pfad angegeben ist, wird der Assistent geöffnet.

    Hinweis:

    Auch wenn keine Datei vom Typ .json verfügbar ist, können Sie den Namen einer neuen .json-Datei direkt in die Aktivität einfügen. Die .json-Datei wird dann automatisch im angegebenen Ordner erstellt.

Der folgende Screenshot zeigt einen Dokumenttyp, der trainiert wurde, einen, der nicht trainiert wurde, und einen, der trainiert und aufgerufen wurde, um angezeigt oder gelöscht zu werden.

For document types that have not been trained yet, design-time training can be performed using the Start Training option. For document types that already have some training, you can either delete it to start over, by using this Dokumentationsbild option, or perform extra training (cumulative to the already existing one) using the edit Dokumentationsbild option.

Hinweis:

Zu Verwendende Trainingsdateien müssen eine einzelne Dokumenttypinstanz pro Datei enthalten. Führen Sie kein Entwurfszeittraining für Dateien aus, die zwei oder mehr Dokumenttypen enthalten, da das fehlerhafte Trainingsdaten ergibt.

Sobald ein neues Training gestartet wurde, wird ein neuer Bildschirm angezeigt, auf dem nach den Trainingsdateien und dem OCR-Modul gefragt wird, die verwendet werden sollen.

Each OCR engine comes with its own set of custom options. Here you can find more details about all options available for each OCR engine.

Hinweis:

Die folgenden OCR-Module unterstützen keine gedrehten Dokumente und sollten nicht zum Verarbeiten solcher Dokumente verwendet werden:

  • Microsoft OCR
  • Tesseract OCR

Nur Trainingsdaten von trainierten Dokumenttypen dürfen exportiert werden. Dokumenttypen, die nicht trainiert wurden, können nicht ausgewählt werden.

Exportieren von Trainingsdaten

Sie können Trainingsdaten wie folgt exportieren:

  1. Wählen Sie trainierte Dokumenttypen aus.

  2. Klicken Sie auf die Schaltfläche Exportieren.

  3. Wenn Sie nicht gespeicherte Änderungen haben, wird die folgende Meldung angezeigt.

  4. Klicken Sie auf Ja.

  5. Speichern Sie das Trainingsdatenarchiv mit dem gewünschten Namen.

  6. Es wird eine Meldung angezeigt, die angibt, wie viele Dokumenttypt-Trainingsdatensätze exportiert wurden. Zum Beispiel:

  7. Klicken Sie auf OK, um zum Hauptbildschirm des Assistenten zurückzukehren.

Importieren von Trainingsdaten

Sie können Trainingsdaten wie folgt importieren:

  1. Klicken Sie auf die Schaltfläche Importieren.

  2. Wählen Sie das Trainingsdatenarchiv aus und klicken Sie auf Öffnen.

  3. Wählen Sie die gewünschten Dokumenttypen aus.

  4. Klicken Sie auf die Schaltfläche Importieren.

  5. Die Trainingsdaten werden importiert.

In der folgenden Tabelle ist jede Meldung veranschaulicht, die beim Importieren von Trainingsdaten angezeigt wird:

Import TypeAngezeigte Meldung
Neuer Dokumenttyp und WortvektorenDieser Dokumenttyp wird der Taxonomie hinzugefügt.
Neuer Wortvektor (zuvor war keiner definiert)Keine Angabe
Identischer Dokumenttyp und WortvektorDer Wortvektor für diesen Dokumenttyp wird überschrieben.

Wie trainiert wird

Platzieren Sie die Aktivität Intelligent Keyword Classifier Trainer in einen Train Classifiers Scope und konfigurieren Sie sie entsprechend.

We cannot enforce training file consistency across parallel trainings at the activity level. Two possible solutions for this issue are provided by Document Understanding Process. Both consist of traffic control:

  1. Dateien sperren (standardmäßig im Prozess implementiert): Benennen Sie die Datei mithilfe der .lock-Erweiterung um, ändern und speichern Sie die Datei, und benennen Sie die Datei dann erneut um, indem Sie die .lock-Erweiterung entfernen.
  2. manuelles Einrichten einer speziellen Warteschlange: Erstellen Sie eine leere Warteschlange im Orchestrator und integrieren Sie Ihre beiden Aktivitäten aus dem Projekt.

For more information on how to train a Classifier, check Document Classification Training.

War diese Seite hilfreich?

Verbinden

Benötigen Sie Hilfe? Support

Möchten Sie lernen? UiPath Academy

Haben Sie Fragen? UiPath-Forum

Auf dem neuesten Stand bleiben