- Überblick
- Verträge zur Dokumentverarbeitung
- Versionshinweise
- Über die DocumentProcessing-Verträge
- Box-Klasse
- IPersistedActivity-Schnittstelle
- PrettyBoxConverter-Klasse
- IClassifierActivity-Schnittstelle
- IClassifierCapabilitiesProvider-Schnittstelle
- ClassifierDocumentType-Klasse
- ClassifierResult-Klasse
- ClassifierCodeActivity-Klasse
- ClassifierNativeActivity-Klasse
- ClassifierAsyncCodeActivity-Klasse
- ClassifierDocumentTypeCapability-Klasse
- ContentValidationData Class
- EvaluatedBusinessRulesForFieldValue Class
- EvaluatedBusinessRuleDetails Class
- ExtractorAsyncCodeActivity-Klasse
- ExtractorCodeActivity-Klasse
- ExtractorDocumentType-Klasse
- ExtractorDocumentTypeCapabilities-Klasse
- ExtractorFieldCapability-Klasse
- ExtractorNativeActivity-Klasse
- ExtractorResult-Klasse
- FieldValue Class
- FieldValueResult Class
- ICapabilitiesProvider-Schnittstelle
- IExtractorActivity-Schnittstelle
- ExtractorPayload-Klasse
- DocumentActionPriority-Enumeration
- DocumentActionData-Klasse
- DocumentActionStatus-Enumeration
- DocumentActionType-Enumeration
- DocumentClassificationActionData-Klasse
- DocumentValidationActionData-Klasse
- UserData-Klasse
- Document-Klasse
- DocumentSplittingResult-Klasse
- DomExtensions-Klasse
- Page-Klasse
- PageSection-Klasse
- Polygon-Klasse
- PolygonConverter-Klasse
- Metadatenklasse
- WordGroup-Klasse
- Word-Klasse
- ProcessingSource-Enumeration
- ResultsTableCell-Klasse
- ResultsTableValue-Klasse
- ResultsTableColumnInfo-Klasse
- ResultsTable-Klasse
- Rotation-Enumeration
- Rule Class
- RuleResult Class
- RuleSet Class
- RuleSetResult Class
- SectionType-Enumeration
- WordGroupType-Enumeration
- IDocumentTextProjection-Schnittstelle
- ClassificationResult-Klasse
- ExtractionResult-Klasse
- ResultsDocument-Klasse
- ResultsDocumentBounds-Klasse
- ResultsDataPoint-Klasse
- ResultsValue-Klasse
- ResultsContentReference-Klasse
- ResultsValueTokens-Klasse
- ResultsDerivedField-Klasse
- ResultsDataSource-Enumeration
- ResultConstants-Klasse
- SimpleFieldValue-Klasse
- TableFieldValue-Klasse
- DocumentGroup-Klasse
- DocumentTaxonomy-Klasse
- DocumentType-Klasse
- Field-Klasse
- FieldType-Enumeration
- FieldValueDetails Class
- LanguageInfo-Klasse
- MetadataEntry-Klasse
- TextType-Aufzählung
- TypeField-Klasse
- ITrackingActivity-Schnittstelle
- ITrainableActivity-Schnittstelle
- ITrainableClassifierActivity-Schnittstelle
- ITrainableExtractorActivity-Schnittstelle
- TrainableClassifierAsyncCodeActivity-Klasse
- TrainableClassifierCodeActivity-Klasse
- TrainableClassifierNativeActivity-Klasse
- TrainableExtractorAsyncCodeActivity-Klasse
- TrainableExtractorCodeActivity-Klasse
- TrainableExtractorNativeActivity-Klasse
- BasicDataPoint-Klasse
- BasicValue-Klasse
- ComponentCollection-Facade-Klasse
- DataPointFacadeBase-Klasse
- ExtractionResultHandler-Klasse
- FieldGroupDataPoint-Klasse
- FieldGroupValue-Klasse
- FieldLookupBase-Klasse
- FieldRedactionSettings-Klasse
- RedactionOptions-Klasse (Vorschau)
- Aufzählung des Redaktionstyps
- ResultsValueFacadeBase-Klasse
- TableDataPoint-Klasse
- TableRow-Klasse
- TableValue-Klasse
- PlatzhalterDataPoint-Klasse
- PlatzhalterDataPointCollection-Klasse
- Document Understanding ML
- Document Understanding OCR Local Server
- Document Understanding
- Versionshinweise
- Über das Document Understanding-Aktivitätspaket
- Projektkompatibilität
- Konfigurieren einer externen Verbindung
- Document Understanding-codierte Automatisierungs-APIs (Vorschau)
- PDF-Passwort festlegen
- Merge PDFs
- Get PDF Page Count
- Extract PDF Text
- Extract PDF Images
- PDF-Seitenbereich extrahieren
- Extract Document Data
- Validierungsaufgabe erstellen und warten
- Wait for Validation Task and Resume
- Create Validation Task
- Create Document Validation Artifacts
- Artefakte der Dokumentvalidierung abrufen
- Dokument klassifizieren (Classify Document)
- Create Classification Validation Task
- Create Classification Validation Task and Wait
- Wait For Classification Validation Task And Resume
- IntelligentOCR
- Versionshinweise
- Über das IntelligentOCR-Aktivitätspaket
- Projektkompatibilität
- Taxonomie laden (Load Taxonomy)
- Digitalisieren von Dokumenten
- Dokumentbereich klassifizieren (Classify Document Scope)
- Schlüsselwortbasierte Classifier (Keyword Based Classifier)
- Document Understanding-Projektklassifizierer
- Intelligenter Schlüsselwortklassifizierer
- Create Document Validation Action
- Create Document Validation Artifacts
- Artefakte der Dokumentvalidierung abrufen
- Wait For Document Classification Action And Resume
- Klassifizierer-Scope trainieren
- Keyword Based Classifier Trainer
- Intelligent Keyword Classifier Trainer
- Datenextraktionsumfang
- Document Understanding-Projektextraktor
- Document Understanding Project Extractor Trainer
- Regex Based Extractor
- Form Extractor
- Extraktor für intelligente Formulare
- Dokument zensieren
- Create Document Validation Action
- Wait For Document Validation Action And Resume
- Train Extractors Scope
- Extraktionsergebnisse exportieren
- Machine Learning Extractor
- Machine Learning Extractor Trainer
- Machine Learning Classifier
- Machine Learning Classifier Trainer
- Generativer Klassifizierer
- Generativer Extraktor
- Konfigurieren der Authentifizierung
- ML-Services
- OCR
- OCR-Verträge
- Versionshinweise
- Über die OCR-Verträge
- Projektkompatibilität
- IOCRActivity-Schnittstelle
- OCRAsyncCodeActivity-Klasse
- OCRCodeActivity-Klasse
- OCRNativeActivity-Klasse
- Character-Klasse
- OCRResult-Klasse
- Word-Klasse
- FontStyles-Enumeration
- OCRRotation-Enumeration
- OCRCapabilities-Klasse
- OCRScrapeBase-Klasse
- OCRScrapeFactory-Klasse
- ScrapeControlBase-Klasse
- ScrapeEngineUsages-Enumeration
- ScrapeEngineBase
- ScrapeEngineFactory-Klasse
- ScrapeEngineProvider-Klasse
- OmniPage
- PDF
- Versionshinweise
- Über das PDF-Aktivitätspaket
- Projektkompatibilität
- PDF-codierte Automatisierungs-APIs (Vorschau)
- E-Mail in PDF konvertieren (Vorschau)
- HTML in PDF konvertieren (Vorschau)
- Text in PDF konvertieren (Vorschau)
- Exportieren einer PDF-Seite als Bild
- Extract Attachments from PDF
- Bilder aus PDF exportieren
- PDF-Seitenbereich extrahieren
- Get PDF Page Count
- PDF-Dateien zusammenfügen
- Verwalten des PDF-Passworts
- PDF-Text lesen (Read PDF Text)
- PDF über OCR lesen (Read PDF With OCR)
- XPS-Text lesen (Read XPS Text)
- XPS über OCR lesen (Read XPS With OCR)
- [Nicht aufgeführt] Abbyy
- Versionshinweise
- Über das Abbyy-Aktivitätspaket
- Projektkompatibilität
- Abbyy OCR
- Abbyy Cloud OCR
- FlexiCapture Classifier
- FlexiCapture Extractor
- FlexiCapture Scope
- Dokument klassifizieren (Classify Document)
- Dokument verarbeiten (Process Document)
- Dokument validieren (Validate Document)
- Dokument exportieren (Export Document)
- Feld erhalten (Get Field)
- Tabelle erhalten (Get Table)
- Vorbereiten der Validierungsstationsdaten
- [Nicht aufgeführt] Abbyy Embedded
Codierte Automatisierungs-APIs für das Document Understanding-Aktivitätspaket, die Dokumentklassifizierung, Datenextraktion und Validierungsartefakte abdecken.
UiPath.DocumentUnderstanding.Activities
Codierte Workflow-API zum Klassifizieren von Dokumenten, Extrahieren strukturierter Daten und Erstellen und Abrufen von Artefakten zur Dokumentvalidierung. Diese APIs sind beim Entwerfen von codierten Automatisierungen verfügbar. Eine Einführung in codierte Automatisierungen und deren Entwerfen mithilfe von APIs finden Sie unter Codierte Automatisierungen.
- Dienstzugriff:
du(TypIDocumentUnderstandingService) - Erforderliches Paket:
"UiPath.DocumentUnderstanding.Activities": "*"in denproject.json-Abhängigkeiten.
Automatisch importierte Namensräume
Die folgenden Namespaces sind automatisch in codierten Workflows verfügbar, wenn das Document Understanding-Paket installiert wird:
UiPath.DocumentUnderstanding.Activities.ApiUiPath.Platform.ResourceHandlingUiPath.DocumentProcessing.Contracts.ActionsUiPath.IntelligentOCR.StudioWeb.Activities.DataExtractionUiPath.IntelligentOCR.StudioWeb.Activities.DocumentClassification
Serviceübersicht
Der du -Dienst macht jeden Document Understanding-Vorgang als direkten Methodenaufruf verfügbar. Es ist keine Verbindung oder kein Scope zum Öffnen vorhanden. Aufrufmethoden für den Dienstzugriff direkt:
var extracted = du.ExtractDocumentData(@"C:\invoices\invoice.pdf", "Invoices", "Production", "invoice");
var extracted = du.ExtractDocumentData(@"C:\invoices\invoice.pdf", "Invoices", "Production", "invoice");
Der Dienst spiegelt die Aktivitäten Studio Web Classify Document, Extract Document Data, Create Document Validation Artifacts und Retrieve Document Validation Artifacts wider .
Projektversion oder Tag
Der Parameter projectVersionOrTag ist dem Dropdownmenü Version von Studio zugeordnet. Übergeben Sie entweder einen Versionsnamen (z. B. v3) oder ein Tag (z. B. Production, Staging, live). Die Laufzeit löst die Art auf, die dem Projekt entspricht. Verwenden Sie für das vordefinierte Projekt Production.
Allgemeine Parameter
timeoutMs(Int) – Timeout in Millisekunden für Klassifizierung und Extraktion. Die Standardeinstellung ist3600000(1 Stunde).docType(String) – Die Dokumenttyp-ID. Übergeben Sie den Namen des Dokumententyps für Projekte mit mehreren Dokumenttypen oder eine leere Zeichenfolge für Projekte im Intelligente Datenextraktion und Verarbeitung (IXP)-Stil, die nur einen Extraktor pro Version haben.
Klassifizierung
DocumentData ClassifyDocument(string documentPath, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)
Klassifiziert ein Dokument aus einem lokalen Dateipfad gegen ein Document Understanding-Projekt. Gibt ein Dokumentdatenobjekt zurück, einschließlich des vorhergesagten Dokumenttyps.
DocumentData ClassifyDocument(IResource file, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)
Klassifiziert die angegebene Dokumentressource. Akzeptiert alle IResource, wie z. B. die Ausgabe der Aktivität Path Exists oder Get Local File or Folder .
Datenextraktion
IDocumentData<DictionaryData> ExtractDocumentData(string documentPath, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)
Extrahiert strukturierte Daten aus einem Dokument in einem lokalen Dateipfad. Gibt die extrahierten Felder als IDocumentData<DictionaryData> zurück.
IDocumentData<DictionaryData> ExtractDocumentData(IResource file, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)
Extrahiert strukturierte Daten aus der angegebenen Dokumentressource.
IDocumentData<DictionaryData> ExtractDocumentData(DocumentData classifiedDocument, string projectName, string projectVersionOrTag, string docType = null, int timeoutMs = 3600000)
Extrahiert strukturierte Daten aus einem Dokument, das bereits mit ClassifyDocument klassifiziert wurde, wodurch eine erneute Digitalisierung der Datei vermieden wird. Wenn docType gleich null ist, wird er vom Dokumenttyp des klassifizierten Dokuments abgeleitet.
Validierungsartefakte
ContentValidationData CreateDocumentValidationArtifacts(IDocumentData<DictionaryData> automaticExtractionResults, string orchestratorFolderName, string orchestratorBucketName = null)
Lädt Extraktionsergebnisse in den Orchestrator-Speicher hoch und gibt ein ContentValidationData -Handle zurück. Verwenden Sie das Handle, um eine Validierungsaktion zu erstellen oder die Ergebnisse später mit RetrieveDocumentValidationArtifacts abzurufen. Wenn orchestratorBucketName gleich null ist, wird der Standard-Bucket verwendet.
IDocumentData<DictionaryData> RetrieveDocumentValidationArtifacts(ContentValidationData contentValidationData, object completedAppAction = null, bool removeDataFromStorage = false, bool returnAutomaticExtractionResults = false)
Ruft validierte Extraktionsergebnisse aus dem Speicher ab. Wenn removeDataFromStorage gleich true ist, werden die Speicherartefakte nach dem Abrufen gelöscht. Wenn returnAutomaticExtractionResults auf true festgelegt ist, werden die ursprünglichen Ergebnisse der automatischen Extraktion anstelle der validierten zurückgegeben.
Beziehung zu den Aktivitäten
Die codierten API- und die Document Understanding XAML-Aktivitäten werden in derselben Laufzeit ausgeführt, sodass ein codierter Workflow das gleiche Klassifizierungs-, Extraktions- und Validierungsartefakt-Verhalten erreicht wie die Aktivitäten Extract Document Data und Classify Document . Der Unterschied ist die Aufrufform: Der Service nimmt einfache Dateipfade oder IResource -Eingaben und gibt Dokumentdatenobjekte direkt zurück, und Sie verwenden die gewöhnliche try/catch anstelle der Aktivität Bei Fehler fortsetzen .
Häufige Muster
Klassifizieren und dann extrahieren
Dieses Muster klassifiziert ein Dokument und verwendet dann das klassifizierte Ergebnis zum Extrahieren von Daten wieder, wodurch die Digitalisierung der Datei ein zweites Mal vermeidet.
[Workflow]
public void Execute()
{
var classified = du.ClassifyDocument(@"C:\docs\file.pdf", "MyProject", "Production");
Log($"Document type: {classified.DocumentType.DisplayName}");
// Reuses the classified document, so the file is not digitized again.
var extracted = du.ExtractDocumentData(classified, "MyProject", "Production");
}
[Workflow]
public void Execute()
{
var classified = du.ClassifyDocument(@"C:\docs\file.pdf", "MyProject", "Production");
Log($"Document type: {classified.DocumentType.DisplayName}");
// Reuses the classified document, so the file is not digitized again.
var extracted = du.ExtractDocumentData(classified, "MyProject", "Production");
}
Extrahieren und Vorbereiten von Daten für App-Aufgaben, die das Validierungssteuerelement enthalten
Dieses Muster extrahiert Daten, lädt sie als Validierungsartefakte zur Überprüfung in einer App-Aufgabe in den Speicher hoch und ruft die validierten Ergebnisse nach Abschluss der Aktion ab.
[Workflow]
public void Execute()
{
var extracted = du.ExtractDocumentData(@"C:\docs\invoice.pdf", "Invoices", "Production", "invoice");
// Upload the results so they can be reviewed in Action Center.
var artifacts = du.CreateDocumentValidationArtifacts(extracted, "Shared");
// After the Action Center validation action completes, retrieve the validated results.
var validated = du.RetrieveDocumentValidationArtifacts(artifacts, removeDataFromStorage: true);
}
[Workflow]
public void Execute()
{
var extracted = du.ExtractDocumentData(@"C:\docs\invoice.pdf", "Invoices", "Production", "invoice");
// Upload the results so they can be reviewed in Action Center.
var artifacts = du.CreateDocumentValidationArtifacts(extracted, "Shared");
// After the Action Center validation action completes, retrieve the validated results.
var validated = du.RetrieveDocumentValidationArtifacts(artifacts, removeDataFromStorage: true);
}
- Automatisch importierte Namensräume
- Serviceübersicht
- Projektversion oder Tag
- Allgemeine Parameter
- Klassifizierung
DocumentData ClassifyDocument(string documentPath, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)DocumentData ClassifyDocument(IResource file, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)- Datenextraktion
IDocumentData<DictionaryData> ExtractDocumentData(string documentPath, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)IDocumentData<DictionaryData> ExtractDocumentData(IResource file, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)IDocumentData<DictionaryData> ExtractDocumentData(DocumentData classifiedDocument, string projectName, string projectVersionOrTag, string docType = null, int timeoutMs = 3600000)- Validierungsartefakte
ContentValidationData CreateDocumentValidationArtifacts(IDocumentData<DictionaryData> automaticExtractionResults, string orchestratorFolderName, string orchestratorBucketName = null)IDocumentData<DictionaryData> RetrieveDocumentValidationArtifacts(ContentValidationData contentValidationData, object completedAppAction = null, bool removeDataFromStorage = false, bool returnAutomaticExtractionResults = false)- Beziehung zu den Aktivitäten
- Häufige Muster
- Klassifizieren und dann extrahieren
- Extrahieren und Vorbereiten von Daten für App-Aufgaben, die das Validierungssteuerelement enthalten