- Visão geral
- Contratos de Processamento de Documentos
- Notas de versão
- Sobre os Contratos de Processamento de Documentos
- Classe Box
- Interface IPersistedActivity
- Classe PrettyBoxConverter
- Interface IClassifierActivity
- Interface IClassifierCapabilitiesProvider
- Classe ClassifierDocumentType
- Classe ClassifierResult
- Classe ClassifierCodeActivity
- Classe ClassifierNativeActivity
- Classe ClassifierAsyncCodeActivity
- Classe ClassifierDocumentTypeCapability
- ContentValidationData Class
- EvaluatedBusinessRulesForFieldValue Class
- EvaluatedBusinessRuleDetails Class
- Classe ExtractorAsyncCodeActivity
- Classe ExtractorCodeActivity
- Classe ExtractorDocumentType
- Classe ExtractorDocumentTypeCapabilities
- Classe ExtractorFieldCapability
- Classe ExtractorNativeActivity
- Classe ExtractorResult
- FieldValue Class
- FieldValueResult Class
- Interface ICapabilitiesProvider
- Interface IExtractorActivity
- Classe ExtractorPayload
- Enumeração DocumentActionPriority
- Classe DocumentActionData
- Enumeração DocumentActionStatus
- Enumeração DocumentActionType
- Classe DocumentClassificationActionData
- Classe DocumentValidationActionData
- Classe UserData
- Classe Document
- Classe DocumentSplittingResult
- Classe DomExtensions
- Classe Page
- Classe PageSection
- Classe Polígono
- Classe PolygonConverter
- Classe de metadados
- Classe WordGroup
- Classe Word
- Enumeração ProcessingSource
- Classe ResultsTableCell
- Classe ResultsTableValue
- Classe ResultsTableColumnInfo
- Classe ResultsTable
- Enumeração Rotation
- Rule Class
- RuleResult Class
- RuleSet Class
- RuleSetResult Class
- Enumeração SectionType
- Enumeração WordGroupType
- Interface IDocumentTextProjection
- Classe ClassificationResult
- Classe ExtractionResult
- Classe ResultsDocument
- Classe ResultsDocumentBounds
- Classe ResultsDataPoint
- Classe ResultsValue
- Classe ResultsContentReference
- Classe ResultsValueTokens
- Classe ResultsDerivedField
- Enumeração ResultsDataSource
- Classe ResultConstants
- Classe SimpleFieldValue
- Classe TableFieldValue
- Classe DocumentGroup
- Classe DocumentTaxonomy
- Classe DocumentType
- Classe Field
- Enumeração FieldType
- FieldValueDetails Class
- Classe LanguageInfo
- Classe MetadataEntry
- Enumeração de tipo de texto
- Classe TypeField
- Interface ITrackingActivity
- Interface ITrainableActivity
- Interface ITrainableClassifierActivity
- Interface ITrainableExtractorActivity
- Classe TrainableClassifierAsyncCodeActivity
- Classe TrainableClassifierCodeActivity
- Classe TrainableClassifierNativeActivity
- Classe TrainableExtractorAsyncCodeActivity
- Classe TrainableExtractorCodeActivity
- Classe TrainableExtractorNativeActivity
- Classe BasicDataPoint
- Classe BasicValue
- Classe ComponentCollectionFacade
- Classe DataPointFacadeBase
- Classe ExtractionResultHandler
- Classe FieldGroupDataPoint
- Classe FieldGroupValue
- Classe Field Lookup Base
- Classe FieldRedactionSettings
- Classe RedactionOptions (pré-visualização)
- TipoDeRedação Enum
- Classe ResultsValueFacadeBase
- Classe TableDataPoint
- Classe TableRow
- Classe TableValue
- Classe CuringaDataPoint
- Classe curingaDataPointCollection
- Document Understanding ML
- Document Understanding OCR Local Server
- Document Understanding
- Notas de versão
- Sobre o pacote de atividades Document Understanding
- Compatibilidade do projeto
- Configuração da conexão externa
- APIs de automação codificadas do Document Understanding (visualização)
- Definir Senha do PDF
- Merge PDFs
- Get PDF Page Count
- Extract PDF Text
- Extract PDF Images
- Extract PDF Page Range
- Extract Document Data
- Criar tarefa de validação e aguardar
- Aguarde a tarefa de validação e retome
- Create Validation Task
- Create Document Validation Artifacts
- Recuperar artefatos de validação de documento
- Classificar Documento
- Create Classification Validation Task
- Create Classification Validation Task and Wait
- Aguardar a tarefa de Validação de Classificação e retomar
- IntelligentOCR
- Notas de versão
- Sobre o pacote de atividades IntelligentOCR
- Compatibilidade do projeto
- Carregar Taxonomia
- Digitize Document
- Classificar Escopo do Documento
- Classificador baseado em palavra-chave
- Document Understanding Project Classifier
- Intelligent Keyword Classifier
- Create Document Classification Action
- Create Document Validation Artifacts
- Recuperar artefatos de validação de documento
- Aguardar ação de classificação do documento e retomar
- Train Classifiers Scope
- Instrutor de Classificador Baseado em Palavra-chave
- Intelligent Keyword Classifier Trainer
- Escopo da Extração de Dados
- Document Understanding Project Extractor
- Document Understanding Project Extractor Trainer
- Regex Based Extractor
- Form Extractor
- Intelligent Form Extractor
- Rasurar documento
- Create Document Validation Action
- Wait For Document Validation Action And Resume
- Escopo de Extratores de Treinamento
- Exportar Resultados da Extração
- Machine Learning Extractor
- Machine Learning Extractor Trainer
- Machine Learning Classifier
- Machine Learning Classifier Trainer
- Classificador Generativo
- Extrator Generativo
- Configuração da autenticação
- Validação de documentos com ações de aplicativos
- Validação manual para digitalizar documentos
- Extração de dados baseada em âncora usando a atividade Intelligent Form Extractor
- Validation Station
- Atividades generativas — Boas práticas
- Extrator generativo — boas práticas
- Classificador generativo — Boas práticas
- Serviços de ML
- OCR
- Contratos de OCR
- Notas de versão
- Sobre os Contratos OCR
- Compatibilidade do projeto
- Interface IOCRActivity
- Classe OCRAsyncCodeActivity
- Classe OCRCodeActivity
- Classe OCRNativeActivity
- Character Class
- Classe OCRResult
- Classe Word
- Enumeração FontStyles
- Enumeração OCRRotation
- Classe OCRCapabilities
- Classe OCRScrapeBase
- Classe OCRScrapeFactory
- Classe ScrapeControlBase
- Enumeração ScrapeEngineUsages
- ScrapeEngineBase
- Classe ScrapeEngineFactory
- Classe ScrapeEngineProvider
- OmniPage
- PDF
- Notas de versão
- Sobre o pacote de atividades PDF
- Compatibilidade do projeto
- APIs de automação codificadas em PDF (pré-visualização)
- Converter e-mail para PDF (pré-visualização)
- Converter HTML para PDF (pré-visualização)
- Converter texto para PDF (pré-visualização)
- Export PDF Page As Image
- Extrair anexos de PDF
- Extract Images From PDF
- Extract PDF Page Range
- Get PDF Page Count
- Join PDF Files
- Manage PDF Password
- Read PDF Text
- Read PDF With OCR
- Read XPS Text
- Read XPS With OCR
- [Não listado] Abbyy
- [Não listado] Abbyy Embedded
APIs de automação codificadas para o pacote de atividades do Document Understanding, cobrindo classificação de documentos, extração de dados e artefatos de validação.
UiPath.DocumentUnderstanding.Activities
API de fluxo de trabalho codificada para classificar documentos, extrair dados estruturados e criar e recuperar artefatos de validação de documentos. Essas APIs estão disponíveis ao projetar automações codificadas. Para obter uma introdução a automações codificadas e como projetá-las usando APIs, consulte Automações codificadas.
- Acessador de serviço:
du(tipoIDocumentUnderstandingService) - Pacote obrigatório:
"UiPath.DocumentUnderstanding.Activities": "*"nas dependênciasproject.json.
Namespaces importados automaticamente
Os seguintes namespaces estão disponíveis automaticamente em fluxos de trabalho codificados quando o pacote Document Understanding está instalado:
UiPath.DocumentUnderstanding.Activities.ApiUiPath.Platform.ResourceHandlingUiPath.DocumentProcessing.Contracts.ActionsUiPath.IntelligentOCR.StudioWeb.Activities.DataExtractionUiPath.IntelligentOCR.StudioWeb.Activities.DocumentClassification
Visão geral do serviço
O du serviço expõe cada operação do Document Understanding como uma chamada de método direta. Não há conexão ou escopo para abrir. Chame métodos no acessador de serviço diretamente:
var extracted = du.ExtractDocumentData(@"C:\invoices\invoice.pdf", "Invoices", "Production", "invoice");
var extracted = du.ExtractDocumentData(@"C:\invoices\invoice.pdf", "Invoices", "Production", "invoice");
O serviço espelha as atividades Studio Web Classify Document, Extract Document Data, Create Document Validation Artefatos e Retrieve Document Validation Artefatos .
Versão ou tag do projeto
O parâmetro projectVersionOrTag mapeia o menu suspenso Versão única do Studio. Passe um nome de versão (por exemplo, v3) ou uma tag (por exemplo, Production, Staging, live). O runtime resolve o tipo correspondente ao projeto. Para o projeto predefinido, use Production.
Parâmetros comuns
timeoutMs(Int) - Tempo limite em milissegundos para classificação e extração. O padrão é3600000(1 hora).docType(String) - O ID do tipo de documento. Passe o nome do tipo de documento para projetos com vários tipos de documento ou uma string vazia para projetos no estilo de Extração e Processamento Inteligente (IXP) que têm um único extrator por versão.
Classificação
DocumentData ClassifyDocument(string documentPath, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)
Classifica um documento de um caminho de arquivo local em relação a um projeto do Document Understanding. Retorna um objeto DocumentData , incluindo o tipo de documento previsto.
DocumentData ClassifyDocument(IResource file, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)
Classifica o recurso de documento fornecido. Aceita qualquer IResource, como a saída da atividade Path Exists ou Get Local File or Folder .
Extração de Dados
IDocumentData<DictionaryData> ExtractDocumentData(string documentPath, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)
Extrai dados estruturados de um documento em um caminho de arquivo local. Retorna os campos extraídos como IDocumentData<DictionaryData>.
IDocumentData<DictionaryData> ExtractDocumentData(IResource file, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)
Extrai dados estruturados do recurso de documento fornecido.
IDocumentData<DictionaryData> ExtractDocumentData(DocumentData classifiedDocument, string projectName, string projectVersionOrTag, string docType = null, int timeoutMs = 3600000)
Extrai dados estruturados de um documento já classificado com ClassifyDocument, o que evita uma nova digitalização do arquivo. Quando docType é null, ele é derivados do tipo de documento do documento classificado.
Artefatos de validação
ContentValidationData CreateDocumentValidationArtifacts(IDocumentData<DictionaryData> automaticExtractionResults, string orchestratorFolderName, string orchestratorBucketName = null)
Carrega os resultados da extração no armazenamento do Orchestrator e retorna um identificador ContentValidationData . Use o identificador para criar uma ação de validação ou para recuperar os resultados posteriormente com RetrieveDocumentValidationArtifacts. Quando orchestratorBucketName é null, o bucket padrão é usado.
IDocumentData<DictionaryData> RetrieveDocumentValidationArtifacts(ContentValidationData contentValidationData, object completedAppAction = null, bool removeDataFromStorage = false, bool returnAutomaticExtractionResults = false)
Recupera os resultados da extração validados do armazenamento. Quando removeDataFromStorage é true, os artefatos de armazenamento são excluídos após a recuperação. Quando returnAutomaticExtractionResults é true, os resultados da extração automática original são retornados em vez dos validados.
Relacionamento com as atividades
A API codificada e as atividades XAML do Document Understanding são executadas no mesmo runtime, portanto, um fluxo de trabalho codificado atinge a mesma classificação, extração e comportamento de artefato de validação que as atividades Extract Document Data e Classify Document . A diferença está no formato da chamada: o serviço segue caminhos de arquivos simples ou entradas IResource e retorna objetos de Dados do Documento diretamente, e você usa try/catch comum em vez da opção Continuar com erro da atividade.
Padrões comuns
Classificar e depois extrair
Esse padrão classifica um documento e, em seguida, reutiliza o resultado classificado para extrair dados, o que evita a digitalização do arquivo uma segunda vez.
[Workflow]
public void Execute()
{
var classified = du.ClassifyDocument(@"C:\docs\file.pdf", "MyProject", "Production");
Log($"Document type: {classified.DocumentType.DisplayName}");
// Reuses the classified document, so the file is not digitized again.
var extracted = du.ExtractDocumentData(classified, "MyProject", "Production");
}
[Workflow]
public void Execute()
{
var classified = du.ClassifyDocument(@"C:\docs\file.pdf", "MyProject", "Production");
Log($"Document type: {classified.DocumentType.DisplayName}");
// Reuses the classified document, so the file is not digitized again.
var extracted = du.ExtractDocumentData(classified, "MyProject", "Production");
}
Extrair e preparar dados para tarefas de aplicativo que contêm o controle de validação
Esse padrão extrai dados, os carrega para o armazenamento como artefatos de validação para revisão em uma tarefa de aplicativo e recupera os resultados validados após a ação ser concluída.
[Workflow]
public void Execute()
{
var extracted = du.ExtractDocumentData(@"C:\docs\invoice.pdf", "Invoices", "Production", "invoice");
// Upload the results so they can be reviewed in Action Center.
var artifacts = du.CreateDocumentValidationArtifacts(extracted, "Shared");
// After the Action Center validation action completes, retrieve the validated results.
var validated = du.RetrieveDocumentValidationArtifacts(artifacts, removeDataFromStorage: true);
}
[Workflow]
public void Execute()
{
var extracted = du.ExtractDocumentData(@"C:\docs\invoice.pdf", "Invoices", "Production", "invoice");
// Upload the results so they can be reviewed in Action Center.
var artifacts = du.CreateDocumentValidationArtifacts(extracted, "Shared");
// After the Action Center validation action completes, retrieve the validated results.
var validated = du.RetrieveDocumentValidationArtifacts(artifacts, removeDataFromStorage: true);
}
- Namespaces importados automaticamente
- Visão geral do serviço
- Versão ou tag do projeto
- Parâmetros comuns
- Classificação
DocumentData ClassifyDocument(string documentPath, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)DocumentData ClassifyDocument(IResource file, string projectName, string projectVersionOrTag, int timeoutMs = 3600000)- Extração de Dados
IDocumentData<DictionaryData> ExtractDocumentData(string documentPath, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)IDocumentData<DictionaryData> ExtractDocumentData(IResource file, string projectName, string projectVersionOrTag, string docType, int timeoutMs = 3600000)IDocumentData<DictionaryData> ExtractDocumentData(DocumentData classifiedDocument, string projectName, string projectVersionOrTag, string docType = null, int timeoutMs = 3600000)- Artefatos de validação
ContentValidationData CreateDocumentValidationArtifacts(IDocumentData<DictionaryData> automaticExtractionResults, string orchestratorFolderName, string orchestratorBucketName = null)IDocumentData<DictionaryData> RetrieveDocumentValidationArtifacts(ContentValidationData contentValidationData, object completedAppAction = null, bool removeDataFromStorage = false, bool returnAutomaticExtractionResults = false)- Relacionamento com as atividades
- Padrões comuns
- Classificar e depois extrair
- Extrair e preparar dados para tarefas de aplicativo que contêm o controle de validação