- Visão geral
- Processo do Document Understanding
- Tutoriais de início rápido
- Componentes do framework
- Pacotes de ML
- Sobre os pacotes de ML
- Requisitos de Hardware
- Configuração de OCR
- Pipelines
- Document Manager
- Serviços de OCR
- Document Understanding implantado no Automation Suite
- Document Understanding implantado no AI Center autônomo
- Aprendizagem profunda
- Treinamento de modelos de alto desempenho
- Licenciamento
- Referências
- UiPath.Abbyy.Activities
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
O uso de um Pacote de ML do Document Understanding envolve estas etapas:
-
Coletar amostras de documentos e os requisitos dos pontos de dados que precisam ser extraídos.
-
Labeling documents using Document Manager. Be aware that Document Manager itself connects to an OCR Service.
-
Baixar ou exportar documentos rotulados como um conjunto de dados de treinamento e carregar a pasta exportada para o armazenamento do AI Center.
-
Baixar ou exportar documentos rotulados como um conjunto de dados de avaliação e carregar a pasta exportada para o armazenamento do AI Center.
-
Executar um pipeline de treinamento no AI Center.
-
Avaliar o desempenho do modelo com um pipeline de avaliação no AI Center.
-
Implantar o modelo treinado como uma Habilidade de ML no AI Center.
-
Consultar a Habilidade de ML de um fluxo de trabalho de RPA usando o pacote de atividades UiPath.DocumentUnderstanding.ML.
Observação:Lembre-se de que o uso dos Pacotes de ML do Document Understanding exige que a máquina na qual o AI Center está instalado possa acessar
https://du-metering.uipath.com.Observação:When creating a UiPath.DocumentUnderstanding.ML.Activities Package in AI Center, the package name should not be any python reserved keyword, such as
class,break,from,finally,global,None, etc. Note that this list is not exhaustive since the package name is used forclass <pkg-name>andimport <pkg-name>.
Esses são modelos de Machine Learning prontos para uso para classificar e extrair quaisquer pontos de dados comuns de documentos semiestruturados ou não estruturados, incluindo campos regulares, colunas de tabela e campos de classificação, em uma abordagem sem modelo.
Pacotes de Machine Learning prontos para uso fornecidos pela UiPath têm a versão 0 e já estão disponíveis em seu tenant, o que significa que não há necessidade de baixá-los.
O download está disponível apenas para as versões 1 ou superior, que já foram treinadas por você.
O Document Understanding contém vários Pacotes de ML divididos em cinco categorias principais:
- UiPath Document OCR
- Document Understanding
- Classificador de documentos
- Out-of-the-box Pre-trained ML Packages
- Outros pacotes de ML prontos para uso
UiPath Document OCR
This is a non-retrainable model which can be used with the UiPath Document OCR engine activity as part of the Digitize Document activity. To be used, the ML Skill must first be made public so that a URL can be copy-pasted into the UiPath Document OCR engine activity.
O UiPathDocumentOCR requer acesso ao servidor de medição do Document Understanding em https://du.uipath.com/metering se a habilidade de ML estiver sendo executada em uma implantação regular do AI Center no local. Não é necessário acesso à Internet nas implantações no local e isoladas do AI Center.
UiPathDocumentOCR_CPU
This ML Package can be deployed exactly the same way as the UiPathDocumentOCR ML Package, with the following differences:
- isso é otimizado para ser executado na CPU, portanto, você deve ver uma aceleração de 3 a 4 vezes ao executar no fluxo de trabalho e de 5 a 10 vezes ao usá-lo para importar documentos para o Document Manager
- a precisão é um pouco menor do que o Pacote de ML UiPathDocumentOCR e é semelhante ao pacote Studio UiPath.DocumentUnderstanding.OCR.LocalServer
- por ser mais rápida, a CPU também é recomendada quando os documentos são grandes (mais de 20 páginas por documento) na ausência de GPU, o que é o ideal.
Document Understanding
Este é um modelo genérico e retreinável para extrair quaisquer pontos de dados comuns de qualquer tipo de documento estruturado ou semiestruturado, construindo um modelo do zero. Este Pacote de ML deve ser treinado. Se implantado sem treinamento prévio, a implantação falha com um erro informando que o modelo não foi treinado.
Classificador de documentos
Este é um modelo genérico e retreinável para classificar qualquer tipo de documento estruturado ou semiestruturado, construindo um modelo do zero. Este Pacote de ML deve ser treinado. Se implantado sem treinamento prévio, a implantação falha com um erro informando que o modelo não foi treinado.
Out-of-the-box Pre-trained ML Packages
Esses são Pacotes de ML retreináveis que contêm o conhecimento de diferentes modelos de Machine Learning.
Eles podem ser personalizados para extrair campos adicionais ou oferecer suporte a idiomas adicionais usando execuções de Pipeline. Usando recursos de aprendizado de transferência de última geração, esse modelo pode ser treinado novamente em documentos rotulados adicionais e adaptado a casos de uso específicos ou expandido para suporte adicional ao idioma latino, cirílico ou grego.
O conjunto de dados usado pode ter os mesmos campos, um subconjunto dos campos ou ter campos adicionais. Para se beneficiar da inteligência já contida no modelo pré-treinado, você precisa usar campos com os mesmos nomes do próprio modelo pronto para uso.
Esses Pacotes de ML são:
- Invoices: The fields extracted out-of-the-box can be found here.
- InvoicesAustralia: The fields extracted out-of-the-box can be found here.
- InvoicesIndia: The fields extracted out-of-the-box can be found here.
- InvoicesJapan
Preview: The fields extracted out-of-the-box can be found here. Retraining using data from Validation Station is currently not supported. - InvoicesChina
Preview: The fields extracted out-of-the-box can be found here. Retraining using data from Validation Station is currently not supported. - Receipts: The fields extracted out-of-the-box can be found here.
- Purchase Orders: The fields extracted out-of-the-box can be found here.
- Utility Bills: The fields extracted out-of-the-box can be found here.
- ID Cards
Preview: The fields extracted out-of-the-box can be found here. - Passports: The fields extracted out-of-the-box can be found here.
- RemittanceAdvices
Preview: The fields extracted out-of-the-box can be found here. - W2
Preview: The fields extracted out-of-the-box can be found here. - W9: The fields extracted out-of-the-box can be found here.
- ACORD125
Preview: The fields extracted out-of-the-box can be found here - I9
Preview: The fields extracted out-of-the-box can be found here - 990
Preview: The fields extracted out-of-the-box can be found here - 4506T
Preview: The fields extracted out-of-the-box can be found here - FM1003
Preview: The fields extracted out-of-the-box can be found here
Esses modelos são arquiteturas de deep learning criadas pela UiPath. Uma GPU pode ser usada tanto no tempo de serviço quanto no tempo de treinamento, mas não é obrigatória. Uma GPU oferece >10x de melhoria na velocidade para treinamento especificamente.
Outros pacotes de ML prontos para uso
Esses são pacotes não retreináveis que são necessários para componentes não ML do conjunto do Document Understanding.
Esses Pacotes de ML são:
- FormExtractor: Deploy as Public Skill and paste the URL into the Form Extractor activity.
- IntelligentFormExtractor: Deploy as Public Skill and paste the URL into the Intelligent Form Extractor activity. Make sure to first deploy the HandwritingRecognition ML Skill and configure that as OCR for the this package.
- IntelligentKeywordClassifier: Deploy as Public Skill and paste the URL into the Intelligent Keyword Classifier activity.
- HandwritingRecognitionOCR: implante como Habilidade Pública e use como OCR ao criar o pacote IntelligentFormExtractor.