UiPath Documentation
document-understanding
2020.10
false
Guia do usuário do Document Understanding.
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Sobre os pacotes de ML

O uso de um Pacote de ML do Document Understanding envolve estas etapas:

  • Colete amostras de documentos e os requisitos dos pontos de dados que precisam ser extraídos.

  • Label documents using Data Manager.

    Data Manager itself will connect to an OCR Service.

  • Exporte documentos rotulados como um conjunto de dados do treinamento e carregue essa pasta exportada para o armazenamento do AI Center.

  • Exporte documentos rotulados como um conjunto de dados de teste e carregue essa pasta exportada para o armazenamento do AI Center.

  • Execute um pipeline de treinamento no AI Center.

  • Avalie o desempenho do modelo com um pipeline de avaliação no AI Center.

  • Implante o modelo treinado como uma Habilidade de ML no AI Center.

  • Query the ML Skill from an RPA workflow using the UiPath.DocumentUnderstanding.ML activity package.

    Observação:

    Lembre-se de que o uso dos Pacotes de ML do Document Understanding exige que a máquina na qual o AI Center está instalado possa acessar https://du-metering.uipath.com.

    Importante:

    Ao criar um pacote UiPath.DocumentUnderstanding.ML.Activities no AI Center, o nome do pacote não deve ser nenhuma palavra-chave reservada do python, como class, break, from, finally, global, None etc. Observe que esta lista não é exaustiva, pois o nome do pacote é usado para class <pkg-name> e import <pkg-name>.

Esses são modelos de Machine Learning prontos para uso para classificar e extrair quaisquer pontos de dados comuns de documentos semiestruturados ou não estruturados, incluindo campos regulares, colunas de tabela e campos de classificação, em uma abordagem sem modelo.

O Document Understanding contém vários Pacotes de ML divididos em quatro categorias principais:

UiPath Document OCR

This is a non-retrainable model which can be used with the UiPath Document OCR engine activity as part of the Digitize Document activity. To be used, it must first be made public so that a URL can be copy-pasted into the UiPath Document OCR engine activity.

O UiPathDocumentOCR requer acesso ao servidor de medição do Document Understanding em https://du.uipath.com/metering se a habilidade de ML estiver sendo executada em uma implantação regular do AI Center no local. Não é necessário acesso à Internet nas implantações no local e isoladas do AI Center.

O pacote de ML UiPathDocumentOCR no AI Center é otimizado para execução em GPU, portanto, recomendamos fortemente usá-lo em GPU. Se nenhuma GPU estiver disponível, recomendamos usar o contêiner Docker autônomo.

Document Understanding

Este é um modelo genérico e retreinável para extrair quaisquer pontos de dados comuns de qualquer tipo de documento estruturado ou semiestruturado, construindo um modelo do zero. Este Pacote de ML deve ser treinado. Se implantado sem treinamento prévio, a implantação falha com um erro informando que o modelo não foi treinado.

Out-of-the-box Pre-trained ML Packages

Esses são Pacotes de ML retreináveis que contêm o conhecimento de diferentes modelos de Machine Learning.

Eles podem ser personalizados para extrair campos adicionais ou oferecer suporte a idiomas adicionais usando execuções de Pipeline. Usando recursos de aprendizado de transferência de última geração, esse modelo pode ser treinado novamente em documentos rotulados adicionais e adaptado a casos de uso específicos ou expandido para suporte adicional ao idioma latino, cirílico ou grego.

O conjunto de dados usado pode ter os mesmos campos, um subconjunto dos campos ou ter campos adicionais. Para se beneficiar da inteligência já contida no modelo pré-treinado, você precisa usar campos com os mesmos nomes do próprio modelo pronto para uso.

Esses Pacotes de ML são:

  • Invoices: The fields extracted out-of-the-box can be found here.
  • InvoicesAustraliaPreview: The fields extracted out-of-the-box can be found here.
  • InvoicesIndiaPreview: The fields extracted out-of-the-box can be found here.
  • InvoicesJapanPreview: The fields extracted out-of-the-box can be found here.
  • Receipts: The fields extracted out-of-the-box can be found here.
  • PurchaseOrdersPreview: The fields extracted out-of-the-box can be found here.
  • UtilityBillsPreview: The fields extracted out-of-the-box can be found here.

Esses modelos são arquiteturas de deep learning criadas pela UiPath. Uma GPU pode ser usada tanto no tempo de serviço quanto no tempo de treinamento, mas não é obrigatória. Uma GPU oferece >10x de melhoria na velocidade para treinamento especificamente.

Outros pacotes de ML prontos para uso

Esses são pacotes não retreináveis que são necessários para componentes não ML do conjunto do Document Understanding.

Esses Pacotes de ML são:

  • FormExtractor: Deploy as Public Skill and paste the URL into the Form Extractor activity.
  • IntelligentFormExtractor: Deploy as Public Skill and paste the URL into the Intelligent Form Extractor activity. Make sure to first deploy the HandwritingRecognition ML Skill and configure that as the OCR for this package.
  • IntelligentKeywordClassifier: Deploy as Public Skill and paste the URL into the Intelligent Keyword Classifier activity.
  • HandwritingRecognition: Deploy as Public Skill and use as OCR when creating the IntelligentFormExtractor package.

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades