- Visão geral
- Processo do Document Understanding
- Tutoriais de início rápido
- Componentes do framework
- Visão geral da digitalização
- Mecanismos OCR
- Atividades relacionadas à digitalização
- Pacotes de ML
- Pipelines
- Gerenciador de Dados
- Serviços de OCR
- Document Understanding implantado no Automation Suite
- Document Understanding implantado no AI Center autônomo
- Aprendizagem profunda
- Crie um modelo de ML de alto desempenho
- Licenciamento
- Referências
- UiPath.Abbyy.Activities
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
O que é Digitalização
A Digitalização é o processo de obtenção de texto legível por máquina de um determinado arquivo de entrada para que um robô possa entender seu conteúdo e agir sobre ele. É a primeira etapa aplicada em arquivos que precisam ser processados por meio do framework Document Understanding.
A etapa de digitalização tem duas saídas:
- o texto do arquivo processado, armazenado em uma variável string, e
- o Modelo de Objeto de Documento desse arquivo - objeto JSON contendo informações básicas como nome, tipo de conteúdo, tamanho do texto, número de páginas, bem como informações detalhadas como rotação de página, idioma detectado, conteúdo e coordenadas para cada palavra identificada no Arquivo.
No framework Document Processing, a digitalização é realizada usando a atividade Digitize Document .
O que a Digitalização não é
Apesar de relacionada, a etapa de digitalização não é OCR.
Muitas vezes, os arquivos que precisam ser processados são arquivos PDF nativos (não digitalizados), que podem ser lidos programaticamente pelo robô sem aplicar OCR.
Quando o mecanismo OCR é utilizado na Digitalização
The Digitize Document activity requires, as part of its configuration, the selection of an OCR engine — so that, at need, it can be used, but only executes OCR on
- arquivos que são imagens
- os formatos de imagem suportados são .png, .gif, .jpe, .jpg, .jpeg, .tiff, .tif, .bmp
- para arquivos TIFF de várias páginas, o OCR é aplicado para cada página
- Páginas PDF que
- não exponha nenhum conteúdo legível por máquina
- contenham imagens que cubram uma área significativa da página.
O OCR também é sempre aplicado se a atividade Digitize Document estiver configurada com a flag ForceApplyOCR definida como True. Essa opção geralmente é recomendada para casos de uso em que uma porcentagem significativa de arquivos parece conter conteúdo nativo, mas o conteúdo lido nativamente não corresponde ao que um usuário pode visualizar nesses arquivos.
Como escolher o mecanismo OCR
As each use case has its own particularities, it is strongly recommended to test all available OCR Engines with different settings, to determine which one works best for your project. Another recommendation is to pay particular attention to the OCR engine arguments, such as Profile, Scale, Language etc. (may vary from one engine to another), so that you can identify the best settings for each use case.