UiPath Documentation
document-understanding
2021.10
false
Guia do usuário do Document Understanding.
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Sobre o Data Manager

O UiPath Document Manager é um aplicativo web leve, que permite aos usuários preparar, revisar e fazer correções nos conjuntos de dados necessários para treinamento e avaliação de modelos de Machine Learning do Document Understanding.

Aqui estão os métodos de implantação no local (On-Premises):

  • Data Manager in AI Center On Premises. This is Generally Available and it is fully supported for Production scenarios. There is no limitation on the size of datasets that can be imported, with the exception of Auto-retraining which still has the 2000 pages or 2GB limit per import. For all the AI Center deployment methods available for On Premises, please see this page.

O Data Manager permite que vários usuários executem uma variedade de operações envolvidas no gerenciamento de lotes de dados, preparação de dados e configuração de modelo:

Defina e configure os campos a serem extraídos por um modelo de ML.

Importe documentos para rotulagem.

Pré-rotule documentos usando um modelo de ML preexistente e pronto para uso, como Extração de Fatura ou Extração de Recibo, fornecido pela UiPath, ou usando um modelo treinado utilizando o AI Center.

Rotule documentos.

Exporte documentos no formato esperado pelos Pipelines de Treinamento do AI Center.

A interface do usuário

A interface do Data Manager contém os seguintes painéis:

Barra de gerenciamento

Exibido na parte superior da página no Data Manager.

Permite realizar várias operações: navegar entre documentos, excluir/restaurar um documento, pesquisar/filtrar documentos, executar previsões de modelos de IA, importar e exportar documentos.

Aqui estão as opções disponíveis na barra de gerenciamento:

Opção Ícone Description

Navegação

docs image

Navegue entre os documentos que correspondam ao filtro ativo. Entre as duas setas, um contador é exibido. Ele ilustra o número do documento atual do número total de documentos que correspondem à pesquisa/filtro ativo.

docs image

Pesquisar ou filtrar documentos. O filtro também é aplicado ao exportar documentos. Você também pode filtrar por palavras em um documento ou por nomes de documentos.

Excluir / Restaurar

docs image / docs image

Excluir ou restaurar um documento. Os documentos excluídos podem ser encontrados no filtro excluído.

Predict

docs image

Execute as previsões do modelo de IA e exiba os resultados.

Após configurar a Pré-rotulagem, o botão é habilitado na barra de gerenciamento. Clique nele para pré-rotular o documento atual.

At the moment, using the Predict option with Public Endpoints prelabels only the first 10 pages of a document. This is a known issue and a fix is in the working. Using the Predict option with ML Skills in AI Center, however, does not impose such a limitation.

docs image

Abra a caixa de diálogo Importar dados.

docs image

Abra a caixa de diálogo Exportar arquivos.

docs image

Clique no ícone para baixar um arquivo Zip contendo o documento original.

docs image

Configure OCR and Prelabelling settings or access the How to... panel. See below.

Fazer download

Além do arquivo Zip contendo o documento original, todas as páginas convertidas internamente pelo Document Manager para imagens .jpeg também são baixadas.

Nome do documento, tipo e nome da sessão

No lado direito do ícone, você pode visualizar o nome do documento atualmente ativo, seu tipo e o nome da sessão.

Há três tipos de documentos:

  • Documento de treinamento
  • Documento de validação
  • Documento de avaliação

Training and Validation documents are part of training datasets used by Training Pipelines.

Evaluation documents are ignored by Training Pipelines and are intended to only be used by Evaluation pipelines in AI Center. These documents are the ones that were marked as evaluation by selecting the Make this an evaluation set checkbox in the Import data dialog box.

Configurações

O botão de configurações tem duas opções disponíveis:

OCR

Para importar documentos para o Data Manager, é obrigatório configurar um serviço de OCR.

As seguintes opções estão disponíveis:

Método de OCR

Importante:

Escolher o mecanismo de OCR a ser usado para importar documentos para o Data Manager é uma decisão importante.

Recomenda-se usar o mesmo OCR para importar dados de treinamento (tempo de treinamento), pois será usado quando o modelo for implantado (tempo de execução).

Idealmente, você deve experimentar alguns diferentes para identificar qual funciona melhor em seus documentos e só então decidir.

As opções no locai são:

  • Contêiner UiPath OCR que suporta os principais idiomas da Europa Ocidental;
  • Contêiner Microsoft Read (disponível como pré-visualização pela Microsoft) também oferece boa cobertura de idioma;
  • UiPath OCR ML Skills implantado no AI Center no local v2020.10 ou posterior.

As opções na nuvem são:

  • UiPath Document OCR - https://du.uipath.com/ocr;
  • Google Cloud Vision OCR, que tem a melhor cobertura de idioma;
  • Google Cloud OCR para japonês ideal para leitura de documentos em japonês;
  • Microsoft Read OCR.

URL de OCR

A configuração do OCR requer que o serviço de OCR tenha um URL. Esses são os URLs possíveis que você pode usar:

  • public URLs such as https://du.uipath.com/ocr or third-party URLs from Google Vision OCR or Microsoft Read OCR

  • URLs do contêiner independente UiPath Document OCR fornecido pela UiPath implantada no local

  • URLs of OCR ML Package deployed as ML Skills which have been made Public in AI Center on-premises v2020.10 or later

    Importante:

    Se estiver executando o OCR na mesma máquina que o Data Manager, não use localhostpara se referir à máquina local, mas sim o endereço IP ou o nome de domínio da máquina local.

    No caso de URLs de OCR implantados como Habilidade de ML pública no AI Center no local, use o URL conforme aparece na tela de detalhes da Habilidade de ML do AI Center.

Chave de OCR

The corresponding API Key for the selected OCR engine. For example, for UiPath Document OCR, you need to use the Document Understanding API Key. Mandatory for Data Manager Cloud and Data Manager On-Prem Online. It is not required for Data Manager On-Prem Air-gapped.

Pré-rotulamento

Se você já possui um modelo que pode extrair alguns dos campos que precisam de rotulagem e há apenas alguns campos extras que exigem rotulagem manual, você pode economizar muito tempo usando o recurso de pré-rotulagem do Data Manager.

As seguintes opções estão disponíveis:

URL de pré-rotulamento

A pré-rotulagem exige que o modelo de ML tenha um URL. Esses são os URLs possíveis que você pode usar:

As habilidades de ML no AI Center On-Premises implantadas em ambientes isolados (air-gapped) não podem ser usadas para pré-rotulagem.

Importante:

Se estiver executando o Modelo de pré-rotulagem na mesma máquina que o Data Manager, não use localhost para se referir à máquina local, mas sim o endereço IP ou o nome de domínio da máquina local.

No caso de URLs de habilidades de ML públicas no AI Center no local, use o URL conforme aparece na tela de detalhes da habilidade de ML do AI Center.

Chave de pré-rotulamento

The Document Understanding API Key. Mandatory for Data Manager Cloud and Data Manager On-Prem Online. It is not required for Data Manager On-Prem Air-gapped.

Como...

The How to... option accesses the Data Manager help menu.

Nela, você pode encontrar:

  • The Data Manager version
  • O link Documentação que leva a esta página de documentação.
  • A seção Controles de rotulagem que exibe os controles a serem usados ao manipular dados.
  • A seção Atalhos do documento que exibe os atalhos usados para executar várias operações, como navegação e dimensionamento da interface do usuário.
  • A seção Configuração que exibe detalhes sobre a configuração da instância conforme executada durante a instalação.

Campos de coluna

Os campos de coluna têm as seguintes opções:

  • Criar novo campo de coluna Imagem dos documentos
  • Editar campo Imagem dos documentos
  • Expande/recolhe valores de campo de coluna Imagem dos documentos

For more details on column fields, visit this section.

Campos Regulares

Os campos regulares têm as seguintes opções:

  • Cria um novo campo regular Imagem dos documentos
  • Editar campo Imagem dos documentos

For more details on regular fields, visit this section.

Campos de Classificação

Os campos de classificação têm as seguintes opções:

  • Cria um novo campo de classificação Imagem dos documentos
  • Editar campo Imagem dos documentos

For more details on classification fields, visit this section.

Exibição de Documento

Para documentos de várias páginas, você pode rolar naturalmente pelas páginas como em qualquer visualizador de PDF. Para aumentar ou diminuir o zoom, use Ctrl + rolagem do mouse.

Você pode rotular documentos selecionando as caixas de palavras e atribuindo-as a um campo pressionando uma tecla. Você também pode clicar com o botão direito do mouse na caixa de palavras e verificar as informações extraídas.

For more details on how to label documents, visit this page.

Quando você abre uma nova sessão do Data Manager ou quando tem um filtro vazio, algumas diretrizes são exibidas na visualização do documento:

Além disso, as falhas de carregamento também são exibidas na visualização do documento:

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades