UiPath Documentation
document-understanding
2022.4
false
Guia do usuário do Document Understanding.
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Importar documentos

A caixa de diálogo Importar dados permite importar facilmente novos documentos para serem rotulados ou revisados.

Click the Import button Imagem dos documentos from the management bar.

A caixa de diálogo contém os seguintes controles:

  • Campo de texto Batch name - é obrigatório inserir um nome para sua exportação, caso contrário, a seção Procurar ou arrastar arquivos será desabilitada; um nome válido pode ter até 24 caracteres e não deve conter caracteres especiais.

  • Make this an evaluation set checkbox - if selected, the dataset is used for evaluation purposes.

  • Caixa de seleção Habilitar documentos grandes - se selecionada, você pode carregar documentos com mais de 150 páginas.

  • Seção Procurar ou arrastar arquivos - clique em Procurar arquivos para fazer upload para navegar pelo seu diretório ou simplesmente arraste e solte os arquivos dentro do quadro.

  • Seção Status - clique em (carregar log de importação anterior) para visualizar o status da última importação; ao fazer upload de dados, na seção Status, você acessa uma visão geral de seus arquivos e é solicitado a prosseguir com a importação clicando em SIM ou abortar a importação clicando em CANCELAR.

    Importante:

    A versão 2021.101 do Data Manager oferece suporte à rotulagem de documentos de várias páginas. Esta é uma grande mudança em relação às versões anteriores, nas quais cada página era rotulada separadamente. Rotular e exportar documentos de várias páginas pressupõe que cada documento represente um único documento lógico. Por exemplo, um documento de seis páginas pode conter uma única fatura de seis páginas, mas não deve conter três faturas diferentes, com duas páginas cada. Isso é particularmente importante para conjuntos de avaliação.

    Este requisito não é relevante para exportações retrocompatíveis.

Tipos de importação

Há 4 tipos de importação suportados no Data Manager:

  • Importação de esquema
  • Raw documents import (max 2000 or 2GB pages per import)
  • Data Manager dataset import (max 2000 or 2GB pages per import)
  • Validation Station dataset import (max 2000 or 2GB pages per import)

Importação de esquema

Se você deseja iniciar uma nova sessão do Data Manager usando o mesmo esquema de uma sessão existente, siga estas etapas:

  1. Clique no botão Exportar Imagem dos documentos a partir da barra de gerenciamento.
  2. Na caixa de diálogo Exportar arquivos, marque a opção Esquema.
  3. Clique no botão Exportar dentro da caixa de diálogo. Um arquivo .zip é exportado.
  4. Click the Import button Imagem dos documentos from the management bar.
  5. Upload or drag & drop the .zip file directly into the new Data Manager session (do not unzip). In this step, you can also upload a predefined schema.
  6. Clique em SIM na seção Status para prosseguir com a importação. O esquema é importado.

You could also use one of the predefined schemas provided in the Use a Predefined Schema page.

Importação de documentos brutos

Os tipos de documentos que podem ser importados para rotulagem são: .pdf, .tiff, .png, .jpg.

  • Arquivos .zip não são suportados para importação de documentos brutos.
  • As configurações de OCR precisam ser definidas antes da importação.

Siga os passos abaixo:

  1. Click the Import button Imagem dos documentos . The Import data dialog box is displayed.

  2. Forneça um nome de lote no campo Batch name. Isso permite que você filtre e localize facilmente esses documentos usando o menu suspenso Pesquisar posteriormente.

    • Se você quiser usar este lote de documentos para treinar um modelo de ML, deixe desmarcada a caixa de seleção Tornar este um conjunto de avaliação.
    • Se você quiser usar este lote de documentos para avaliar um modelo de ML (ou seja, medir seu desempenho), marque a caixa de seleção Tornar este um conjunto de avaliação. Isso garante que os dados sejam ignorados pelos pipelines de treinamento.
  3. Se você tiver documentos com mais de 150 páginas, marque a caixa de seleção Habilitar documentos grandes. Caso contrário, deixe a caixa de seleção desmarcada.

  4. Carregue ou arraste e solte um arquivo ou conjunto de arquivos na seção Procurar ou soltar arquivos.

  5. Clique em SIM. O arquivo ou conjunto de arquivos são importados.

Importação de conjunto de dados no Data Manager

Para importar um conjunto de dados que foi rotulado anteriormente em outra sessão do Data Manager, você precisa obter o arquivo .zip que foi exportado originalmente e importá-lo diretamente para a nova instância do Data Manager.

If your new Data Manager instance is completely empty (no data and no fields defined), then both the documents with labels and the schema are imported.

Se sua nova instância do Data Manager já tiver campos definidos, o conjunto de dados recém-importado precisará ter os mesmos campos ou um subconjunto desses campos. Caso contrário, a importação será rejeitada.

Dividir grandes conjuntos de dados

To import Data Manager datasets larger than 1GB or that have more than 1500 files, we recommend you to use this script which splits the .zip files into multiple .zip files that are smaller than 1GB and that have less than 1500 files.

Importação do conjunto de dados do Validation Station

Como seu fluxo de trabalho de RPA processa documentos usando um modelo de ML existente, alguns documentos podem exigir validação manual usando a atividade Estação de Validação (disponível em robôs attended ou no navegador usando o Orchestrator Action Center).

The validated data generated in Validation Station can be exported using Machine Learning Extractor Trainer activity and can be used to train ML models using the feature described below.

Observação:

Para a importação do conjunto de dados do Validation Station, é obrigatório ter um esquema definido.

Siga os passos abaixo:

  1. Configure o Machine Learning Extractor Trainer para gerar dados em uma pasta com caminho <Trainer/Output/Folder> (use qualquer caminho de pasta vazio).
  2. Execute um fluxo de trabalho de RPA, incluindo o Validation Station e o Machine Learning Extractor Trainer.
  3. O Machine Learning Extractor Trainer cria três subpastas: documents, metadata e predictions dentro da pasta output.
  4. Compacte o arquivo <Trainer/Output/Folder> para obter um arquivo .zip, por exemplo TrainerOutputFolder.zip.
  5. Import the .zip file into Data Manager which detects that the import contains data produced by Machine Learning Extractor Trainer and imports the data accordingly.

Se houver campos ausentes exigidos pelo conjunto de dados, uma mensagem de erro será exibida na caixa de diálogo de importação.

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades