UiPath Documentation
document-understanding
2021.10
false
Guia do usuário do Document Understanding.
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Intelligent Keyword Classifier

O que é o Classificador inteligente de palavras-chave

The Intelligent Keyword Classifier is a classifier that uses the word vector it learns from files of certain document types to perform document classification.

O algoritmo é construído em torno do conceito de repetição de conteúdo para o mesmo tipo de documento e parte da premissa de que os tipos de documentos possuem uma série de palavras que geralmente ocorrem nesses tipos de documentos, permitindo assim um cálculo de similaridade vetorial.

Ao classificar um arquivo em um tipo de documento, o Classificador inteligente de palavras-chave:

  • encontra o vetor de palavras mais próximo ao qual um arquivo é mais semelhante,
  • reporta sobre o tipo de documento de pontuação mais alta, com as palavras principais correspondentes subjacentes.

O Classificador inteligente de palavras-chave também possui recursos de divisão de arquivos, o que significa que ele pode relatar mais de uma classe para um determinado arquivo, para intervalos de páginas separados.

Quando usar

Você deve considerar usar este classificador se:

  • seus arquivos contêm um ou mais tipos de documentos em um único arquivo
  • seus tipos de documento são relativamente fáceis de diferenciar no que diz respeito ao conteúdo.

Requisitos especiais

Você precisa usar sua chave de API do Automation Cloud Document Understanding ou hospedar sua própria instância do Classificador inteligente de palavras-chave no AI Center no local para usar este classificador.

Como configurar no tempo de design

You can configure the Intelligent Keyword Classifier at design-time, by simply accessing the Manage Learning wizard of the activity. The same wizard can be used for reviewing data collected during the document classification training phase, by opening the same wizard with an updated learning file path.

Este assistente permite configurar e gerenciar os dados de treinamento usados por esta atividade para identificar o tipo de documento e classificar os documentos. Ele foi criado para atender a necessidade de editar um caminho de arquivo. Se uma opção de Dados de Aprendizagem com uma variável for usada, você será perguntado se deseja editar um caminho de arquivo específico ou abortar esta operação.

Observação:

The Manage Learning wizard only works when the activity is configured with a Learning File Path string. It does not work with a Learning File Path set as a variable input, or with a LearningData string input.

  1. Add an Intelligent Keyword Classifier/Intelligent Keyword Classifier Trainer activity to your workflow.

  2. Configure your Intelligent Keyword Classifier activity by adding the path of a .json file.

    • If no path is provided and the Manage Learning option is clicked, then a popup is displayed, asking for a Learning File Path input. Once the path is provided, the wizard opens.
    • A variable can be added instead of a .json file, but, because the wizard cannot apply the learning pattern to a LearningData variable, it asks for a specific file path that can be edited.
  3. Click on the Manage Learning option.

    • The Wizard window opens.

  4. Se nenhum caminho for fornecido e a opção Gerenciar aprendizado for clicada, então um pop-up será exibido solicitando um Aprendizado de caminho de arquivo. Assim que o caminho for fornecido, o assistente será aberto.

    Observação:

    Even if no .json file is available, you can add the name of a new .json file straight into the activity and the .json file is automatically created inside the specified folder.

A captura de tela abaixo apresenta um tipo de documento que foi treinado, um que não foi e um que foi treinado e acessado para ser visualizado ou excluído.

For document types that have not been trained yet, design-time training can be performed using the Start Training option. For document types that already have some training, you can either delete it to start over, by using this Imagem dos documentos option, or perform extra training (cumulative to the already existing one) using the edit Imagem dos documentos option.

Observação:

Arquivos de treinamento a serem usados devem conter uma única instância de tipo de documento por arquivo. Não execute treinamento em tempo de design em arquivos que contenham dois ou mais tipos de documento, pois seus dados de treinamento estarão incorretos.

Após iniciado um novo treinamento, uma nova tela é exibida solicitando os arquivos de treinamento e o mecanismo de OCR que deve ser usado.

Each OCR engine comes with its own set of custom options. Here you can find more details about all options available for each OCR engine.

Observação:

Os seguintes mecanismos de OCR não suportam documentos rotacionados e não devem ser usados para processar tais documentos:

  • Microsoft OCR
  • Tesseract OCR

Somente dados de treinamento de tipos de documento que foram treinados são elegíveis para exportação.Os tipos de documento que não foram treinados não podem ser selecionados.

Exportando dados de treinamento

Você pode exportar dados de treinamento seguindo estas etapas:

  1. Selecione os tipos de documento que foram treinados.

  2. Click the Export button.

  3. Se houver alterações não salvas, a seguinte mensagem será exibida.

  4. Clique em Sim.

  5. Salve o arquivo de dados de treinamento com o nome desejado.

  6. Uma mensagem é exibida informando quantos conjuntos de dados de treinamento de tipo de documento foram exportados. Por exemplo:

  7. Click OK to return to the main screen of the wizard.

Importando dados de treinamento

Você pode importar dados de treinamento seguindo estas etapas:

  1. Click the Import button.

  2. Select the training data archive and click Open.

  3. Selecione os tipos de documento que você deseja.

  4. Click the Import button.

  5. Os dados de treinamento são importados.

A tabela abaixo explica cada mensagem exibida ao importar dados de treinamento:

Import TypeMensagem exibida
Novo tipo de documento e vetores do WordEste tipo de documento será adicionado à taxonomia
Novo vetor do Word (nenhum foi definido anteriormente)N/A
Mesmo tipo de documento e vetor do WordO vetor de palavra para este tipo de documento será substituído

Como treinar

Coloque a atividade Intelligent Keyword Classifier Trainer em um Train Classifiers Scope e configure-o adequadamente.

We cannot enforce training file consistency across parallel trainings at the activity level. Two possible solutions for this issue are provided by Document Understanding Process. Both consist of traffic control:

  1. arquivos de bloqueio (implementado por padrão no processo): renomeie o arquivo usando a extensão .lock, modifique e salve o arquivo, depois renomeie o arquivo novamente, removendo a extensão .lock
  2. configuração manual de uma fila especial: crie uma fila vazia no Orchestrator e integre suas duas atividades do projeto.

For more information on how to train a Classifier, check Document Classification Training.

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades