- Introdução
- Componentes do framework
- Document Understanding no AI Center
- Pipelines
- Pipelines de treinamento e avaliação
- Pacotes de ML
- Gerenciador de Dados
- Serviços de OCR
- Licenciamento
- Referências
Os Pacotes de ML do Document Understanding podem executar todos os três tipos de pipelines (pipeline completo, de treinamento e de avaliação).
Para a maioria dos casos de uso, não é necessário especificar parâmetros: o modelo usa técnicas avançadas para encontrar um modelo de bom desempenho.
Você pode obter informações sobre um Pipeline em dois locais: na visualização Detalhes, acessível no menu suspenso contextual no lado direito da tabela de Pipelines; ou na guia Logs de ML na barra lateral esquerda. A visualização Detalhes contém um painel Saídas e uma página de Logs. O painel Saídas sempre conterá um arquivo _results.json com um resumo dos detalhes do Pipeline, como versão do pacote, conjunto de dados, uso da GPU e tempo de execução.
Pipelines de treinamento e retreinamento
Há dois tipos de pipelines de treinamento:
- Em um Pacote de ML do tipo Document Understanding
- Em um Pacote de ML de um tipo diferente, como faturas, recibos, ordens de compra, contas de serviços, faturas da Índia ou faturas da Austrália.
O treinamento usando um pacote de "Document Understanding" apenas treina um modelo desde o início no conjunto de dados fornecido como entrada.
Para casos de uso com documentos (formulários) de baixa diversidade, você pode obter bons resultados com apenas 30 a 50 amostras.
Para casos de uso com diversos documentos em que você precisa apenas de campos regulares ("cabeçalho"), são necessários pelo menos 20 a 50 amostras por campo; portanto, se precisar extrair 10 campos regulares, precisará de pelo menos 200 a 500 amostras.
Quando você precisar extrair campos de coluna (por exemplo, itens de linha), serão necessárias 50 a 200 amostras por campo de coluna; mas para layouts altamente complexos e diversos, pode-se exigir até 1000.
Se você também precisar cobrir vários idiomas, precisará de pelo menos 200 a 300 amostras por idioma. Esses números não precisam ser somados, exceto para os idiomas. Portanto, para 10 campos de cabeçalho e 5 campos de coluna, 500 amostras podem ser suficientes, mas em alguns casos mais de 1.000 podem ser necessárias.
O treinamento usando um dos pacotes descritos na etapa 2 requer uma entrada adicional: um modelo básico. Também nos referimos a isso como retreinamento, pois você não está começando do zero, mas de um modelo básico. Essa abordagem usa uma técnica chamada Transfer Learning (transferência de aprendizado), na qual o modelo aproveita as informações codificadas em outro modelo preexistente. Quando você treina nos mesmos campos para otimizar apenas a precisão, pode obter bons resultados com apenas 100 a 500 documentos adicionais. Se você estiver adicionando novos campos ao modelo, precisará de 30 a 50 documentos por novo campo para obter bons resultados. Ao escolher qual versão do modelo Base usar, sugerimos que sempre use a 1.0, a versão pré-treinada e pré-configurada fornecida pela UiPath.
Os campos de classificação não são treinados novamente, portanto, ao treinar novamente um modelo, você precisa ter certeza de que o conjunto de dados rotulado tem pelo menos 10 a 20 amostras de cada classe que deseja que o modelo reconheça, independentemente do desempenho do Modelo pré-treinado que você está usando como modelo base.
Ajuste fino usando dados da Estação de Validação (Visualização)
The September 2020 release of AI Fabric includes the capability of fine-tuning ML models using data that has been validated by a human using Validation Station.
Como seu fluxo de trabalho de RPA processa documentos usando um modelo de ML existente, alguns documentos podem exigir validação manual usando a atividade Estação de Validação (disponível em robôs attended ou no navegador usando o Orchestrator Action Center).
The validated data generated in Validation Station can be exported using Machine Learning Extractor Trainer activity, and can be used to fine-tune ML models in AI Fabric.
Não recomendamos o treinamento de modelos de ML do zero (ou seja, usando o pacote de ML DocumentUnderstanding) usando dados do Validation Station, mas apenas para ajustar modelos de ML existentes (incluindo modelos de ML prontos para uso) usando dados da Estação de Validação.
For the detailed steps involved in fine-tuning an ML model see the Validation Station Dataset Import section of the Data Manager documentation.
For successfully running Training or Full pipelines we strongly recommend at least 25 documents and at least 10 samples from each labelled field in your dataset. Otherwise the pipeline will show an error "Dataset Creation Failed"
As more data gets labelled, either using Data Manager or coming from Validation Station, best results are obtained by maintaining a single dataset and adding more data to it, and always retraining on the base model provided by UiPath, with minor version 0. It is strongly recommended to avoid retraining using a base model which you trained yourself previously (minor version 1 or higher).
Treinamento na GPU ou na CPU
Using a GPU (AI Robot Pro) for training is at least 10 times faster than using a CPU (AI Robot). Please be aware that training Document Understanding models on GPU requires a GPU with at least 11GB of video RAM to run successfully.
Os modelos de GPU precisam suportar a versão 418.0+ Drivers NVIDIA e drivers CUDA versão 9.0+.
O treinamento na CPU é suportado apenas para conjuntos de dados de até 500 imagens. Para conjuntos de dados maiores, você precisará treinar usando GPU.
Formato do conjunto de dados
A folder containing the exported dataset coming from Data Manager. This includes:
-
images: uma pasta contendo imagens de todas as páginas rotuladas;
-
latest recente: uma pasta contendo arquivos .json com os dados rotulados de cada página;
-
schema.json: um arquivo contendo os campos a serem extraídos e seus tipos;
-
split.csv: um arquivo contendo a divisão por cada documento que será usado para TREINAR ou VALIDAR durante o Pipeline de Treinamento
Variáveis de Ambiente
- ml_model.epochs: customize the number of epochs for Training or Full Pipeline (the default value is 150)
Artefatos
Quando o pipeline for Completo ou de Avaliação, o painel Saídas também conterá uma pasta "artefatos" que contém dois arquivos:
- evaluation_metrics.txt contém as pontuações F1 dos campos que foram previstos. Observe que, para itens de linha, apenas uma pontuação global é obtida para todas as colunas juntas.
- evaluation.xlsx é uma planilha do Excel com uma comparação lado a lado da verdade absoluta versus o valor previsto para cada campo previsto pelo modelo, bem como uma métrica de precisão por documento, em ordem crescente de precisão. Assim, os documentos mais imprecisos são apresentados na parte superior para facilitar o diagnóstico e a solução de problemas.