- Información general
- Proceso de Document Understanding
- Tutoriales de inicio rápido
- Componentes de marco
- Paquetes ML
- Procesos
- Gestor de datos
- Servicios de OCR
- Document Understanding implementado en Automation Suite
- Document Understanding implementado en AI Center independiente
- Aprendizaje profundo
- Crear un modelo ML de alto rendimiento
- Licencia
- Referencias
- Actividades.DeUipath
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
El cuadro de diálogo Importar datos permite importar fácilmente nuevos documentos para etiquetar o revisar.
Click the Import button
from the management bar.
El cuadro de diálogo contiene los siguientes controles:
-
Campo de texto Nombre del lote: es obligatorio introducir un nombre para tu exportación, de lo contrario la sección Examinar o soltar archivos se desactiva; un nombre válido puede tener hasta 24 caracteres y no debe contener caracteres especiales.
-
Make this an evaluation set checkbox - if selected, the dataset is used for evaluation purposes.
-
Casilla Habilitar documentos grandes: si está seleccionada, puedes cargar documentos de más de 150 páginas.
-
Sección Examinar o soltar archivos: haz clic en Examinar los archivos para subirlos para navegar por tu directorio o simplemente arrastra los archivos dentro del marco.
-
Sección Estado: haz clic en (cargar el registro de importación anterior) para comprobar el estado de la última importación; cuando cargues datos, en la sección de estado recibirás un resumen de tus archivos y se te pedirá que continúes con la importación haciendo clic en SÍ o que abortes la importación haciendo clic en CANCELAR.
Importante:La versión 2021.10 de Data Manager admite el etiquetado de documentos de varias páginas. Se trata de un cambio importante con respecto a las versiones anteriores, en las que cada página se etiquetaba por separado. El etiquetado y la exportación de documentos de varias páginas supone que cada documento representa un único documento lógico. Por ejemplo, un documento de seis páginas puede contener una única factura de seis páginas, pero no debe contener tres facturas diferentes de dos páginas cada una. Esto es especialmente importante para los conjuntos de evaluación.
Este requisito no es pertinente para exportaciones retrocompatibles.
Tipos de importación
Hay cuatro tipos de Importar admitidos en Data Manager:
- Importación de esquema
- Raw documents import (max 2000 or 2GB pages per import)
- Data Manager dataset import (max 2000 or 2GB pages per import)
- Validation Station dataset import (max 2000 or 2GB pages per import)
Importación de esquema
Si te gustaría lanzar una nueva sesión de Data Manager utilizando el mismo esquema que en una sesión existente, puedes seguir estos pasos:
- Haz clic en el botón Exportar
desde la barra de gestión. - En el cuadro de diálogo Exportar archivos, marca la opción Esquema.
- Haz clic en el botón Exportar dentro del cuadro de diálogo. Se exporta un archivo
.zip. - Click the Import button
from the management bar. - Upload or drag & drop the
.zipfile directly into the new Data Manager session (do not unzip). In this step, you can also upload a predefined schema. - Haz clic en SÍ en la sección Estado para proceder a la importación. El esquema se importa.
You could also use one of the predefined schemas provided in the Use a Predefined Schema page.
Importación de documentos sin formato
Los tipos de documentos que se pueden importar para el etiquetado son .pdf, .tiff, .png y .jpg.
- Los archivos
.zipno son compatibles con la importación de documentos en bruto. - Los ajustes de OCR deben configurarse antes de la importación.
Sigue estos pasos:
-
Click the Import button
. The Import data dialog box is displayed. -
Indica un nombre de lote en el campo Nombre del lote. Esto te permite filtrar y encontrar fácilmente estos documentos usando el desplegable Buscar más adelante.
- Si deseas usar este lote de documentos para el entrenamiento de un modelo ML, deja sin seleccionar la casilla Hacer de esto un conjunto de evaluación.
- Si deseas usar este lote de documentos para evaluar un modelo ML (por ejemplo, para medir su rendimiento), selecciona la casilla Hacer de esto un conjunto de evaluación. Esto garantiza que los datos sean ignorados por los procesos de entrenamiento.
-
Si tienes documentos de más de 150 páginas, marca la casilla Habilitar documentos grandes. En caso contrario, deja la casilla sin marcar.
-
Carga o arrastra un archivo o conjunto de archivos en la sección Examinar o soltar archivos.
-
Haz clic en Sí. Se importa el archivo o conjunto de archivos.
Importación del conjunto de datos de Data Manager
Para importar un conjunto de datos, etiquetado previamente en otra sesión de Data Manager, debes obtener el archivo .zip exportado originalmente e importarlo directamente a la nueva instancia de Data Manager.
If your new Data Manager instance is completely empty (no data and no fields defined), then both the documents with labels and the schema are imported.
Si tu nueva instancia de Data Manager ya tiene campos definidos, entonces el conjunto de datos recién importado debe tener los mismos campos o un subconjunto de esos campos. En caso contrario, se rechaza la importación.
Dividir grandes conjuntos de datos
To import Data Manager datasets larger than 1GB or that have more than 1500 files, we recommend you to use this script which splits the .zip files into multiple .zip files that are smaller than 1GB and that have less than 1500 files.
Importación del conjunto de datos de la estación de validación
A medida que tu flujo de trabajo RPA procesa los documentos usando un modelo ML existente, algunos documentos pueden requerir de validación humana mediante la actividad Estación de validación (disponible en los robots attended o en el navegador que usa el Action Center de Orchestrator).
The validated data generated in Validation Station can be exported using Machine Learning Extractor Trainer activity and can be used to train ML models using the feature described below.
Para la importación de conjuntos de datos de la estación de validación, es obligatorio tener un esquema definido.
Sigue estos pasos:
- Configura el entrenador de extractor con aprendizaje automático para que los datos salgan en una carpeta con ruta
<Trainer/Output/Folder>(usa cualquier ruta de carpeta vacía). - Ejecuta un flujo de trabajo de RPA que incluya la estación de validación y el entrenador de extractor con aprendizaje automático.
- El entrenador de extractor con aprendizaje automático crea tres subcarpetas: documentos, metadatos y predicciones dentro de la carpeta de salida.
- Comprime
<Trainer/Output/Folder>para obtener un archivo.zip, por ejemplo TrainerOutputFolder.zip. - Import the
.zipfile into Data Manager which detects that the import contains data produced by Machine Learning Extractor Trainer and imports the data accordingly.
Si faltan campos requeridos por el conjunto de datos, se muestra un mensaje de error en el cuadro de diálogo de importación.