- Primeros pasos
- Componentes de marco
- Document Understanding en AI Center
- Procesos
- Paquetes ML
- Gestor de datos
- Servicios de OCR
- Servicios de OCR
- Licencia
- Referencias
Acerca de los servicios de OCR
Los servicios de OCR se utilizan para lo siguiente:
- En el momento de etiquetar los datos, al importar los documentos en Data Manager. Los servicios disponibles para este paso son UiPath Document OCR (gratuito en Cloud u On-premises), Google Cloud OCR (solo Cloud), Microsoft Read OCR (Cloud u On-Premises) y Omnipage (solo On-Premises).
- Durante el tiempo de ejecución a la hora de ejecutar los modelos desde los flujos de trabajo RPA. Los servicios disponibles para este paso consisten en todos los motores OCR integrados con la Plataforma de RPA de UiPath, incluyendo lo anterior, además de Abbyy Finereader, Microsoft OCR (heredado), Microsoft Project Oxford OCR y Tesseract.
In production, we recommend calling the OCR using the Digitize Document activity in your workflow and passing the Document Object Model as input to the activity calling the ML model. For this purpose, you need to use the Machine Learning Extractor activity (Official feed).
Para facilitar las pruebas, también se puede configurar el OCR directamente en AI Center (ventana de Configuración), aunque no se recomienda para las implementaciones de producción.
Opciones de implementación local
UiPath Document OCR tiene 3 opciones de implementación disponibles:
- On the robot using a LocalServer activity package and the UiPath.OCR.Activities package version 3.1.0-preview or later - requires no internet access and no additional hardware but the Robot machine needs a CPU with AVX2 support.
- Esta debe ser tu opción predeterminada. Para volúmenes mayores, se pueden añadir más robots.
- Contenedor Docker independiente que se ejecuta en una máquina Linux GPU (véase más abajo: recomendado para volúmenes superiores a 1 millón de páginas/año): se requiere acceso a Internet para la concesión de licencias/medición.
- Esta debe ser la opción predeterminada para grandes volúmenes de más de 2 o 3 millones de páginas al año.
- Contenedor Docker independiente que se ejecuta en una máquina con CPU Linux (véase más abajo): se requiere acceso a Internet para la concesión de licencias/medición.
- Solo para situaciones poco frecuentes en las que las máquinas Robot funcionen con CPU sin compatibilidad con AVX2 o en las que no se pueda obtener una GPU.
- ML Skill in AI Center (see ML Packages section) (GPU strongly recommended) - Internet access not required on premises if AI Center installation is airgapped
Requisitos
En esta sección se detallan los requisitos de hardware y software para instalar motores OCR.
Requisitos de hardware
- Machines Involved : VM in the Cloud or On-Prem Box or Laptop
- Operating Systems: Windows (Windows 10) or Linux (Ubuntu/CentOS/RedHat)
- Computing Engines: CPU or GPU
- OCR: UiPath Document OCR CPU or UiPath Document OCR GPU or OmniPage OCR CPU
| Núcleos de la CPU | RAM (GB) | RAM de vídeo (GB) | HDD (GB) | |
|---|---|---|---|---|
| CPU UiPath | 8 | 8 | 50 | |
| GPU UiPath | 1 | 4 | 8 | 50 |
| CPU OmniPage | 1 | 2 | 30 |
Requisitos de software
The software requirements for OCR Engines are the same as for Data Manager.
Configuración de la red
Data Manager needs access to OCR engine <IP>:<port_number>. OCR engine might be UiPath Document OCR on-premises, Omnipage OCR on-premises, Google Cloud Vision OCR, Microsoft Read Azure, Microsoft Read on-premises.
Robots need access to OCR <IP>:<port_number>. Same OCR options as above, except for Omnipage, which is available in the Robots directly as an Activity Pack.
Los motores OCR deben acceder al servidor de licencias alojado por UiPath en Azure, en el puerto 443.
Prueba mínima o configuración de prueba de concepto
Si solo deseas servir modelos previamente entrenados listos para usar, puedes ejecutar un motor OCR en el ordenador portátil con Windows 10. Asegúrate de que Docker Desktop dispone de 8 G de RAM.
Si deseas probar el entrenamiento de un modelo personalizado como demostración en un pequeño volumen de datos (menos de 100 documentos), puedes ejecutar el motor OCR en un entorno con un límite de 4 GB de RAM. Para casos pequeños como este, puede no ser necesaria una GPU para el motor OCR.
Requisitos previos
Los motores OCR son aplicaciones en contenedores que se ejecutan en Docker. No se pueden ejecutar en la misma máquina que AI Center local. Para ejecutarlos en una máquina independiente, se pueden utilizar los comandos del instalador de requisitos previos que se indican a continuación para configurar Docker y, opcionalmente, los controladores NVidia. Estos scripts no deben ejecutarse en la máquina donde se instalará AI Center.
The prerequisites for OCR Engines are the same as for Data Manager.
(Opcional) Instalación de la máquina GPU
Linux
Ejecuta este comando:
curl -fsSL https://raw.githubusercontent.com/UiPath/Infrastructure/master/ML/du_prereq_installer.sh | sudo bash -s -- --env gpu
curl -fsSL https://raw.githubusercontent.com/UiPath/Infrastructure/master/ML/du_prereq_installer.sh | sudo bash -s -- --env gpu
En algunos sistemas puede ser necesario ejecutar el comando dos veces o reiniciar el sistema para instalar todos los requisitos.
Azure Specific: In order to use the NV-series virtual machines you need to either install the NVIDIA driver before executing the above command, or you can use a Driver Extension from Azure to install the necessary NVIDIA driver according to that tier GPU model.
Máquinas virtuales con Azure
Si la instalación se realiza en una máquina virtual con Azure, utiliza este comando:
curl -fsSL https://raw.githubusercontent.com/UiPath/Infrastructure/master/ML/du_prereq_installer.sh | sudo bash -s -- --env gpu --cloud azure
curl -fsSL https://raw.githubusercontent.com/UiPath/Infrastructure/master/ML/du_prereq_installer.sh | sudo bash -s -- --env gpu --cloud azure
Instalación
UiPath Document OCR (Vista previa)
UiPath Document OCR es una tecnología OCR propia de UiPath, que admite los caracteres utilizados por los siguientes idiomas de escritura latina: inglés, francés, alemán, italiano, portugués, rumano y español. El texto en otros idiomas se reconocerá, pero sin acentos. Por ejemplo, "Ł" en polaco se reconocerá como "L". Las páginas procesadas con UiPath Document OCR no cuentan para la cuota de páginas adquirida junto con la licencia Enterprise de Document Understanding, por lo que el uso de UiPath Document OCR es gratuito.
UiPath Document OCR is available both on-premises as a docker container and in the cloud as a cloud service API with the URL: https://du.uipath.com/ocr. See the full description of the available URLs on the Public Endpoints page.
-
Para instalar UiPath Document OCR, ejecuta estos comandos:
docker login aiflprodweacr.azurecr.io -u *** -p **docker pull aiflprodweacr.azurecr.io/uipath-ocr:latestdocker login aiflprodweacr.azurecr.io -u *** -p **docker pull aiflprodweacr.azurecr.io/uipath-ocr:latest -
Ejecuta mediante CPU
docker run -d -p 5000:80 aiflprodweacr.azurecr.io/uipath-ocr:latest LicenseAgreement=acceptdocker run -d -p 5000:80 aiflprodweacr.azurecr.io/uipath-ocr:latest LicenseAgreement=accept -
Ejecuta mediante GPU
docker run -d -p 5000:80 --gpus all aiflprodweacr.azurecr.io/uipath-ocr:latest LicenseAgreement=acceptdocker run -d -p 5000:80 --gpus all aiflprodweacr.azurecr.io/uipath-ocr:latest LicenseAgreement=accept -
En AI Center, al crear un nuevo paquete ML, en la parte inferior de la pantalla se encuentra la sección de configuración del OCR, donde se puede definir el tipo de motor OCR, la URL del OCR y la clave del OCR. La clave del OCR es la clave API que se consigue en la sección de licencias de tu cuenta de Automation Cloud.
Importante:UiPath Document OCR container and Omnipage OCR container cannot run on the same machine as AI Center on-premises.
OmniPage OCR
El contenedor docker Omnipage está diseñado para utilizarse únicamente con Data Manager, con objeto de importar documentos en idiomas que UiPath Document OCR aún no admite.
Ejecuta estos comandos:
docker login aiflprodweacr.azurecr.io -u *** -p ***docker pull aiflprodweacr.azurecr.io/omnipage-ocr:latestdocker run -d -p 5100:80 aiflprodweacr.azurecr.io/omnipage-ocr:latest LicenseAgreement=accept
docker login aiflprodweacr.azurecr.io -u *** -p ***docker pull aiflprodweacr.azurecr.io/omnipage-ocr:latestdocker run -d -p 5100:80 aiflprodweacr.azurecr.io/omnipage-ocr:latest LicenseAgreement=accept
Google Cloud OCR
The endpoint can be obtained from the Google Cloud Platform documentation. The ApiKey can be obtained from your Google Cloud Platform Console if you have a Google Cloud Vision service in your subscription.
Microsoft Read
Aplicable tanto a los puntos finales de los contenedores de Azure como a los locales.
En el caso de los servicios de Azure, es necesario proporcionar tanto el punto final como la clave API.
En el caso de los puntos finales de contenedor local, no es necesaria la clave API.
Configurar el servicio de OCR en Data Manager y los paquetes ML de AI Center Document Understanding
En la siguiente tabla se muestra cómo configurar los seis tipos de motores OCR admitidos tanto en Data Manager como en AI Center.
El argumento ocr.method corresponde al menú desplegable del motor OCR en la vista de creación del paquete ML de AI Center.
| Motor OCR | ocr.method | ocr.key | ocr.url |
|---|---|---|---|
| UiPath | UiPath | UiPath Automation Cloud Clave API de Document Understanding Plan empresarial | http://<IP_addr>:<port_number> |
| OmniPage | omnipage | UiPath Automation Cloud Clave API de Document Understanding Plan empresarial | http://<IP_addr>:<port_number> |
| Clave de API de la consola GCP | https://vision.googleapis.com/v1/images:annotate | ||
| Microsoft Read 2.0 On-Prem | Microsoft | Ninguno | http://<IP_addr>:<port_number>/vision/v2.0/read/core/Analyze |
| Microsoft Read 2.0 Azure | Microsoft | Clave API para los recursos del Portal Azure | <Azure_resource_Endpoint>/vision/v2.0/read/core/asyncBatchAnalyze |
| Microsoft Read 3.1 local | Microsoft | Ninguno | http://<IP_addr>:<port_number>/vision/v3.1/read/analyze |
| Microsoft Read 3.1 Azure | Microsoft | Clave API para los recursos del Portal Azure | <Azure_resource_Endpoint>/vision/v3.1/read/analyze |
- Acerca de los servicios de OCR
- Opciones de implementación local
- Requisitos
- Requisitos de hardware
- Requisitos de software
- Configuración de la red
- Prueba mínima o configuración de prueba de concepto
- Requisitos previos
- (Opcional) Instalación de la máquina GPU
- Instalación
- UiPath Document OCR (Vista previa)
- OmniPage OCR
- Google Cloud OCR
- Microsoft Read
- Configurar el servicio de OCR en Data Manager y los paquetes ML de AI Center Document Understanding