- Información general
- Contratos de procesamiento de documentos
- Notas relacionadas
- Acerca de los contratos de procesamiento de documento
- Clase Cuadro
- Interfaz IPersistedActivity
- Clase PrettyBoxConverter
- Interfaz IClassifierActivity
- Interfaz IClasificadorProveedorDeCapacidades
- Clase ClassifierDocumentType
- Clase ClassifierResult
- ClassifierCodeActivity Class
- ClassifierNativeActivity Class
- ClassifierAsyncCodeActivity Class
- Clase ClasificadorCapacidadDeTipoDeDocumento
- ContentValidationData Class
- EvaluatedBusinessRulesForFieldValue Class
- EvaluatedBusinessRuleDetails Class
- Clase
- Clase
- Clase ExtractorDocumentType
- Clase ExtractorDocumentTypeCapabilities
- Clase ExtractorFieldCapability
- Clase
- Clase ExtractorResult
- FieldValue Class
- FieldValueResult Class
- Interfaz ICapabilitiesProvider
- Interfaz IExtractorActivity
- Clase ExtractorPayload
- Enumeración DocumentActionPriority
- Clase DocumentActionData
- Enumeración DocumentActionStatus
- DocumentActionType Enum
- Clase DocumentClassificationActionData
- Clase DocumentValidationActionData
- Clase UserData
- Clase Documento
- Clase DocumentoDividirResultado
- Clase DomExtensions
- Clase Página
- Clase SecciónDePágina
- Clase de polígono
- Clase PolygonConverter
- Clase de metadatos
- Clase GrupoDeWord
- Clase Word
- Enum FuenteDeProcesamiento
- Clase ResultadosTablaCelda
- Clase ResultadosTablaValor
- Clase ResultadosTablaColumnaInfo
- Clase TablaDeResultados
- Enum Rotación
- Rule Class
- RuleResult Class
- RuleSet Class
- RuleSetResult Class
- Enum TipoDeSección
- Enum TipoDeGrupoDeWord
- Interfaz IDocumentTextProjection
- Clase ResultadoDeClasificación
- Clase ResultadoDeExtracción
- Clase ResultadosDeDocumento
- Clase ResultadosDeLímitesDeDocumento
- Clase ResultadosDePuntoDeDatos
- Clase ResultadosDeValor
- Clase ResultadosDeContenidoDeReferencia
- Clase ResultadosDeValorDeTokens
- Clase ResultadosDeCampoDerivado
- Enum ResultadosDeFuenteDeDatos
- Clase ResultadoDeConstantes
- Clase ValorDeCampoSimple
- Clase ValorDeCampoDeTabla
- Clase GrupoDeDocumento
- Clase TaxonomíaDeDocumento
- Clase TipoDeDocumento
- Clase Campo
- Enum TipoDeCampo
- FieldValueDetails Class
- Clase InformaciónDeLenguaje
- Clase MetadataEntry
- Enumeración de tipo de texto
- Clase TipoDeCampo
- Interfaz de actividad de ITracking
- Interfaz de ITrainableActivity
- Interfaz ITrainableClassifierActivity
- Interfaz ITrainableExtractorActivity
- Clase TrainableClassifierAsyncCodeActivity
- Clase TrainableClassifierCodeActivity
- Clase TrainableClassifierNativeActivity
- Clase TrainableExtractorAsyncCodeActivity
- Clase TrainableExtractorCodeActivity
- Clase TrainableExtractorNativeActivity
- Clase BasicDataPoint
- Clase BasicValue
- Clase ComponentCollectionFacade
- Clase DataPointFacadeBase
- Clase ExtractionResultHandler
- Clase FieldGroupDataPoint
- Clase de valor de grupo de campos
- Clase FieldLookupBase
- Clase de ConfiguraciónDeRedacciónDeCampo
- Clase de RedactionOptions (vista previa)
- Enumeración de tipo de redacción
- Clase ResultsValueFacadeBase
- Clase TableDataPoint
- Clase de FilaDeTabla
- Clase ValorDeTabla
- Clase WildcardDataPoint
- Clase WildcardDataPointCollection
- Document Understanding ML
- Servidor local de OCR de Document Understanding
- Document Understanding
- Notas relacionadas
- Acerca del paquete de actividades Document Understanding
- Compatibilidad de proyectos
- Configurar la conexión externa
- API de automatización codificada de Document Understanding (vista previa)
- Establecer contraseña de PDF
- Fusionar PDF
- Obtener el recuento de páginas del PDF
- Extraer texto en PDF
- Extraer imágenes en PDF
- Extraer rango de página en PDF
- Extraer datos del documento
- Cree una tarea de validación y espere
- Esperar la tarea de validación y continuar
- Crear tarea de validación
- Crear artefactos de validación de documentos
- Recuperar artefactos de validación de documentos
- Clasificar documento
- Crear tarea de validación de clasificación
- Crear tarea de validación de clasificación y esperar
- Esperar la tarea de validación de clasificación y reanudar
- OCRInteligente
- Notas relacionadas
- Acerca del paquete de actividades IntelligentOCR
- Compatibilidad de proyectos
- Cargar taxonomía
- Digitalizar documento
- Clasificar ámbito de documento
- Clasificador basado en palabras clave
- Clasificador de proyectos de Document Understanding
- Clasificador inteligente de palabra clave
- Crear acción de clasificación de documentos
- Crear artefactos de validación de documentos
- Recuperar artefactos de validación de documentos
- Esperar la acción de clasificación de documentos y reanudar
- Entrenar el alcance de los clasificadores
- Entrenador del clasificador basado en palabras clave
- Entrenador del clasificador inteligente de palabra clave
- Alcance de la extracción de información
- Extractor de proyectos de Document Understanding
- Entrenador del extractor de proyectos de Document Understanding
- Extractor basado en regex
- Extractor de forma
- Extractor inteligente de formularios
- Redactar documento
- Crear acción de validación de documentos
- Esperar la acción de validación de documentos y reanudar
- Entrenar el alcance de los Extractores
- Exportar resultados de extracción
- Extractor con aprendizaje automático
- Entrenador de extractor con aprendizaje automático
- Clasificador de aprendizaje automático
- Entrenador del clasificador de aprendizaje automático
- Clasificador generativo
- Extractor generativo
- Configurar autenticación
- Validar documentos con acciones de la aplicación
- Validación manual para digitalizar documentos
- Extracción de datos basada en anclajes utilizando el extractor inteligente de formularios
- Estación de validación
- Actividades generativas: buenas prácticas
- Extractor generativo: buenas prácticas
- Clasificador generativo: buenas prácticas
- Servicios ML
- OCR
- Contratos OCR
- Notas relacionadas
- Acerca de los contratos OCR
- Compatibilidad de proyectos
- IOCRActivity Interface
- OCRAsyncCodeActivity Class
- OCRCodeActivity Class
- OCRNativeActivity Class
- Clase Carácter
- Clase OCRResult
- Clase Word
- FontStyles Enum
- OCRRotation Enum
- Clase OCRCapabilities
- OCRScrapeBase Class
- OCRScrapeFactory Class
- ScrapeControlBase Class
- Enum ScrapeEngineUsages
- ExtraerBaseDelEctor
- Clase ScrapeEngineFactory
- Clase ExtraerEngineProvider
- OmniPage
- PDF
- Notas relacionadas
- Acerca del paquete de actividades de PDF
- Compatibilidad de proyectos
- API de automatización codificadas en PDF (vista previa)
- Convertir correo electrónico a PDF (vista previa)
- Convertir HTML a PDF (vista previa)
- Convertir texto a PDF (vista previa)
- Exportar página en PDF como imagen
- Extraer archivos adjuntos de PDF
- Extraer imágenes de PDF
- Extraer rango de página en PDF
- Obtener el recuento de páginas del PDF
- Unir archivos PDF
- Administrar contraseña de PDF
- Leer texto en PDF
- Leer PDF con OCR
- Leer texto en XPS
- Leer XPS con OCR
- [No en la lista] Abbyy
- [No en la lista] Abbyy incrustado
API de automatización codificadas para el paquete de actividades PDF, que cubren la lectura, fusión, conversión y manipulación de archivos PDF y XPS.
UiPath.PDF.Activities
API de flujo de trabajo codificado para leer, fusionar, convertir y manipular archivos PDF y XPS. Estas API están disponibles al diseñar automatizaciones codificadas. Para obtener una introducción a las automatizaciones codificadas y cómo diseñarlas utilizando API, consulta Automatizaciones codificadas.
- Descriptor de acceso de servicio:
pdf(tipoIPdfService) - Paquete requerido:
"UiPath.PDF.Activities": "*"en las dependenciasproject.json.
Espacios de nombres importados automáticamente
Los siguientes espacios de nombres están disponibles automáticamente en los flujos de trabajo codificados cuando se instala el paquete PDF:
UiPath.PDF.Activities.ApiUiPath.PDFUiPath.PDF.Activities.PDF.EnumsUiPath.Platform.ResourceHandlingSystem.Net.Mail
Descripción general del servicio
El servicio pdf expone cada operación como una llamada de método directo. No hay conexión ni ámbito que abrir. La mayoría de las operaciones proporcionan dos formas: una que toma una ruta de archivo como string y otra que toma un IResource (por ejemplo, la salida de la ruta Existente u Obtener archivo o carpeta local ). Llamar a métodos en el descriptor de acceso de servicio directamente:
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
Los métodos que crean o transforman un archivo devuelven un ILocalResource que apunta a la salida. Cuando outputFileName es null, el servicio genera un nombre automáticamente. Los archivos protegidos por contraseña se abren pasando el parámetro password. El parámetro range acepta "All" o rangos explícitos como "1-3,5".
Leyendo texto
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)
Lee el texto de un archivo PDF. Establece preserveFormatting como true para mantener el diseño del texto. También está disponible una sobrecarga que acepta un IResource.
string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Lee el texto de un PDF escaneado utilizando el motor OCR proporcionado. Obtén un motor OCR del servicio OCR (por ejemplo, IOcrService.GetUiPathDocumentOcr). degreeOfParallelism establece cuántas páginas se procesan a la vez. Solo Windows.
string ReadXpsText(string fileName, string range = "All")
Lee el texto de un archivo XPS. También está disponible una sobrecarga que acepta un IResource. Solo Windows.
string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)
Lee el texto de un archivo XPS utilizando el motor OCR proporcionado. Solo Windows.
Operaciones de página y documento
int GetPdfPageCount(string fileName, string password = null)
Devuelve el número de páginas de un archivo PDF. También está disponible una sobrecarga que acepta un IResource.
ILocalResource JoinPdf(string[] fileList, string outputFileName = null)
Combina varios archivos PDF en un solo PDF, en el orden indicado. También está disponible una sobrecarga que acepta un IResource[].
ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)
Extrae un rango de páginas (por ejemplo, "1-3,5") de un PDF en un nuevo PDF. También está disponible una sobrecarga que acepta un IResource.
ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Exporta una sola página (pageNumberbasado en 1) como una imagen. El formato de imagen se infiere de la extensión outputFileName. También está disponible una sobrecarga que acepta un IResource.
Crear y convertir
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)
Crea un PDF a partir de una lista de archivos de imagen, una imagen por página. Formatos de entrada compatibles: PNG, JPG, JPEG, TIF, TIFF, BMP. También está disponible una sobrecarga que acepta un IResource[].
ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Convierte el contenido HTML en un PDF. Establece keepBackground como true para conservar los colores de fondo y los gráficos.
ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Convierte un mensaje de correo electrónico en un PDF.
ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)
Convierte texto sin formato en PDF, con un tamaño de fuente y alineación de texto configurables.
Extraer imágenes y archivos adjuntos
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)
Extrae todas las imágenes de un PDF y las guarda en el formato elegido. También está disponible una sobrecarga que acepta un IResource.
IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)
Extrae los archivos incrustados en un PDF. filter Establece para limitar a extensiones específicas (pornew[] { ".docx", ".xlsx" } ejemplo,). También está disponible una sobrecarga que acepta un IResource.
Gestionar contraseñas
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)
Establece o elimina las contraseñas de usuario y propietario en un PDF. Pase null o una cadena vacía como nueva contraseña para eliminarla. También está disponible una sobrecarga que acepta un IResource.
Opciones
ConvertToPdfOptions
Opciones de diseño y contenido compartidas para los métodos de conversión.
HeaderHtmlString: fragmento de HTML utilizado como encabezado de la página. El valor predeterminado esnull(sin encabezado).FooterHtmlString: fragmento de HTML utilizado como pie de página. El valor predeterminado esnull(sin pie de página).PaperSizePaperSize: tamaño del papel para el PDF de salida. El valor predeterminado esA4.MarginInt: margen de la página en puntos. El valor predeterminado es0.ScaleDouble: escala de representación de la página, entre0.1y2inclusive. El valor predeterminado es1.0.
Referencia de enumeración
ImageExtension
Utilizado por ExtractImagesFromPdf.
PNG: formato de imagen PNG.JPEG: formato de imagen JPEG.TIFF: formato de imagen TIFF.BMP: formato de imagen BMP.
ImageDpi
Utilizado por ReadPdfWithOcr y ExportPdfPageAsImage.
Low: 96 DPI.Medium- 150 DPI. Predeterminado.High- 270 DPI.
TextAlignment
Utilizado por ConvertTextToPdf.
Justify- alineación justificada. Predeterminado.Left: alineación izquierda.Right- alineación derecha.Center- Alineación del centro.
PaperSize
Utilizado por ConvertToPdfOptions.
A4(predeterminado),A3,A5,A2,A6: tamaños de la serie ISO A.Letter,Legal,Tabloid,Ledger,Executive,Statement: tamaños de América del Norte.B4,B5: tamaños de la serie ISO B.Number10Envelope,DLEnvelope,C5Envelope,C4Envelope: tamaños de sobre.
Relación con las actividades
La API codificada y las actividades PDF XAML se ejecutan en el mismo runtime, por lo que un flujo de trabajo codificado alcanza el mismo comportamiento de lectura, conversión y manipulación que las actividades del paquete de actividades PDF. La diferencia es la forma de la llamada: el servicio toma rutas de archivos simples o entradas IResource y devuelve resultados string, int o ILocalResource directamente, y utilizas try/catch ordinarios en lugar de la actividad Opción Continuar en caso de error .
Patrones comunes
Leer el texto de un PDF
Este patrón lee el texto de un rango de páginas de un archivo PDF. ReadPdfText devuelve el texto extraído como string.
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
Combinar archivos PDF y extraer un rango de páginas
Este patrón fusiona dos archivos PDF en uno y luego extrae un rango de páginas del resultado fusionado. Cada paso devuelve un ILocalResource que apunta al archivo de salida.
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
Convertir HTML a PDF de tamaño Carta con un margen
Este patrón convierte una cadena HTML en un PDF, utilizando ConvertToPdfOptions para establecer un tamaño de papel Carta y un margen de página. ConvertHtmlToPdf devuelve un ILocalResource que apunta al PDF creado.
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
- Espacios de nombres importados automáticamente
- Descripción general del servicio
- Leyendo texto
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)string ReadXpsText(string fileName, string range = "All")string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)- Operaciones de página y documento
int GetPdfPageCount(string fileName, string password = null)ILocalResource JoinPdf(string[] fileList, string outputFileName = null)ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)- Crear y convertir
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)- Extraer imágenes y archivos adjuntos
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)- Gestionar contraseñas
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)- Opciones
ConvertToPdfOptions- Referencia de enumeración
ImageExtensionImageDpiTextAlignmentPaperSize- Relación con las actividades
- Patrones comunes
- Leer el texto de un PDF
- Combinar archivos PDF y extraer un rango de páginas
- Convertir HTML a PDF de tamaño Carta con un margen