- Visão geral
- Contratos de Processamento de Documentos
- Notas de versão
- Sobre os Contratos de Processamento de Documentos
- Classe Box
- Interface IPersistedActivity
- Classe PrettyBoxConverter
- Interface IClassifierActivity
- Interface IClassifierCapabilitiesProvider
- Classe ClassifierDocumentType
- Classe ClassifierResult
- Classe ClassifierCodeActivity
- Classe ClassifierNativeActivity
- Classe ClassifierAsyncCodeActivity
- Classe ClassifierDocumentTypeCapability
- ContentValidationData Class
- EvaluatedBusinessRulesForFieldValue Class
- EvaluatedBusinessRuleDetails Class
- Classe ExtractorAsyncCodeActivity
- Classe ExtractorCodeActivity
- Classe ExtractorDocumentType
- Classe ExtractorDocumentTypeCapabilities
- Classe ExtractorFieldCapability
- Classe ExtractorNativeActivity
- Classe ExtractorResult
- FieldValue Class
- FieldValueResult Class
- Interface ICapabilitiesProvider
- Interface IExtractorActivity
- Classe ExtractorPayload
- Enumeração DocumentActionPriority
- Classe DocumentActionData
- Enumeração DocumentActionStatus
- Enumeração DocumentActionType
- Classe DocumentClassificationActionData
- Classe DocumentValidationActionData
- Classe UserData
- Classe Document
- Classe DocumentSplittingResult
- Classe DomExtensions
- Classe Page
- Classe PageSection
- Classe Polígono
- Classe PolygonConverter
- Classe de metadados
- Classe WordGroup
- Classe Word
- Enumeração ProcessingSource
- Classe ResultsTableCell
- Classe ResultsTableValue
- Classe ResultsTableColumnInfo
- Classe ResultsTable
- Enumeração Rotation
- Rule Class
- RuleResult Class
- RuleSet Class
- RuleSetResult Class
- Enumeração SectionType
- Enumeração WordGroupType
- Interface IDocumentTextProjection
- Classe ClassificationResult
- Classe ExtractionResult
- Classe ResultsDocument
- Classe ResultsDocumentBounds
- Classe ResultsDataPoint
- Classe ResultsValue
- Classe ResultsContentReference
- Classe ResultsValueTokens
- Classe ResultsDerivedField
- Enumeração ResultsDataSource
- Classe ResultConstants
- Classe SimpleFieldValue
- Classe TableFieldValue
- Classe DocumentGroup
- Classe DocumentTaxonomy
- Classe DocumentType
- Classe Field
- Enumeração FieldType
- FieldValueDetails Class
- Classe LanguageInfo
- Classe MetadataEntry
- Enumeração de tipo de texto
- Classe TypeField
- Interface ITrackingActivity
- Interface ITrainableActivity
- Interface ITrainableClassifierActivity
- Interface ITrainableExtractorActivity
- Classe TrainableClassifierAsyncCodeActivity
- Classe TrainableClassifierCodeActivity
- Classe TrainableClassifierNativeActivity
- Classe TrainableExtractorAsyncCodeActivity
- Classe TrainableExtractorCodeActivity
- Classe TrainableExtractorNativeActivity
- Classe BasicDataPoint
- Classe BasicValue
- Classe ComponentCollectionFacade
- Classe DataPointFacadeBase
- Classe ExtractionResultHandler
- Classe FieldGroupDataPoint
- Classe FieldGroupValue
- Classe Field Lookup Base
- Classe FieldRedactionSettings
- Classe RedactionOptions (pré-visualização)
- TipoDeRedação Enum
- Classe ResultsValueFacadeBase
- Classe TableDataPoint
- Classe TableRow
- Classe TableValue
- Classe CuringaDataPoint
- Classe curingaDataPointCollection
- Document Understanding ML
- Document Understanding OCR Local Server
- Document Understanding
- Notas de versão
- Sobre o pacote de atividades Document Understanding
- Compatibilidade do projeto
- Configuração da conexão externa
- APIs de automação codificadas do Document Understanding (visualização)
- Definir Senha do PDF
- Merge PDFs
- Get PDF Page Count
- Extract PDF Text
- Extract PDF Images
- Extract PDF Page Range
- Extract Document Data
- Criar tarefa de validação e aguardar
- Aguarde a tarefa de validação e retome
- Create Validation Task
- Create Document Validation Artifacts
- Recuperar artefatos de validação de documento
- Classificar Documento
- Create Classification Validation Task
- Create Classification Validation Task and Wait
- Aguardar a tarefa de Validação de Classificação e retomar
- IntelligentOCR
- Notas de versão
- Sobre o pacote de atividades IntelligentOCR
- Compatibilidade do projeto
- Carregar Taxonomia
- Digitize Document
- Classificar Escopo do Documento
- Classificador baseado em palavra-chave
- Document Understanding Project Classifier
- Intelligent Keyword Classifier
- Create Document Classification Action
- Create Document Validation Artifacts
- Recuperar artefatos de validação de documento
- Aguardar ação de classificação do documento e retomar
- Train Classifiers Scope
- Instrutor de Classificador Baseado em Palavra-chave
- Intelligent Keyword Classifier Trainer
- Escopo da Extração de Dados
- Document Understanding Project Extractor
- Document Understanding Project Extractor Trainer
- Regex Based Extractor
- Form Extractor
- Intelligent Form Extractor
- Rasurar documento
- Create Document Validation Action
- Wait For Document Validation Action And Resume
- Escopo de Extratores de Treinamento
- Exportar Resultados da Extração
- Machine Learning Extractor
- Machine Learning Extractor Trainer
- Machine Learning Classifier
- Machine Learning Classifier Trainer
- Classificador Generativo
- Extrator Generativo
- Configuração da autenticação
- Validação de documentos com ações de aplicativos
- Validação manual para digitalizar documentos
- Extração de dados baseada em âncora usando a atividade Intelligent Form Extractor
- Validation Station
- Atividades generativas — Boas práticas
- Extrator generativo — boas práticas
- Classificador generativo — Boas práticas
- Serviços de ML
- OCR
- Contratos de OCR
- Notas de versão
- Sobre os Contratos OCR
- Compatibilidade do projeto
- Interface IOCRActivity
- Classe OCRAsyncCodeActivity
- Classe OCRCodeActivity
- Classe OCRNativeActivity
- Character Class
- Classe OCRResult
- Classe Word
- Enumeração FontStyles
- Enumeração OCRRotation
- Classe OCRCapabilities
- Classe OCRScrapeBase
- Classe OCRScrapeFactory
- Classe ScrapeControlBase
- Enumeração ScrapeEngineUsages
- ScrapeEngineBase
- Classe ScrapeEngineFactory
- Classe ScrapeEngineProvider
- OmniPage
- PDF
- Notas de versão
- Sobre o pacote de atividades PDF
- Compatibilidade do projeto
- APIs de automação codificadas em PDF (pré-visualização)
- Converter e-mail para PDF (pré-visualização)
- Converter HTML para PDF (pré-visualização)
- Converter texto para PDF (pré-visualização)
- Export PDF Page As Image
- Extrair anexos de PDF
- Extract Images From PDF
- Extract PDF Page Range
- Get PDF Page Count
- Join PDF Files
- Manage PDF Password
- Read PDF Text
- Read PDF With OCR
- Read XPS Text
- Read XPS With OCR
- [Não listado] Abbyy
- [Não listado] Abbyy Embedded
APIs de automação codificadas para o pacote de atividades de PDF, cobrindo leitura, mesclação, conversão e manipulação de arquivos PDF e XPS.
UiPath.PDF.Activities
API de fluxo de trabalho codificado para ler, mesclar, converter e manipular arquivos PDF e XPS. Essas APIs estão disponíveis ao projetar automações codificadas. Para obter uma introdução a automações codificadas e como projetá-las usando APIs, consulte Automações codificadas.
- Acessador de serviço:
pdf(tipoIPdfService) - Pacote obrigatório:
"UiPath.PDF.Activities": "*"nas dependênciasproject.json.
Namespaces importados automaticamente
Os seguintes namespaces estão disponíveis automaticamente em fluxos de trabalho codificados quando o pacote PDF é instalado:
UiPath.PDF.Activities.ApiUiPath.PDFUiPath.PDF.Activities.PDF.EnumsUiPath.Platform.ResourceHandlingSystem.Net.Mail
Visão geral do serviço
O pdf serviço expõe cada operação como uma chamada de método direta. Não há conexão ou escopo para abrir. A maioria das operações fornece duas formas: uma que leva um caminho de arquivo como um string, e uma que leva um IResource (por exemplo, a saída da atividade Path Exists ou Get Local File or Folder ). Chame métodos no acessador de serviço diretamente:
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
Os métodos que criam ou transformam um arquivo retornam um ILocalResource apontando para a saída. Quando outputFileName é null, o serviço gera um nome automaticamente. Arquivos protegidos por senha são abertos passando o parâmetro password. O parâmetro range aceita "All" ou intervalos explícitos, como "1-3,5".
Lendo o texto
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)
Lê o texto de um arquivo PDF. Defina preserveFormatting como true para manter o layout de texto. Uma sobrecarga aceitando um IResource também está disponível.
string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Lê o texto de um PDF digitalizado usando o mecanismo de OCR fornecido. Obtenha um mecanismo de OCR do serviço de OCR (por exemplo, IOcrService.GetUiPathDocumentOcr). degreeOfParallelism define quantas páginas são processadas de uma só vez. Apenas no Windows.
string ReadXpsText(string fileName, string range = "All")
Lê o texto de um arquivo XPS. Uma sobrecarga aceitando um IResource também está disponível. Apenas no Windows.
string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)
Lê o texto de um arquivo XPS usando o mecanismo de OCR fornecido. Apenas no Windows.
Operações de página e documento
int GetPdfPageCount(string fileName, string password = null)
Retorna o número de páginas em um arquivo PDF. Uma sobrecarga aceitando um IResource também está disponível.
ILocalResource JoinPdf(string[] fileList, string outputFileName = null)
Mescla vários arquivos PDF em um único PDF, na ordem fornecida. Uma sobrecarga aceitando um IResource[] também está disponível.
ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)
Extrai um intervalo de páginas (por exemplo, "1-3,5") de um PDF para um novo PDF. Uma sobrecarga aceitando um IResource também está disponível.
ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Exporta uma única página (pageNumber com base em 1) como uma imagem. O formato da imagem é inferido da extensão outputFileName. Uma sobrecarga aceitando um IResource também está disponível.
Criação e conversão
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)
Cria um PDF a partir de uma lista de arquivos de imagem, uma imagem por página. Formatos de entrada compatíveis: PNG, JPG, JPEG, TIF, TIFF, BMP. Uma sobrecarga aceitando um IResource[] também está disponível.
ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Converte conteúdo HTML em PDF. Defina keepBackground como true para preservar as cores de fundo e os gráficos.
ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Converte uma mensagem de email em PDF.
ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)
Converte texto simples em PDF, com tamanho de fonte e alinhamento de texto configuráveis.
Extração de imagens e anexos
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)
Extrai todas as imagens de um PDF e as salva no formato escolhido. Uma sobrecarga aceitando um IResource também está disponível.
IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)
Extrai os arquivos incorporados em um PDF. Defina filter para limitar a extensões específicas (por exemplo, new[] { ".docx", ".xlsx" }). Uma sobrecarga aceitando um IResource também está disponível.
Gerenciamento de senhas
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)
Define ou remove as senhas do usuário e proprietário em um PDF. Passe null ou uma string vazia como uma nova senha para removê-la. Uma sobrecarga aceitando um IResource também está disponível.
Opções
ConvertToPdfOptions
Opções de layout e conteúdo compartilhados para os métodos de conversão.
HeaderHtmlString- Fragmento de HTML usado como cabeçalho da página. O padrão énull(sem cabeçalho).FooterHtmlString- Fragmento de HTML usado como rodapé da página. O padrão énull(sem rodapé).PaperSizePaperSize- Tamanho do papel para o PDF de saída. O padrão éA4.MarginInt- Margem da página em pontos. O padrão é0.ScaleDouble- Escala de renderização de página, entre0.1e2, inclusive. O padrão é1.0.
Referência enumerada
ImageExtension
Usado por ExtractImagesFromPdf.
PNG– Formato de imagem PNG.JPEG- Formato de imagem JPEG.TIFF– Formato de imagem TIFF.BMP– Formato de imagem BMP.
ImageDpi
Usado por ReadPdfWithOcr e ExportPdfPageAsImage.
Low- 96 DPI.Medium- 150 DPI. Padrão.High- 270 DPI.
TextAlignment
Usado por ConvertTextToPdf.
Justify- Alinhamento justificado. Padrão.Left- Alinhamento à esquerda.Right- Alinhamento à direita.Center- Alinhamento central.
PaperSize
Usado por ConvertToPdfOptions.
A4(padrão),A3,A5,A2,A6— Tamanhos ISO A-series.Letter,Legal,Tabloid,Ledger,Executive,Statement- Tamanhos americano.B4,B5- Tamanhos ISO série B.Number10Envelope,DLEnvelope,C5Envelope,C4Envelope— Tamanhos de envelopes.
Relacionamento com as atividades
A API codificada e as atividades PDF XAML são executadas no mesmo runtime, portanto, um fluxo de trabalho codificado atinge o mesmo comportamento de leitura, conversão e manipulação que as atividades no pacote de atividades PDF. A diferença está no formato da chamada: o serviço pega caminhos de arquivos simples ou IResource entradas e retorna string, int ou ILocalResource resultados diretamente, e você usa try/catch comum em vez da atividade Continuar com erro
Padrões comuns
Ler o texto de um PDF
Esse padrão lê o texto de um intervalo de páginas de um arquivo PDF. ReadPdfText retorna o texto extraído como string um.
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
Mesclar PDFs e extrair um intervalo de páginas
Esse padrão mescla dois arquivos PDF em um e, em seguida, extrai um intervalo de páginas do resultado mesclado. Cada etapa retorna um ILocalResource apontando para o arquivo de saída.
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
Converter HTML em um PDF padrão com margem
Esse padrão converte uma string HTML em um PDF, usando ConvertToPdfOptions para definir um tamanho de papel Carta e uma margem de página. ConvertHtmlToPdf retorna um ILocalResource apontando para o PDF criado.
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
- Namespaces importados automaticamente
- Visão geral do serviço
- Lendo o texto
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)string ReadXpsText(string fileName, string range = "All")string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)- Operações de página e documento
int GetPdfPageCount(string fileName, string password = null)ILocalResource JoinPdf(string[] fileList, string outputFileName = null)ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)- Criação e conversão
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)- Extração de imagens e anexos
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)- Gerenciamento de senhas
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)- Opções
ConvertToPdfOptions- Referência enumerada
ImageExtensionImageDpiTextAlignmentPaperSize- Relacionamento com as atividades
- Padrões comuns
- Ler o texto de um PDF
- Mesclar PDFs e extrair um intervalo de páginas
- Converter HTML em um PDF padrão com margem