- Überblick
- Verträge zur Dokumentverarbeitung
- Versionshinweise
- Über die DocumentProcessing-Verträge
- Box-Klasse
- IPersistedActivity-Schnittstelle
- PrettyBoxConverter-Klasse
- IClassifierActivity-Schnittstelle
- IClassifierCapabilitiesProvider-Schnittstelle
- ClassifierDocumentType-Klasse
- ClassifierResult-Klasse
- ClassifierCodeActivity-Klasse
- ClassifierNativeActivity-Klasse
- ClassifierAsyncCodeActivity-Klasse
- ClassifierDocumentTypeCapability-Klasse
- ContentValidationData Class
- EvaluatedBusinessRulesForFieldValue Class
- EvaluatedBusinessRuleDetails Class
- ExtractorAsyncCodeActivity-Klasse
- ExtractorCodeActivity-Klasse
- ExtractorDocumentType-Klasse
- ExtractorDocumentTypeCapabilities-Klasse
- ExtractorFieldCapability-Klasse
- ExtractorNativeActivity-Klasse
- ExtractorResult-Klasse
- FieldValue Class
- FieldValueResult Class
- ICapabilitiesProvider-Schnittstelle
- IExtractorActivity-Schnittstelle
- ExtractorPayload-Klasse
- DocumentActionPriority-Enumeration
- DocumentActionData-Klasse
- DocumentActionStatus-Enumeration
- DocumentActionType-Enumeration
- DocumentClassificationActionData-Klasse
- DocumentValidationActionData-Klasse
- UserData-Klasse
- Document-Klasse
- DocumentSplittingResult-Klasse
- DomExtensions-Klasse
- Page-Klasse
- PageSection-Klasse
- Polygon-Klasse
- PolygonConverter-Klasse
- Metadatenklasse
- WordGroup-Klasse
- Word-Klasse
- ProcessingSource-Enumeration
- ResultsTableCell-Klasse
- ResultsTableValue-Klasse
- ResultsTableColumnInfo-Klasse
- ResultsTable-Klasse
- Rotation-Enumeration
- Rule Class
- RuleResult Class
- RuleSet Class
- RuleSetResult Class
- SectionType-Enumeration
- WordGroupType-Enumeration
- IDocumentTextProjection-Schnittstelle
- ClassificationResult-Klasse
- ExtractionResult-Klasse
- ResultsDocument-Klasse
- ResultsDocumentBounds-Klasse
- ResultsDataPoint-Klasse
- ResultsValue-Klasse
- ResultsContentReference-Klasse
- ResultsValueTokens-Klasse
- ResultsDerivedField-Klasse
- ResultsDataSource-Enumeration
- ResultConstants-Klasse
- SimpleFieldValue-Klasse
- TableFieldValue-Klasse
- DocumentGroup-Klasse
- DocumentTaxonomy-Klasse
- DocumentType-Klasse
- Field-Klasse
- FieldType-Enumeration
- FieldValueDetails Class
- LanguageInfo-Klasse
- MetadataEntry-Klasse
- TextType-Aufzählung
- TypeField-Klasse
- ITrackingActivity-Schnittstelle
- ITrainableActivity-Schnittstelle
- ITrainableClassifierActivity-Schnittstelle
- ITrainableExtractorActivity-Schnittstelle
- TrainableClassifierAsyncCodeActivity-Klasse
- TrainableClassifierCodeActivity-Klasse
- TrainableClassifierNativeActivity-Klasse
- TrainableExtractorAsyncCodeActivity-Klasse
- TrainableExtractorCodeActivity-Klasse
- TrainableExtractorNativeActivity-Klasse
- BasicDataPoint-Klasse
- BasicValue-Klasse
- ComponentCollection-Facade-Klasse
- DataPointFacadeBase-Klasse
- ExtractionResultHandler-Klasse
- FieldGroupDataPoint-Klasse
- FieldGroupValue-Klasse
- FieldLookupBase-Klasse
- FieldRedactionSettings-Klasse
- RedactionOptions-Klasse (Vorschau)
- Aufzählung des Redaktionstyps
- ResultsValueFacadeBase-Klasse
- TableDataPoint-Klasse
- TableRow-Klasse
- TableValue-Klasse
- PlatzhalterDataPoint-Klasse
- PlatzhalterDataPointCollection-Klasse
- Document Understanding ML
- Document Understanding OCR Local Server
- Document Understanding
- Versionshinweise
- Über das Document Understanding-Aktivitätspaket
- Projektkompatibilität
- Konfigurieren einer externen Verbindung
- Document Understanding-codierte Automatisierungs-APIs (Vorschau)
- PDF-Passwort festlegen
- Merge PDFs
- Get PDF Page Count
- Extract PDF Text
- Extract PDF Images
- PDF-Seitenbereich extrahieren
- Extract Document Data
- Validierungsaufgabe erstellen und warten
- Wait for Validation Task and Resume
- Create Validation Task
- Create Document Validation Artifacts
- Artefakte der Dokumentvalidierung abrufen
- Dokument klassifizieren (Classify Document)
- Create Classification Validation Task
- Create Classification Validation Task and Wait
- Wait For Classification Validation Task And Resume
- IntelligentOCR
- Versionshinweise
- Über das IntelligentOCR-Aktivitätspaket
- Projektkompatibilität
- Taxonomie laden (Load Taxonomy)
- Digitalisieren von Dokumenten
- Dokumentbereich klassifizieren (Classify Document Scope)
- Schlüsselwortbasierte Classifier (Keyword Based Classifier)
- Document Understanding-Projektklassifizierer
- Intelligenter Schlüsselwortklassifizierer
- Create Document Validation Action
- Create Document Validation Artifacts
- Artefakte der Dokumentvalidierung abrufen
- Wait For Document Classification Action And Resume
- Klassifizierer-Scope trainieren
- Keyword Based Classifier Trainer
- Intelligent Keyword Classifier Trainer
- Datenextraktionsumfang
- Document Understanding-Projektextraktor
- Document Understanding Project Extractor Trainer
- Regex Based Extractor
- Form Extractor
- Extraktor für intelligente Formulare
- Dokument zensieren
- Create Document Validation Action
- Wait For Document Validation Action And Resume
- Train Extractors Scope
- Extraktionsergebnisse exportieren
- Machine Learning Extractor
- Machine Learning Extractor Trainer
- Machine Learning Classifier
- Machine Learning Classifier Trainer
- Generativer Klassifizierer
- Generativer Extraktor
- Konfigurieren der Authentifizierung
- ML-Services
- OCR
- OCR-Verträge
- Versionshinweise
- Über die OCR-Verträge
- Projektkompatibilität
- IOCRActivity-Schnittstelle
- OCRAsyncCodeActivity-Klasse
- OCRCodeActivity-Klasse
- OCRNativeActivity-Klasse
- Character-Klasse
- OCRResult-Klasse
- Word-Klasse
- FontStyles-Enumeration
- OCRRotation-Enumeration
- OCRCapabilities-Klasse
- OCRScrapeBase-Klasse
- OCRScrapeFactory-Klasse
- ScrapeControlBase-Klasse
- ScrapeEngineUsages-Enumeration
- ScrapeEngineBase
- ScrapeEngineFactory-Klasse
- ScrapeEngineProvider-Klasse
- OmniPage
- PDF
- Versionshinweise
- Über das PDF-Aktivitätspaket
- Projektkompatibilität
- PDF-codierte Automatisierungs-APIs (Vorschau)
- E-Mail in PDF konvertieren (Vorschau)
- HTML in PDF konvertieren (Vorschau)
- Text in PDF konvertieren (Vorschau)
- Exportieren einer PDF-Seite als Bild
- Extract Attachments from PDF
- Bilder aus PDF exportieren
- PDF-Seitenbereich extrahieren
- Get PDF Page Count
- PDF-Dateien zusammenfügen
- Verwalten des PDF-Passworts
- PDF-Text lesen (Read PDF Text)
- PDF über OCR lesen (Read PDF With OCR)
- XPS-Text lesen (Read XPS Text)
- XPS über OCR lesen (Read XPS With OCR)
- [Nicht aufgeführt] Abbyy
- Versionshinweise
- Über das Abbyy-Aktivitätspaket
- Projektkompatibilität
- Abbyy OCR
- Abbyy Cloud OCR
- FlexiCapture Classifier
- FlexiCapture Extractor
- FlexiCapture Scope
- Dokument klassifizieren (Classify Document)
- Dokument verarbeiten (Process Document)
- Dokument validieren (Validate Document)
- Dokument exportieren (Export Document)
- Feld erhalten (Get Field)
- Tabelle erhalten (Get Table)
- Vorbereiten der Validierungsstationsdaten
- [Nicht aufgeführt] Abbyy Embedded
Codierte Automatisierungs-APIs für das PDF-Aktivitätspaket, die das Lesen, Zusammenführen, Konvertieren und Bearbeiten von PDF- und XPS-Dateien abdecken.
UiPath.PDF.Activities
Codierte Workflow-API zum Lesen, Zusammenführen, Konvertieren und Bearbeiten von PDF- und XPS-Dateien. Diese APIs sind beim Entwerfen von codierten Automatisierungen verfügbar. Eine Einführung in codierte Automatisierungen und deren Entwerfen mithilfe von APIs finden Sie unter Codierte Automatisierungen.
- Dienstzugriff:
pdf(TypIPdfService) - Erforderliches Paket:
"UiPath.PDF.Activities": "*"in denproject.json-Abhängigkeiten.
Automatisch importierte Namensräume
Die folgenden Namespaces sind automatisch in codierten Workflows verfügbar, wenn das PDF-Paket installiert ist:
UiPath.PDF.Activities.ApiUiPath.PDFUiPath.PDF.Activities.PDF.EnumsUiPath.Platform.ResourceHandlingSystem.Net.Mail
Serviceübersicht
Der pdf -Dienst macht jeden Vorgang als direkten Methodenaufruf verfügbar. Es ist keine Verbindung oder kein Scope zum Öffnen vorhanden. Die meisten Vorgänge bieten zwei Formulare: eines, das einen Dateipfad als string annimmt, und eines, das ein IResource annimmt (z. B. die Ausgabe der Aktivität Path Exists oder Get Local File or Folder ). Aufrufmethoden für den Dienstzugriff direkt:
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
Methoden, die eine Datei erstellen oder transformieren, geben ein ILocalResource zurück, das auf die Ausgabe verweist. Wenn outputFileName gleich null ist, generiert der Dienst automatisch einen Namen. Kennwortgeschützte Dateien werden durch Übergeben des Parameters password geöffnet. Der Parameter range akzeptiert "All" oder explizite Bereiche wie "1-3,5".
Text wird gelesen
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)
Liest den Text aus einer PDF-Datei. Legen Sie preserveFormatting auf true fest, um das Textlayout beizubehalten. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Liest den Text aus einer gescannten PDF-Datei mithilfe der bereitgestellten OCR-Engine. Rufen Sie ein OCR-Modul vom OCR-Dienst ab (z. B. IOcrService.GetUiPathDocumentOcr). degreeOfParallelism legt fest, wie viele Seiten gleichzeitig verarbeitet werden. Nur Windows.
string ReadXpsText(string fileName, string range = "All")
Liest den Text aus einer XPS-Datei. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar. Nur Windows.
string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)
Liest den Text mithilfe der bereitgestellten OCR-Engine aus einer XPS-Datei. Nur Windows.
Seiten- und Dokumentvorgänge
int GetPdfPageCount(string fileName, string password = null)
Gibt die Anzahl der Seiten in einer PDF-Datei zurück. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
ILocalResource JoinPdf(string[] fileList, string outputFileName = null)
Führt mehrere PDF-Dateien in der angegebenen Reihenfolge zu einer einzigen PDF-Datei zusammen. Eine Überladung, die ein IResource[] akzeptiert, ist ebenfalls verfügbar.
ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)
Extrahiert eine Reihe von Seiten (z. B. "1-3,5") aus einer PDF-Datei in eine neue PDF-Datei. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Exportiert eine einzelne Seite (1-basierte pageNumber) als Bild. Das Bildformat wird von der outputFileName -Erweiterung abgeleitet. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
Erstellen und Konvertieren
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)
Erstellt eine PDF-Datei aus einer Liste von Bilddateien, ein Bild pro Seite. Unterstützte Eingabeformate: PNG, JPG, JPEG, TIF, TIFF, BMP. Eine Überladung, die ein IResource[] akzeptiert, ist ebenfalls verfügbar.
ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Konvertiert HTML-Inhalt in eine PDF-Datei. Legen Sie keepBackground auf true fest, um Hintergrundfarbe und Grafiken beizubehalten.
ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Konvertiert eine E-Mail-Nachricht in eine PDF-Datei.
ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)
Konvertiert Nur-Text in eine PDF-Datei mit konfigurierbarer Schriftgröße und Textausrichtung.
Bilder und Anhänge werden extrahiert
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)
Extrahiert alle Bilder aus einer PDF-Datei und speichert sie im ausgewählten Format. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)
Extrahiert die in eine PDF-Datei eingebetteten Dateien. Legen Sie filter fest, um auf bestimmte Erweiterungen zu beschränken (z. B. new[] { ".docx", ".xlsx" }). Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
Verwalten von Kennwörtern
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)
Legt die Benutzer- und Besitzerkennwörter für eine PDF-Datei fest oder entfernt sie. Übergeben Sie null oder eine leere Zeichenfolge als neues Kennwort, um es zu entfernen. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.
Optionen
ConvertToPdfOptions
Freigegebene Layout- und Inhaltsoptionen für die Konvertierungsmethoden.
HeaderHtmlString– HTML-Snippet, das als Seitenheader verwendet wird. Die Standardeinstellung istnull(kein Header).FooterHtmlString– HTML-Snippet, das als Seiten Fußzeile verwendet wird. Die Standardeinstellung istnull(keine Fußzeile).PaperSizePaperSize– Papiergröße für die Ausgabe-PDF. Die Standardeinstellung istA4.MarginInt– Seitenrand in Punkten. Die Standardeinstellung ist0.ScaleDouble– Seitendarstellungsskalierung zwischen0.1und2einschließlich. Standardmäßig auf1.0.
Aufzählungsreferenz
ImageExtension
Wird von ExtractImagesFromPdf verwendet.
PNG– PNG-Bildformat.JPEG– JPEG-Bildformat.TIFF– TIFF-Bildformat.BMP– BMP-Bildformat.
ImageDpi
Wird von ReadPdfWithOcr und ExportPdfPageAsImage verwendet.
Low– 96 DPI.Medium– 150 DPI. Standard.High– 270 DPI.
TextAlignment
Wird von ConvertTextToPdf verwendet.
Justify– In Blocksatz. Standard.Left– Linksausrichtung.Right– Ausrichtung nach rechts.Center– Ausrichtungszentrum.
PaperSize
Wird von ConvertToPdfOptions verwendet.
A4(Standard),A3,A5,A2,A6– Größen der ISO A-Serie.Letter,Legal,Tabloid,Ledger,Executive,Statement– Nordeuropa.B4,B5– Größen der ISO-B-Serie.Number10Envelope,DLEnvelope,C5Envelope,C4Envelope– Umschlaggrößen.
Beziehung zu den Aktivitäten
Die codierte API und die PDF-XAML-Aktivitäten werden in derselben Runtime ausgeführt, sodass ein codierter Workflow das gleiche Lese-, Konvertierungs- und Manipulationsverhalten wie die Aktivitäten im PDF-Aktivitätspaket erreicht. Der Unterschied ist die Aufrufform: Der Dienst nimmt einfache Dateipfade oder IResource -Eingaben und gibt die Ergebnisse string, int oder ILocalResource direkt zurück, und Sie verwenden das normale try/catch anstelle der Aktivität Option Bei Fehler fortsetzen .
Häufige Muster
Liest den Text einer PDF-Datei
Dieses Muster liest den Text eines Seitenbereichs aus einer PDF-Datei. ReadPdfText gibt den extrahierten Text als string zurück.
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
Führen Sie PDF-Dateien zusammen und extrahieren Sie einen Seitenbereich
Dieses Muster führt zwei PDF-Dateien in einer zusammen und extrahiert dann einen Seitenbereich aus dem zusammengeführten Ergebnis. Jeder Schritt gibt ein ILocalResource zurück, das auf die Ausgabedatei verweist.
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
Konvertieren Sie HTML in eine PDF-Datei in Buchstabengröße mit Rand
Dieses Muster konvertiert eine HTML-Zeichenfolge in eine PDF-Datei, wobei ConvertToPdfOptions verwendet wird, um die Papiergröße „Buchstaben“ und einen Seitenrand festzulegen. ConvertHtmlToPdf gibt ILocalResource zurück, das auf die erstellte PDF-Datei verweist.
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
- Automatisch importierte Namensräume
- Serviceübersicht
- Text wird gelesen
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)string ReadXpsText(string fileName, string range = "All")string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)- Seiten- und Dokumentvorgänge
int GetPdfPageCount(string fileName, string password = null)ILocalResource JoinPdf(string[] fileList, string outputFileName = null)ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)- Erstellen und Konvertieren
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)- Bilder und Anhänge werden extrahiert
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)- Verwalten von Kennwörtern
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)- Optionen
ConvertToPdfOptions- Aufzählungsreferenz
ImageExtensionImageDpiTextAlignmentPaperSize- Beziehung zu den Aktivitäten
- Häufige Muster
- Liest den Text einer PDF-Datei
- Führen Sie PDF-Dateien zusammen und extrahieren Sie einen Seitenbereich
- Konvertieren Sie HTML in eine PDF-Datei in Buchstabengröße mit Rand