UiPath Documentation
activities
latest
false
Document Understanding-Aktivitäten
Wichtig :
Bitte beachten Sie, dass dieser Inhalt teilweise mithilfe von maschineller Übersetzung lokalisiert wurde. Es kann 1–2 Wochen dauern, bis die Lokalisierung neu veröffentlichter Inhalte verfügbar ist.

PDF-codierte Automatisierungs-APIs (Vorschau)

Codierte Automatisierungs-APIs für das PDF-Aktivitätspaket, die das Lesen, Zusammenführen, Konvertieren und Bearbeiten von PDF- und XPS-Dateien abdecken.

UiPath.PDF.Activities

Codierte Workflow-API zum Lesen, Zusammenführen, Konvertieren und Bearbeiten von PDF- und XPS-Dateien. Diese APIs sind beim Entwerfen von codierten Automatisierungen verfügbar. Eine Einführung in codierte Automatisierungen und deren Entwerfen mithilfe von APIs finden Sie unter Codierte Automatisierungen.

  • Dienstzugriff: pdf (Typ IPdfService)
  • Erforderliches Paket: "UiPath.PDF.Activities": "*" in den project.json -Abhängigkeiten.

Automatisch importierte Namensräume

Die folgenden Namespaces sind automatisch in codierten Workflows verfügbar, wenn das PDF-Paket installiert ist:

  • UiPath.PDF.Activities.Api
  • UiPath.PDF
  • UiPath.PDF.Activities.PDF.Enums
  • UiPath.Platform.ResourceHandling
  • System.Net.Mail

Serviceübersicht

Der pdf -Dienst macht jeden Vorgang als direkten Methodenaufruf verfügbar. Es ist keine Verbindung oder kein Scope zum Öffnen vorhanden. Die meisten Vorgänge bieten zwei Formulare: eines, das einen Dateipfad als string annimmt, und eines, das ein IResource annimmt (z. B. die Ausgabe der Aktivität Path Exists oder Get Local File or Folder ). Aufrufmethoden für den Dienstzugriff direkt:

string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");

Methoden, die eine Datei erstellen oder transformieren, geben ein ILocalResource zurück, das auf die Ausgabe verweist. Wenn outputFileName gleich null ist, generiert der Dienst automatisch einen Namen. Kennwortgeschützte Dateien werden durch Übergeben des Parameters password geöffnet. Der Parameter range akzeptiert "All" oder explizite Bereiche wie "1-3,5".

Text wird gelesen

string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)

Liest den Text aus einer PDF-Datei. Legen Sie preserveFormatting auf true fest, um das Textlayout beizubehalten. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)

Liest den Text aus einer gescannten PDF-Datei mithilfe der bereitgestellten OCR-Engine. Rufen Sie ein OCR-Modul vom OCR-Dienst ab (z. B. IOcrService.GetUiPathDocumentOcr). degreeOfParallelism legt fest, wie viele Seiten gleichzeitig verarbeitet werden. Nur Windows.

string ReadXpsText(string fileName, string range = "All")

Liest den Text aus einer XPS-Datei. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar. Nur Windows.

string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)

Liest den Text mithilfe der bereitgestellten OCR-Engine aus einer XPS-Datei. Nur Windows.

Seiten- und Dokumentvorgänge

int GetPdfPageCount(string fileName, string password = null)

Gibt die Anzahl der Seiten in einer PDF-Datei zurück. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

ILocalResource JoinPdf(string[] fileList, string outputFileName = null)

Führt mehrere PDF-Dateien in der angegebenen Reihenfolge zu einer einzigen PDF-Datei zusammen. Eine Überladung, die ein IResource[] akzeptiert, ist ebenfalls verfügbar.

ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)

Extrahiert eine Reihe von Seiten (z. B. "1-3,5") aus einer PDF-Datei in eine neue PDF-Datei. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)

Exportiert eine einzelne Seite (1-basierte pageNumber) als Bild. Das Bildformat wird von der outputFileName -Erweiterung abgeleitet. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

Erstellen und Konvertieren

ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)

Erstellt eine PDF-Datei aus einer Liste von Bilddateien, ein Bild pro Seite. Unterstützte Eingabeformate: PNG, JPG, JPEG, TIF, TIFF, BMP. Eine Überladung, die ein IResource[] akzeptiert, ist ebenfalls verfügbar.

ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)

Konvertiert HTML-Inhalt in eine PDF-Datei. Legen Sie keepBackground auf true fest, um Hintergrundfarbe und Grafiken beizubehalten.

ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)

Konvertiert eine E-Mail-Nachricht in eine PDF-Datei.

ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)

Konvertiert Nur-Text in eine PDF-Datei mit konfigurierbarer Schriftgröße und Textausrichtung.

Bilder und Anhänge werden extrahiert

IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)

Extrahiert alle Bilder aus einer PDF-Datei und speichert sie im ausgewählten Format. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)

Extrahiert die in eine PDF-Datei eingebetteten Dateien. Legen Sie filter fest, um auf bestimmte Erweiterungen zu beschränken (z. B. new[] { ".docx", ".xlsx" }). Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

Verwalten von Kennwörtern

ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)

Legt die Benutzer- und Besitzerkennwörter für eine PDF-Datei fest oder entfernt sie. Übergeben Sie null oder eine leere Zeichenfolge als neues Kennwort, um es zu entfernen. Eine Überladung, die ein IResource akzeptiert, ist ebenfalls verfügbar.

Optionen

ConvertToPdfOptions

Freigegebene Layout- und Inhaltsoptionen für die Konvertierungsmethoden.

  • HeaderHtml String – HTML-Snippet, das als Seitenheader verwendet wird. Die Standardeinstellung ist null (kein Header).
  • FooterHtml String – HTML-Snippet, das als Seiten Fußzeile verwendet wird. Die Standardeinstellung ist null (keine Fußzeile).
  • PaperSize PaperSize – Papiergröße für die Ausgabe-PDF. Die Standardeinstellung ist A4.
  • Margin Int – Seitenrand in Punkten. Die Standardeinstellung ist 0.
  • Scale Double – Seitendarstellungsskalierung zwischen 0.1 und 2 einschließlich. Standardmäßig auf 1.0.

Aufzählungsreferenz

ImageExtension

Wird von ExtractImagesFromPdf verwendet.

  • PNG – PNG-Bildformat.
  • JPEG – JPEG-Bildformat.
  • TIFF – TIFF-Bildformat.
  • BMP – BMP-Bildformat.

ImageDpi

Wird von ReadPdfWithOcr und ExportPdfPageAsImage verwendet.

  • Low – 96 DPI.
  • Medium – 150 DPI. Standard.
  • High – 270 DPI.

TextAlignment

Wird von ConvertTextToPdf verwendet.

  • Justify – In Blocksatz. Standard.
  • Left – Linksausrichtung.
  • Right – Ausrichtung nach rechts.
  • Center – Ausrichtungszentrum.

PaperSize

Wird von ConvertToPdfOptions verwendet.

  • A4 (Standard), A3, A5, A2, A6 – Größen der ISO A-Serie.
  • Letter, Legal, Tabloid, Ledger, Executive, Statement – Nordeuropa.
  • B4, B5 – Größen der ISO-B-Serie.
  • Number10Envelope, DLEnvelope, C5Envelope, C4Envelope – Umschlaggrößen.

Beziehung zu den Aktivitäten

Die codierte API und die PDF-XAML-Aktivitäten werden in derselben Runtime ausgeführt, sodass ein codierter Workflow das gleiche Lese-, Konvertierungs- und Manipulationsverhalten wie die Aktivitäten im PDF-Aktivitätspaket erreicht. Der Unterschied ist die Aufrufform: Der Dienst nimmt einfache Dateipfade oder IResource -Eingaben und gibt die Ergebnisse string, int oder ILocalResource direkt zurück, und Sie verwenden das normale try/catch anstelle der Aktivität Option Bei Fehler fortsetzen .

Häufige Muster

Liest den Text einer PDF-Datei

Dieses Muster liest den Text eines Seitenbereichs aus einer PDF-Datei. ReadPdfText gibt den extrahierten Text als string zurück.

[Workflow]
public void Execute()
{
    string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
    Log(text);
}
[Workflow]
public void Execute()
{
    string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
    Log(text);
}

Führen Sie PDF-Dateien zusammen und extrahieren Sie einen Seitenbereich

Dieses Muster führt zwei PDF-Dateien in einer zusammen und extrahiert dann einen Seitenbereich aus dem zusammengeführten Ergebnis. Jeder Schritt gibt ein ILocalResource zurück, das auf die Ausgabedatei verweist.

[Workflow]
public void Execute()
{
    var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
    var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
[Workflow]
public void Execute()
{
    var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
    var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}

Konvertieren Sie HTML in eine PDF-Datei in Buchstabengröße mit Rand

Dieses Muster konvertiert eine HTML-Zeichenfolge in eine PDF-Datei, wobei ConvertToPdfOptions verwendet wird, um die Papiergröße „Buchstaben“ und einen Seitenrand festzulegen. ConvertHtmlToPdf gibt ILocalResource zurück, das auf die erstellte PDF-Datei verweist.

[Workflow]
public void Execute()
{
    var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
    var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
[Workflow]
public void Execute()
{
    var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
    var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}

War diese Seite hilfreich?

Verbinden

Benötigen Sie Hilfe? Support

Möchten Sie lernen? UiPath Academy

Haben Sie Fragen? UiPath-Forum

Auf dem neuesten Stand bleiben