UiPath Documentation
activities
latest
false
Document Understanding アクティビティ
重要 :
このコンテンツの一部は機械翻訳によって処理されており、完全な翻訳を保証するものではありません。 新しいコンテンツの翻訳は、およそ 1 ~ 2 週間で公開されます。

PDF のコード化されたオートメーション API (プレビュー)

PDF アクティビティ パッケージのコード化されたオートメーション API です。PDF および XPS ファイルの読み取り、結合、変換、操作に対応しています。

UiPath.PDF.Activities

PDF および XPS ファイルの読み取り、結合、変換、操作を行うためのコード化されたワークフロー API です。これらの API は、コード化されたオートメーションを設計する際に使用できます。コード化されたオートメーションの概要と、API を使用してそれらのオートメーションを設計する方法については、「 コード化されたオートメーション」をご覧ください

  • サービス アクセサ: pdf ( IPdfService型)
  • 必要なパッケージ: 依存関係project.json"UiPath.PDF.Activities": "*"

自動インポートされる名前空間

PDF パッケージをインストールすると、コード化されたワークフローで以下の名前空間が自動的に利用可能になります。

  • UiPath.PDF.Activities.Api
  • UiPath.PDF
  • UiPath.PDF.Activities.PDF.Enums
  • UiPath.Platform.ResourceHandling
  • System.Net.Mail

サービスの概要

pdf サービスでは、各操作が直接メソッド呼び出しとして公開されます。開くコネクションまたはスコープがありません。ほとんどの操作には 2 つの形式があります。1 つはファイル パスを stringとして受け取る形式と、 IResource 形式 (たとえば、[ パスの存在を確認] アクティビティや [ ローカル ファイル/フォルダーを取得 ] アクティビティの出力など) です。サービス アクセサーのメソッドを直接呼び出します。

string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");

ファイルを作成または変換するメソッドは、出力を指す ILocalResource を返します。outputFileNamenullの場合、サービスによって名前が自動的に生成されます。パスワードで保護されたファイルは、 password パラメーターを渡すことで開かれます。range パラメーターには、"All"範囲または明示的な範囲 (例: "1-3,5") を指定できます。

テキストの読み上げ

string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)

PDF ファイルからテキストを読み取ります。テキスト レイアウトを維持するには、 preserveFormatting を [ true ] に設定します。IResourceを受け入れるオーバーロードも使用できます。

string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)

付属の OCR エンジンを使用して、スキャンした PDF からテキストを読み取ります。OCR サービスから OCR エンジンを取得します (例: IOcrService.GetUiPathDocumentOcr)。degreeOfParallelism 一度に処理するページ数を設定します。Windows 専用です。

string ReadXpsText(string fileName, string range = "All")

XPS ファイルからテキストを読み取ります。IResourceを受け入れるオーバーロードも使用できます。Windows 専用です。

string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)

提供された OCR エンジンを使用して XPS ファイルからテキストを読み取ります。Windows 専用です。

ページ操作とドキュメント操作

int GetPdfPageCount(string fileName, string password = null)

PDF ファイルのページ数を返します。IResourceを受け入れるオーバーロードも使用できます。

ILocalResource JoinPdf(string[] fileList, string outputFileName = null)

複数の PDF ファイルを指定の順序で 1 つの PDF に結合します。IResource[]を受け入れるオーバーロードも使用できます。

ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)

PDF から PDF から新しい PDF にページの範囲 (例: "1-3,5"など) を抽出します。IResourceを受け入れるオーバーロードも使用できます。

ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)

1 つのページ (1 から開始 pageNumber) を画像としてエクスポートします。画像形式は、 outputFileName 拡張子から推論されます。IResourceを受け入れるオーバーロードも使用できます。

作成と変換

ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)

画像ファイルのリストから PDF を作成します (1 ページに 1 つの画像)。サポートされている入力形式は、PNG、JPG、JPEG、TIF、TIFF、BMP です。IResource[]を受け入れるオーバーロードも使用できます。

ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)

HTML コンテンツを PDF に変換します。背景色とグラフィックを保持するには、[ keepBackground ] を [ true ] に設定します。

ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)

メール メッセージを PDF に変換します。

ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)

プレーン テキストを PDF に変換します。フォント サイズとテキストの配置を設定できます。

画像と添付ファイルを抽出する

IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)

PDF からすべての画像を抽出し、選択した形式で保存します。IResourceを受け入れるオーバーロードも使用できます。

IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)

PDF に埋め込まれたファイルを抽出します。filterを特定の拡張機能 (例: new[] { ".docx", ".xlsx" }) に制限するように設定します。IResourceを受け入れるオーバーロードも使用できます。

パスワードを管理する

ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)

PDF のユーザーと所有者のパスワードを設定または削除します。削除するには、新しいパスワードとして null または空の文字列を渡します。IResourceを受け入れるオーバーロードも使用できます。

オプション

ConvertToPdfOptions

変換方法の共有レイアウトとコンテンツ オプション。

  • HeaderHtml String - ページ ヘッダーとして使用される HTML スニペットです。既定値は null です (ヘッダーなし)。
  • FooterHtml String - ページ フッターとして使用される HTML スニペットです。既定値は null です (フッターなし)。
  • PaperSize PaperSize - 出力 PDF の用紙サイズです。既定値は A4です。
  • Margin Int - ページ余白 (ポイント)。既定値は 0です。
  • Scale Double - ページのレンダリング規模です ( 0.1 から 2 まで)。既定値は 1.0です。

列挙型のリファレンス

ImageExtension

ExtractImagesFromPdfが使用 します。

  • PNG - PNG 画像形式です。
  • JPEG - JPEG 画像形式です。
  • TIFF - TIFF 画像形式です。
  • BMP - BMP 画像形式です。

ImageDpi

ReadPdfWithOcrExportPdfPageAsImageで使用します。

  • Low - 96 DPI
  • Medium - 150 DPI既定。
  • High - 270 DPI。

TextAlignment

ConvertTextToPdfが使用 します。

  • Justify - 両端揃え。既定。
  • Left - 左揃え。
  • Right - 右揃え。
  • Center - 中央揃え。

PaperSize

ConvertToPdfOptionsが使用 します。

  • A4 (既定)、 A3A5A2A6 - ISO A シリーズのサイズです。
  • LetterLegalTabloidLedgerExecutiveStatement - 北米サイズ。
  • B4B5 - ISO Bシリーズサイズ。
  • Number10EnvelopeDLEnvelopeC5EnvelopeC4Envelope - エンベロープのサイズです。

アクティビティとの関係

コード化された API アクティビティと PDF XAML アクティビティは同じランタイムで実行されるため、コード化されたワークフローは、 PDF アクティビティ パッケージのアクティビティと同じ読み取り、変換、操作の動作になります。違いは呼び出しの形状です。サービスはプレーンなファイル パスまたはIResource入力を受け取り、stringint、またはILocalResource結果を直接返します。また、アクティビティの [エラー発生時に実行を継続] オプションの代わりに、通常の try/catch を使用します。

一般的なパターン

PDF のテキストを読み込む

このパターンは、PDF ファイルからページ範囲のテキストを読み取ります。ReadPdfText は、抽出されたテキストを stringとして返します。

[Workflow]
public void Execute()
{
    string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
    Log(text);
}
[Workflow]
public void Execute()
{
    string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
    Log(text);
}

PDF を結合してページ範囲を抽出する

このパターンは、2 つの PDF ファイルを 1 つに結合し、結合結果からページ範囲を抽出します。各ステップは、出力ファイルを指す ILocalResource を返します。

[Workflow]
public void Execute()
{
    var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
    var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
[Workflow]
public void Execute()
{
    var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
    var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}

HTML を余白のあるレターサイズの PDF に変換する

このパターンでは、 ConvertToPdfOptions を使用して Letter 用紙サイズとページ マージンを設定し、HTML 文字列を PDF に変換します。ConvertHtmlToPdf は、作成した PDF を指す ILocalResource を返します。

[Workflow]
public void Execute()
{
    var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
    var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
[Workflow]
public void Execute()
{
    var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
    var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}

このページは役に立ちましたか?

接続

ヘルプ リソース サポート

学習する UiPath アカデミー

質問する UiPath フォーラム

最新情報を取得