- Vue d'ensemble (Overview)
- Document Processing Contracts
- Notes de publication
- À propos des contrats de traitement de documents
- Classe Zone
- Interface ActivitéIPersisted
- Classe PrettyBoxConverter
- Interface ActivitéIClassifier
- Interface FournisseurIClassifieurCapacités
- Classe TypeDocumentClassifieur
- Classe RésultatClassifieur
- Classe ActivitéCodeClassifieur
- Classe ActivitéClassifieurNatif
- Classe ActivitéClassifieurCodeAsync
- Classe CapacitéClassifieurTypeDocument
- ContentValidationData Class
- EvaluatedBusinessRulesForFieldValue Class
- EvaluatedBusinessRuleDetails Class
- Classe ActivitéExtracteurCodeAsync
- Classe ActivitéExtracteurCode
- Classe ExtracteurTypeDocument
- Classe ExtracteurDocumentTypeCapacités
- Classe ExtracteurChampCapacités
- Classe ActivitéExtracteurNatif
- Classe ExtracteurRésultat
- FieldValue Class
- FieldValueResult Class
- Interface FournisseurICapabilities
- Interface ActivitéIExtractor
- Classe ChargeUtileExtracteur
- Énumération PrioritéActionDocument
- Classe DocumentActionData
- Énumération StatutActionDocument
- Énumération TypeActionDocument
- Classe DocumentClassificationActionData
- Classe DocumentValidationActionData
- Classe DonnéesUtilisateur
- Classe Documents
- Classe RésultatDivisionDocument
- Classe ExtensionDom
- Classe Page
- Classe SectionPage
- Classe Polygone
- Classe ConvertisseurPolygones
- Classe de métadonnées
- Classe GroupeMot
- Classe Mot
- Énumération SourceTraitement
- Classe CelluleRésultatsTable
- Classe ValeurTableRésultats
- Classe InformationsColonnesTableRésultats
- Classe TableRésultats
- Énumération Rotation
- Rule Class
- RuleResult Class
- RuleSet Class
- RuleSetResult Class
- Énumération TypeSection
- Énumération TypeGroupeMot
- ProjectionTexteIDocument Interface
- Classe RésultatClassification
- Classe RésultatExtraction
- Classe ResultatsDocument
- Classe ResultatsLimitesDocument
- Classe ResultatsDonnéesPoint
- Classe RésultatsValeur
- Classe ResultatsContenuRéference
- Classe ResultatsValeurJetons
- Classe ResultatsChampDérivé
- Énumération ResultatsSourceDonnées
- Classe ResultatsConstantes
- Classe ChampValeurSimple
- Classe ValeurChampTable
- Classe GroupeDocument
- Classe DocumentTaxonomie
- Classe TypeDocument
- Classe Champ
- Énumération TypeChamp
- FieldValueDetails Class
- Classe InfoLangage
- Classe SaisieMétadonnées
- Énumération TypeTexte
- Classe TypeFieldTypeField Class
- Interface ActivitéISuivi
- ITrainableActivity Interface
- Interface ActivitéClassifieurITrainable
- Interface ActivitéExtracteurITrainable
- Classe ActivitéFormationClassifieurCodeAsync
- Classe ActivitéFormationClassifieurCode
- Classe ActivitéFormationClassifieurNatif
- Classe ActivitéFormationExtracteurCodeAsync
- Classe ActivitéFormationExtracteurCode
- Classe ActivitéFormationExtracteurNative
- Classe PointsDonnéesBases
- Classe ValeurBasique
- Classe FauneCollectionComposants
- Classe BaseFacturePointDonnées
- Classe GestionnaireRésultatsExtraction
- Classe PointDonnéesGroupeChamps
- Classe ValeurGroupeChamps
- Classe BaseLookup
- Classe ParamètresCaviardageChamp
- Classe OptionsCaviardage (Aperçu)
- Énumération TypeCaviardage
- Classe BaseFacultatifRésultats
- Classe PointDonnéesTable
- Classe LigneTable
- Classe ValeurTable
- Classe PointDonnéesCaractèreGénérique
- Classe CollectionPointDonnéesCaractèreGénérique
- Document Understanding ML
- Serveur local OCR Document Understanding
- Document Understanding
- Notes de publication
- À propos du package d’activités Document Understanding
- Compatibilité du projet
- Configuration de la connexion externe
- API d'automatisation codée Document Understanding (aperçu)
- Définir le mot de passe du PDF
- Merge PDFs
- Get PDF Page Count
- Extraire le texte PDF (Extract PDF Text)
- Extract PDF Images
- Extract PDF Page Range
- Extraire les données du document
- Create Validation Task and Wait
- Attendre la tâche de validation et reprendre
- Create Validation Task
- Créer une action de validation de document (Create Document Validation Action)
- Retrieve Document Validation Artifacts
- Classer un document (Classify Document)
- Créer une tâche de validation de classification (Create Classification Validation Task)
- Créer une tâche de validation de classification et attendre (Create Classification Validation Task and Wait)
- Attendre la tâche de validation de la classification et reprendre
- IntelligentOCR
- Notes de publication
- À propos du package d'activités IntelligentOCR
- Compatibilité du projet
- Load Taxonomy
- Digitize Document
- Classify Document Scope
- Keyword Based Classifier
- Classifieur de projet Document Understanding (Document Understanding Project Classifier)
- Intelligent Keyword Classifier
- Create Document Classification Action
- Créer une action de validation de document (Create Document Validation Action)
- Retrieve Document Validation Artifacts
- Attendre l'action de classification du document et reprendre
- Tester l'étendue des classifieurs
- Outil d'entraînement de classifieur basé sur des mots-clés
- Intelligent Keyword Classifier Trainer
- Data Extraction Scope
- Extracteur de projet Document Understanding (Document Understanding Project Extractor)
- Entraîneur d’extracteur de projet Document Understanding
- Regex Based Extractor
- Form Extractor
- Extracteur de formulaires intelligents
- Caviarder le document
- Create Document Validation Action
- Wait For Document Validation Action And Resume
- Tester l'étendue des extracteurs
- Export Extraction Results
- Extracteur d'apprentissage automatique
- Machine Learning Extractor Trainer
- Machine Learning Classifier
- Machine Learning Classifier Trainer
- Classifieur génératif
- Extracteur génératif
- Configuration de l'authentification
- Valider des documents avec des actions App
- Valider manuellement des documents numérisés
- Extraction de données basée sur des ancres à l'aide de l'Extracteur de formulaires intelligent
- Station de validation
- Activités génératives - Bonnes pratiques
- Extracteur génératif - Bonnes pratiques
- Classifieur génératif - Bonnes pratiques
- Services ML
- OCR
- Contrats OCR
- Notes de publication
- À propos des contrats OCR
- Compatibilité du projet
- Interface ActivitéIOCR
- Classe OCRCodeAsync
- Classe ActivitéCodeOCR
- Classe ActivitéOCRNatif
- Classe Caractère
- Classe RésultatOCR
- Classe Mot
- Énumération StylesPolice
- Énumération RotationOCR
- Classe OCRCapabilities
- Classe BaseCaptureOCR
- Classe UsineCaptureOCR
- Classe BaseContrôleCapture
- Énumération UtilisationCaptureMoteur
- ScrapeEngineBase
- Classe ScrapeEngineFactory
- Classe ScrapeEngineProvider
- OmniPage
- PDF
- Notes de publication
- À propos du package d'activités PDF
- Compatibilité du projet
- API d'automatisation codée PDF (aperçu)
- Convertir un e-mail en PDF (aperçu)
- Convertir HTML en PDF (aperçu)
- Convertir un contenu textuel en PDF (aperçu)
- Export PDF Page As Image
- Extraire les pièces jointes d’un fichier PDF
- Extract Images From PDF
- Extract PDF Page Range
- Get PDF Page Count
- Join PDF Files
- Manage PDF Password
- Lire le texte PDF (Read PDF Text)
- Lire le PDF avec OCR (Read PDF With OCR)
- Lire le texte XPS (Read XPS Text)
- Lire le XPS avec OCR (Read XPS With OCR)
- [Non listé] Abbyy
- Notes de publication
- À propos du package d'activités Abbyy
- Compatibilité du projet
- Reconnaissance optique des caractères ABBYY (ABBYY OCR)
- Reconnaissance optique des caractères ABBYY Cloud (ABBYY Cloud OCR)
- FlexiCapture Classifier
- FlexiCapture Extractor
- FlexiCapture Scope
- Classer un document (Classify Document)
- Traiter le document (Process Document)
- Valider le document (Validate Document)
- Exporter le document (Export Document)
- Obtenir le champ (Get Field)
- Obtenir la table (Get Table)
- Prepare Validation Station Data
- [Non listé] Abbyy intégré
API d'automatisation codée pour le package d'activités PDF, couvrant la lecture, la fusion, la conversion et la manipulation de fichiers PDF et XPS.
UiPath.PDF.Activities
API de workflow codé pour la lecture, la fusion, la conversion et la manipulation de fichiers PDF et XPS. Ces API sont disponibles lors de la conception d'automatisations codées. Pour obtenir une introduction aux automatisations codées et à leur conception à l'aide d'API, consultez la section Automatisations codées.
- Accéder au service:
pdf(typeIPdfService) - Package requis:
"UiPath.PDF.Activities": "*"dans les dépendancesproject.json.
Espaces de noms importés automatiquement
Les espaces de noms suivants sont automatiquement disponibles dans les workflows codés lorsque le package PDF est installé:
UiPath.PDF.Activities.ApiUiPath.PDFUiPath.PDF.Activities.PDF.EnumsUiPath.Platform.ResourceHandlingSystem.Net.Mail
Vue d’ensemble du service
Le service pdf expose chaque opération sous forme d'appel de méthode direct. Il n’y a aucune connexion ni étendue à ouvrir. La plupart des opérations fournissent deux formulaires: l'un qui prend un chemin de fichier comme string, et l'autre qui prend un IResource (par exemple, la sortie de l'activité Chemin d'accès existe ou Obtenir le fichier/dossier local ). Appelez directement des méthodes sur l’accesseur du service:
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
string text = pdf.ReadPdfText(@"C:\docs\report.pdf");
Les méthodes qui créent ou transforment un fichier renvoient un pointeur ILocalResource à la sortie. Lorsque la valeur outputFileName est null, le service génère automatiquement un nom. Les fichiers protégés par un mot de passe sont ouverts en transmettant le paramètre password. Le range paramètre accepte "All" ou des plages explicites telles que "1-3,5".
Lecture du texte
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)
Lit le texte d'un fichier PDF. Définissez preserveFormatting sur true pour conserver la mise en page du texte. Une surcharge acceptant une IResource est également disponible.
string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Lit le texte d’un fichier PDF numérisé à l’aide du moteur OCR fourni. Obtenez un moteur OCR auprès du service OCR (par exemple, IOcrService.GetUiPathDocumentOcr). degreeOfParallelism définit le nombre de pages à traiter à la fois. Windows uniquement.
string ReadXpsText(string fileName, string range = "All")
Lit le texte d'un fichier XPS. Une surcharge acceptant une IResource est également disponible. Windows uniquement.
string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)
Lit le texte d’un fichier XPS à l’aide du moteur OCR fourni. Windows uniquement.
Opérations de page et de document
int GetPdfPageCount(string fileName, string password = null)
Renvoie le nombre de pages dans un fichier PDF. Une surcharge acceptant une IResource est également disponible.
ILocalResource JoinPdf(string[] fileList, string outputFileName = null)
Fusionne plusieurs fichiers PDF en un seul PDF, dans l’ordre indiqué. Une surcharge acceptant une IResource[] est également disponible.
ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)
Extrait une plage de pages (par exemple, "1-3,5") d'un fichier PDF dans un nouveau PDF. Une surcharge acceptant une IResource est également disponible.
ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)
Exporte une seule page (pageNumber basé sur 1) en tant qu'image. Le format d'image est déduit de l'extension outputFileName. Une surcharge acceptant une IResource est également disponible.
Création et conversion
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)
Crée un PDF à partir d’une liste de fichiers image, une image par page. Formats d’entrée pris en charge: PNG, JPG, JPEG, TIF, TIFF, BMP. Une surcharge acceptant une IResource[] est également disponible.
ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Convertit du contenu HTML en PDF. Définissez keepBackground sur true pour conserver les couleurs et les graphiques d’arrière-plan.
ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)
Convertit un message électronique en PDF.
ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)
Convertit du texte brut en PDF, avec une taille de police et un alignement du texte configurables.
Extraction des images et des pièces jointes
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)
Extrait toutes les images d’un PDF et les enregistre dans le format choisi. Une surcharge acceptant une IResource est également disponible.
IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)
Extrait les fichiers intégrés dans un PDF. Définissez filter pour vous limiter à des extensions spécifiques (par exemple, new[] { ".docx", ".xlsx" }). Une surcharge acceptant une IResource est également disponible.
Gestion des mots de passe
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)
Définit ou supprime les mots de passe utilisateur et propriétaire d’un fichier PDF. Saisissez null ou une chaîne vide comme nouveau mot de passe pour le supprimer. Une surcharge acceptant une IResource est également disponible.
Options
ConvertToPdfOptions
Options de mise en page et de contenu partagées pour les méthodes de conversion.
HeaderHtmlString- Extrait HTML utilisé comme en-tête de la page. La valeur par défaut estnull(aucun en-tête).FooterHtmlString- Extrait HTML utilisé comme pied de page. La valeur par défaut estnull(pas de pied de page).PaperSizePaperSize- Format de papier pour le PDF de sortie. La valeur par défaut estA4.MarginInt- Marge de la page en points. La valeur par défaut est0.ScaleDouble- Échelle du rendu de la page, comprise entre0.1et2inclus. La valeur par défaut est1.0.
Enum référence
ImageExtension
Utilisé par ExtractImagesFromPdf.
PNG- Format d'image PNG.JPEG- Format d'image JPEG.TIFF- format d'image TIFF.BMP- Format d'image BMP.
ImageDpi
Utilisé par ReadPdfWithOcr et ExportPdfPageAsImage.
Low- 96 PPP.Medium- 150 PPP. Par défaut.High- 270 PPP.
TextAlignment
Utilisé par ConvertTextToPdf.
Justify- Alignement Justifié. Par défaut.Left- Alignement de gauche.Right- Alignement de droite.Center- Alignement au centre.
PaperSize
Utilisé par ConvertToPdfOptions.
A4(par défaut),A3,A5,A2,A6- tailles ISO de la série A.Letter,Legal,Tabloid,Ledger,Executive,Statement- tailles pour l'Amérique du Nord.B4,B5- tailles ISO de la série B.Number10Envelope,DLEnvelope,C5Envelope,C4Envelope- Tailles de l'enveloppe.
Relation avec les activités
L’API codée et les activités PDF XAML s’exécutent sur le même runtime, de sorte qu’un workflow codé atteint le même comportement de lecture, de conversion et de manipulation que les activités du package d’activités PDF. La différence est au niveau de la forme de l'appel: le service prend des chemins de fichiers simples ou des entrées IResource et renvoie directement les résultats string, int ou ILocalResource , et vous utilisez le mode try/catch au lieu de l'activité Option ContinuerSurErreur .
Modèles communs
Lire le texte d’un PDF
Ce modèle va lire le texte d’une plage de pages à partir d’un fichier PDF. ReadPdfText renvoie le texte extrait sous forme de string.
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
[Workflow]
public void Execute()
{
string text = pdf.ReadPdfText(@"C:\docs\report.pdf", range: "1-3");
Log(text);
}
Fusionner des fichiers PDF et extraire une plage de pages
Ce modèle fusionne deux fichiers PDF en un seul, puis extrait une plage de pages du résultat de la fusion. Chaque étape renvoie un ILocalResource pointant vers le fichier de sortie.
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
[Workflow]
public void Execute()
{
var merged = pdf.JoinPdf(new[] { @"C:\docs\a.pdf", @"C:\docs\b.pdf" }, @"C:\docs\merged.pdf");
var firstTwoPages = pdf.ExtractPdfPageRange(merged.LocalPath, "1-2", outputFileName: @"C:\docs\excerpt.pdf");
}
Convertir le contenu HTML en PDF de taille lettre avec une marge
Ce modèle convertit une chaîne HTML en PDF, en utilisant ConvertToPdfOptions pour définir le format Lettre et la marge de la page. ConvertHtmlToPdf renvoie un ILocalResource pointant vers le PDF créé.
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
[Workflow]
public void Execute()
{
var options = new ConvertToPdfOptions { PaperSize = PaperSize.Letter, Margin = 20 };
var pdfFile = pdf.ConvertHtmlToPdf("<h1>Report</h1><p>Generated by a coded workflow.</p>", @"C:\docs\report.pdf", options: options);
}
- Espaces de noms importés automatiquement
- Vue d’ensemble du service
- Lecture du texte
string ReadPdfText(string fileName, string password = null, string range = "All", bool preserveFormatting = false)string ReadPdfWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null, ImageDpi imageDpi = ImageDpi.Medium)string ReadXpsText(string fileName, string range = "All")string ReadXpsWithOcr(string fileName, IOCRActivity ocrEngine, string range = "All", int degreeOfParallelism = 1, string password = null)- Opérations de page et de document
int GetPdfPageCount(string fileName, string password = null)ILocalResource JoinPdf(string[] fileList, string outputFileName = null)ILocalResource ExtractPdfPageRange(string fileName, string range, string password = null, string outputFileName = null)ILocalResource ExportPdfPageAsImage(string fileName, int pageNumber, string outputFileName, string password = null, ImageDpi imageDpi = ImageDpi.Medium)- Création et conversion
ILocalResource CreatePdfFromImages(string[] fileList, string outputFileName = null)ILocalResource ConvertHtmlToPdf(string html, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertEmailToPdf(MailMessage email, string outputFileName = null, bool keepBackground = true, ConvertToPdfOptions options = null)ILocalResource ConvertTextToPdf(string text, string outputFileName = null, int fontSize = 12, TextAlignment textAlignment = TextAlignment.Justify, ConvertToPdfOptions options = null)- Extraction des images et des pièces jointes
IEnumerable<ILocalResource> ExtractImagesFromPdf(string fileName, string password = null, ImageExtension imageExtension = ImageExtension.PNG, string outputFolderName = null)IEnumerable<ILocalResource> ExtractAttachmentsFromPdf(string fileName, string password = null, string[] filter = null, string outputFolderName = null)- Gestion des mots de passe
ILocalResource ManagePdfPassword(string fileName, string oldUserPassword, string newUserPassword, string oldOwnerPassword, string newOwnerPassword, string outputFileName = null)- Options
ConvertToPdfOptions- Enum référence
ImageExtensionImageDpiTextAlignmentPaperSize- Relation avec les activités
- Modèles communs
- Lire le texte d’un PDF
- Fusionner des fichiers PDF et extraire une plage de pages
- Convertir le contenu HTML en PDF de taille lettre avec une marge