UiPath Documentation
document-understanding
2020.10
false
Document Understanding ガイド
重要 :
このコンテンツの一部は機械翻訳によって処理されており、完全な翻訳を保証するものではありません。 新しいコンテンツの翻訳は、およそ 1 ~ 2 週間で公開されます。

フィールドを作成および設定する

フィールドを追加する

フィールドは削除することも名前を変更することもできません。したがって、新しいフィールドを追加する前に慎重に検討してください。ただし、後から ML モデルのトレーニングに使用しないことにしたフィールドがある場合は、[フィールドを編集] ウィンドウの [非表示] チェックボックスを使用して、そのフィールドを常に非表示にすることができます。

Click here for details about fields, their meaning, and when to use them.

注:

作成できるフィールドは、最大 40 件です。

列フィールド

請求書ドキュメントの明細項目である説明または単価は、列フィールドの例となります。

  1. Click + in the table section at the top of the page to add a new Column field. The Create Column Field window is displayed.
  2. [一意のフィールド名を入力] フィールドに、フィールドの一意の名前を入力します。このフィールドでは大文字は使用できません。
  3. [作成] をクリックします。[フィールドを編集] ウィンドウが表示されます。
  4. [コンテンツの種類] ドロップダウン リストからコンテンツの種類を選択します。
  5. [スコアリング] ドロップダウン リストから、モデル予測の評価を実行する際の精度の決定に使用する尺度を選択します。
  6. [ホットキー] フィールドをクリックし、お使いのキーボードのキーを押すと、キーが自動的に設定されます。
  7. Fill in the hex code of the desired field color in the Color field.
  8. 確認対象のフィールドが、住所や説明のように、複数のテキスト行にまたがる可能性がある場合は、[複数行] チェック ボックスをオンにします。このオプションをオンにしない場合は、最初の行だけが返されます。
  9. Select the Split items checkbox if you want this field to be used as a delimiter between line items or rows in a table. Any line on which this field appears is considered to be a new line item or row in the table. Most commonly, this is used on Line Amount fields on Invoice line items.
  10. エクスポートされるデータセットにこのフィールドを含めたくない場合は、[非表示] チェックボックスをオンにします。
  11. [保存] をクリックして、設定を保存します。

標準フィールド

これらは、特定のドキュメントに 1 回だけ表示されるフィールドです。列フィールドの例としては、請求書ドキュメントの明細項目である請求書番号または合計金額があります。

  1. Click + on the right pane in the Regular Fields section. The Create Regular Field window is displayed.
  2. [一意のフィールド名を入力] フィールドに、フィールドの一意の名前を入力します。このフィールドでは大文字は使用できません。
  3. [作成] をクリックします。[フィールドを編集] ウィンドウが表示されます。
  4. [コンテンツの種類] ドロップダウン リストからコンテンツの種類を選択します。
  5. 指定したページ上の単一のフィールドで、モデルが複数のインスタンスを予測する場合は、[後処理] ドロップダウン リストから後処理のメカニズムを選択します。
  6. [ホットキー] フィールドをクリックし、お使いのキーボードのキーを押すと、キーが自動的に設定されます。
  7. [色] フィールドに、目的のフィールドの色の 16 進コードを入力します。
  8. [複数ページ] ドロップダウン リストから、データの取得方法を選択します。このオプションは、複数のページを持つドキュメントのいくつかの異なるページにフィールドが表示される場合に使用します。このオプションでは、モデルが返す結果の決定方法を定義します。
  9. [スコアリング] ドロップダウン リストから、モデル予測の評価を実行する際の精度の決定に使用する尺度を選択します。
  10. 確認対象のフィールドが、住所や説明のように、複数のテキスト行にまたがる可能性がある場合は、[複数行] チェック ボックスをオンにします。このオプションをオンにしない場合は、最初の行だけが返されます。
  11. エクスポートされるデータセットにこのフィールドを含めたくない場合は、[非表示] チェックボックスをオンにします。
  12. [保存] をクリックして、設定を保存します。

分類フィールド

ドキュメント全体を参照するデータ ポイントです。たとえば、領収書の経費の種類 (飲食、宿泊、飛行機、輸送) または請求書の通貨 (米ドル、ユーロ、日本円) が分類フィールドの例となります。

  1. Click + on the right pane in the Classification Fields section. The Create Classification Field window is displayed.

  2. [一意のフィールド名を入力] フィールドに、フィールドの一意の名前を入力します。このフィールドでは大文字は使用できません。

  3. [作成] をクリックします。[フィールドを編集] ウィンドウが表示されます。

  4. テキスト領域にクラスのリストを入力し、名前をコンマ区切りのリストとして入力します。

  5. [保存] をクリックして、設定を保存します。

    重要:

    標準フィールドおよび列フィールドと異なり、分類フィールドは再トレーニングされません。たとえば、通貨フィールドの場合、米ドルとインド ルピーの請求書だけを含むデータセットで請求書モデルを再トレーニングすると、結果として生成されるモデルだけがこの 2 つの通貨を認識できるようになります。

フィールドの説明

管理バー

Data Manager のページの上部に表示されます。複数の操作を実行できます (ドキュメント間の移動、ドキュメントの削除、ドキュメントのフィルター処理、AI モデルの予測の実行、ドキュメントのインポートとエクスポート)。

フィールド 説明

アクティブなフィルターに一致するドキュメント間を移動します。

2 つの矢印の間にカウンターが表示されます。

アクティブなフィルターに一致するドキュメントの総数のうち、現在のドキュメントの数を示します。

削除/回復

ドキュメントを削除または回復します。

フィルター ドロップダウン

ドキュメントをフィルター処理します。このフィルターは、エクスポートされたデータにも適用されます。次のオプションを使用できます。

  • トレーニングと検証セット

    -test-set

    -deleted

    -labeled

    -unlabeled

    -<batch_name>

予測

AI モデルの予測を実行し、結果を表示します。

インポート

ラベル付けする新しいドキュメントをインポートします。

エクスポート

ラベル付けされたデータをエクスポートします。

エクスポートされたデータには、アクティブなフィルターが適用されます。

[ドキュメント名]

現在アクティブなドキュメントの名前です。

[ユーザー名]

現在アクティブなユーザーのユーザー名です。

ログアウト

Data Manager からログアウトします。

ログアウトすると、Cookie もクリアされます。

ヘルプ

Displays the Data Manager help menu.

フィールドを作成ウィンドウ

追加するフィールドの名前を設定できます。

フィールド説明
一意のフィールド名を入力フィールドの名前です。小文字、数字、アンダースコア (_)、およびダッシュ (-) のみを含めることができます。

フィールドを編集ウィンドウ

標準フィールドと列フィールドを設定できます。

フィールド 説明

コンテンツの種類

フィールドのコンテンツの種類です。次のオプションを使用できます。

  • string – appropriate for company names or addresses, as well as payment terms, or for any other field where the RPA developer prefers to build the parsing or formatting logic manually, in the RPA workflow.
  • 数値 – 金額または数量に適しており、小数点/桁区切り文字をインテリジェントに解析します。
  • 日付 – モデルによって、出力が yyyy-mm-dd 形式で解析、フォーマット、統合されます。
  • phone - 電話番号に適しています。
  • id-no – appropriate for alphanumeric codes, numbers of IDs, it is similar to the string content type, but includes cleaning of any characters coming before a “:”. If the id number you need to extract might contain “:” characters, please use string as content type instead, to avoid data loss.

後処理

標準フィールドにのみ表示されます。

後処理のメカニズムです。次のオプションを使用できます。

  • first span – モデルは、指定したページでフィールドが複数箇所に出現すると予測した場合、最初の箇所を返します。
  • largest value – if model predicts more than one instance of a field on a given page, the model returns the largest numeric value. This is only displayed for content of type number and is appropriate for Total Amount fields.
  • longest value – モデルは、指定したページでフィールドが複数箇所に出現すると予測した場合、最も長い文字列から成る値を返します。

ホットキー

フィールドのショートカット キーです。

フィールドの色です。

複数ページ

ドキュメント内の複数のページにフィールドが表示される場合にデータを返す方法です。次のオプションを使用できます。

  • highest confidence - the default choice for string,phone, and number content types.
  • first occurrence - the default choice for id-no and data content types.
  • 最後の発生時刻

    - longest string - only displayed for content of type string.

    - shortest string - only displayed for content of type string.

    - highest numeric value - only displayed for content of type number.

    - lowest numeric value - only displayed for content of type number.

スコアリング

コンテンツの種類が string の場合にのみ設定できます。他のすべてのコンテンツの種類では、完全一致のスコアリング方法が使用されます。

モデル予測の評価を実行するときの精度を決定するために使用する尺度です。

  • exact match – a prediction is only deemed to be correct (score of 1) if it exactly matches the true value. If it differs by even a single character, then it is deemed to be incorrect (score of 0).
  • levenshtein – a prediction is deemed to be partially correct according to the Levenshtein distance between the prediction and the true value. If a 10-letter value is predicted correctly except for the last 2 characters, then the score of that prediction will be 0.8.

複数行

複数行にまたがる可能性があるフィールド (住所や説明など) の場合に、このチェックボックスをオンにします。オンにしない場合は、最初の行だけが返されます。

項目を分割

列フィールドにのみ表示されます。

このフィールドを明細項目や表の行の区切り文字として使用する場合は、このチェックボックスをオンにします。行にこのフィールドが表示されている場合は、新しい明細項目または表の行とみなされます。通常は、請求書の明細項目の「明細金額」フィールドで使用されます。

非表示

エクスポートされるデータセットにこのフィールドが含まれないようにしたい場合は、このチェックボックスをオンにします。

Data Manager のヘルプ メニュー

[ラベル付けのコントロール] セクションには、データを処理するときに使用されるコントロールが表示されます。

[ドキュメントのショートカット] セクションには、ナビゲーションや UI のスケーリングなどのさまざまな操作の実行に使用されるショートカットが表示されます。

[構成] セクションには、インストール時に実行されたインスタンス構成に関する詳細が表示されます。

[エラー報告] セクションで、最近生成されたログを表示できます。

このページは役に立ちましたか?

接続

ヘルプ リソース サポート

学習する UiPath アカデミー

質問する UiPath フォーラム

最新情報を取得