ixp
latest
false
非结构化复杂文档用户指南
重要 :
新发布内容的本地化可能需要 1-2 周的时间才能完成。
将扩展语言的布局模型配置为 IXP 中的智能预处理步骤,以提高使用受支持的非拉丁语脚本编写的文档的提取准确性。
备注:
此功能在日本地区提供预览版。
概述
扩展语言的布局模型是 IXP 中一个智能预处理选项,可提高提取准确性。这是可选的规范化步骤,与主提取模型一起使用,有助于在 LLM Processes 文档之前改善文档的表示方式,尤其是对于信息在页面上的位置至关重要的文档,例如表格、表单、多列布局或基于复选框的文档。
在提取模型 Processes 内容之前,布局模型(扩展语言)会分析文档的视觉结构,包括 Text 和其他元素在页面上的排列方式。它专为提高使用扩展字符集和复杂布局的文件的准确性而设计,因为其他预处理选项可能会无法准确捕获文档结构。
收益
布局模型(扩展语言)功能具有以下优势:
- 以结构为重点的预处理 – 改善在提取过程中对文档布局的解读,无需更改提示词或切换模型。 当准确性更多地取决于文档结构而非内容含义时,这种方法会特别有效。
- 更准确的行/列映射 – 在结构 关键 的情况下,保留关系。
- 增强型复选框提取 – 更可靠地检测和映射复选框字段。
- 无缝工作流集成 – 在现有 智能提取处理 (IXP) 流程中运行,用于测试、验证、评分和版本比较。
使用布局模型
要使用布局模型,请按以下步骤操作:
- 导航到构建选项卡。
- 选择”模型配置“。
- 在“智能预处理”下,选择“布局模型(扩展语言)”。
何时使用布局模型
当“无”、“表格模型 - 小型版”或表格模型预处理选项的提取准确度低于预期时,请使用此功能。
此功能在以下场景中特别有效:
- 密集的财务报表和报告 — 经纪对账单、贷款申请、服务报告以及其他需要保持多行、章节和嵌套表格一致的文件。
- 复选框密集型表单 — 保险、医疗保健、入职和受监管表单,其中包含许多相邻或重复的复选框,其主要失败模式在于正确的复选框与字段映射。
- 操作行项目文档 — 包装清单、插入订单、服务订单、清单以及类似文档,在这些文档中,正确的行识别比广泛的语义理解更为重要。
- 低性能文档集 — 使用标准提取时表现较差的文档系列,特别是当错误是由行/列或复选框不匹配导致,而非因指令问题导致时。
布局模型(扩展语言)预处理示例
下图包含在不使用布局模型(扩展语言)的情况下查询 LLM 的提取示例。 “单次结清”和“无现金再融资”被错误地提取为由申请人选择。
下图包含使用“布局模型(扩展语言)”提取的示例,其中两个字段中的值均正确提取。 未应用任何指令更改。