UiPath Documentation
ixp
latest
false
Guia do usuário de Documentos complexos e não estruturados
Importante :
A tradução automática foi aplicada parcialmente neste conteúdo. A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Configuração do modelo

Configurações de LLM para projetos de Extração e Processamento Inteligente (IXP), incluindo opções de pré-processamento inteligentes e opções de modelo de extração na aba Criar.

Visão geral

Você pode configurar o LLM subjacente, bem como suas definições na opção Configuração do modelo na guia Criar.

As configurações disponíveis são:

  • Model family:

    • GPT
    • Gemini
  • Model version:

    • For GPT:
      • gpt-4o
      • gpt-5.1-2025-11-13 (preview)
      • gpt-5.4-2026-03-05 (preview)
    • For Gemini:
      • 2.5 Flash
      • 2.5 Pro (preview)
      • 3.1 Pro Preview (preview)
      • 3.5 Flash Lite (preview)
    Observação:

    You can run these models on your own LLM subscriptions instead of the UiPath®-hosted models. For details, refer to Bring your own subscription (BYOS).

  • Pré-processamento inteligente:

    • Nenhum
    • Modelo de tabela - Mini
    • Modelo de tabela
    • Modelo de layout (pré-visualização)
    • Modelo de layout (linguagens estendidas) - visualização
  • Modelo de extração:

    • GPT-4o
    • Gemini
  • Opções avançadas:

    • Atribuição
    • Temperatura
    • P superior
    • Semente
    • Penalidade de frequência
    • Solicitar substituição

Ajuste essas configurações para melhorar a precisão das previsões do modelo e aprimorar seu desempenho.

Pré-processamento inteligente

As opções de pré-processamento inteligentes melhoram o desempenho da previsão quando os documentos são difíceis para os modelos interpretarem, devido à formatação complexa.

Isso inclui as seguintes opções:

  • Nenhum - Essa opção padrão é adequada para a maioria dos documentos que não têm conteúdo tabular.
  • Modelo de tabela - mini - Otimizado para conteúdo tabular e latência. Essa opção é mais adequada para documentos com tabelas simples ou várias tabelas.
  • Modelo de tabela — Otimizado para um conteúdo tabular mais complexo. Essa opção é mais adequada para documentos com tabelas aninhadas complexas, tabelas com células mescladas, pontos de marcador ou tabelas que abrangem várias páginas.
    Observação:
    • Embora isso tenha o melhor desempenho em tabelas complexas, ele aumenta a latência das previsões.
    • This feature requires the Gemini 2.5 Flash model through the AI Trust Layer.
  • Modelo de layout - Fornece uma representação textual completa do documento e seu layout para o modelo, juntamente com as imagens do documento. Essa opção pode melhorar o desempenho em documentos com layouts desafiadores e variados, incluindo tabelas, bem como em elementos de documentos complexos, como caixas de seleção, carimbos e escrita à mão.
    Observação:
    • Essa opção aumenta a latência de processamento de cada documento.
    • Essa opção não funciona com idiomas estendidos não latinos. Para documentos em idiomas estendidos não latinos, consulte a opção Modelo de layout (idiomas estendidos) .
  • Modelo de layout (linguagens estendidas) - Adiciona uma etapa de preparação extra antes da extração para ajudar o modelo a ler melhor documentos que são difíceis de interpretar devido à sua estrutura visual. Essa opção é mais adequada para formulários com caixas de seleção, manuscritos, tabelas densas e documentos que misturam diferentes tipos de conteúdo, como tabelas, listas e texto livre. Para obter mais detalhes sobre essa funcionalidade, verifique Modelo de layout para linguagens estendidas.

Exemplo de pré-processamento inteligente

A imagem a seguir contém um exemplo de um LLM de consulta de extração sem usar o modo de modelo de tabela , onde os valores da coluna this period são confundidos com os da coluna year to date .

A imagem a seguir contém um exemplo de uma extração usando o modo de modelo de Tabela , em que os valores de ambas as colunas, this period e year to date, são extraídos corretamente.

Modelos de extração

A opção Modelo de extração representa o LLM subjacente usado para a extração.

Os modelos disponíveis são:

  • GPT-4o
  • Gemini

Escolha do modelo mais adequado

Different models perform differently for different use cases, but Gemini is recommended where possible. Several other pre- and post-processing features, which help optimize performance and user experience, are also Gemini-based.

O GPT-4o tem uma restrição de 50 páginas.

Gemini 2.5 Flash can process documents in IXP up to 500 pages in a single call, with higher page counts supported in preview. The Gemini limit may vary slightly based on the density of the document.

In terms of field values, Gemini 2.5 Flash has a higher output context window, which allows it to handle more field values than GPT-4o. The strict limit without pre-processing options is around 1000 field values per document. This may vary depending on the complexity of the document.

Observação:

Os modelos que não retornam probabilidades de log sempre retornam um valor de confiança de 1,0 para todos os valores previstos. Isso afeta atualmente os seguintes modelos, que devem se comportar dessa maneira durante a visualização:

  • Visualização do Gemini 3.1 Pro
  • Gemini 3.1 Flash Lite
  • Gemini 3.5 Flash
  • gpt-5.4-2026-03-05

Suporte a idiomas

Você pode carregar documentos e criar modelos em qualquer idioma que seja bem suportado pelo modelo de extração selecionado. O conjunto de idiomas compatíveis depende do modelo que você selecionar para seu projeto.

A precisão da extração pode variar dependendo do idioma dos seus documentos. Os resultados podem ser menos consistentes para idiomas como:

  • Árabe
  • chinês
  • Hebraico
  • Coreano

Para esses idiomas, você deve validar o desempenho do modelo em uma amostra representativa de seus documentos antes de passar para a produção.

Mudança de um modelo para outro

Para alternar de um modelo para outro, use a lista suspensa da opção Modelo de extração e selecione Salvar. Isso disparará uma nova versão do projeto a ser criada e novas previsões a serem geradas automaticamente.

Importante:

Para atividades maduras, as taxonomias, especialmente as instruções, e as previsões confirmadas, especialmente para campos inferidos, normalmente são otimizadas para um tipo de modelo em vez do outro. É provável que, depois da mudança, as pontuações de desempenho possam cair, pois pode ser necessária alguma iteração nas instruções e uma nova revisão das previsões para desfazer otimizações específicas do modelo que podem estar afetando o desempenho do outro modelo.

Se você precisar mudar o modelo por motivo de desempenho, verifique primeiro se o modelo alternativo pode resolver o problema principal que o modelo atual não pode solucionar. Se puder, otimize o novo modelo para melhorar as métricas de desempenho em Measure.

Limites de processamento de Documento

Na prática, o Extração e Processamento Inteligente (IXP) pode extrair de forma confiável até aproximadamente 1.200 valores de Campo por Documento.

Isso significa que, se um documento exigir mais de 1.200 valores de campo para serem extraídos, o modelo pode atingir seu limite de tokens. Isso pode acontecer mesmo que o documento esteja bem dentro dos limites de páginas listados nesta seção. O trabalho de pesquisa e desenvolvimento está em andamento para oferecer suporte a limites de valor de campo mais altos em versões futuras.

Se os limites de tokens forem excedidos, as previsões podem estar incompletas ou vazias, independentemente do número de páginas. Por exemplo, um documento de 80 páginas com 1.400 valores de campo extraídos pode disparar um warning de limite de tokens na interface do usuário.No Runtime, quando o limite de tokens for excedido, a resposta da API mostrará isso retornando valores de confiança de ocorrência e extração de 0.

Se os limites de páginas forem excedidos, apenas as páginas dentro dos limites especificados abaixo são processadas. Ambos os comportamentos aplicam-se para o Gemini e GPT-4o.

Os limites de Runtime / runtime incluem:

  • Número de páginas por documento:
    • Para o Gemini, até 500 páginas.
    • Para GPT-4o, 50 páginas.
  • Limites de token – Documentos com muitos dados com mais de 200 extrações, como tabelas longas, provavelmente atingirão o limite de token. O Gemini tem um limite de tokens de saída mais alto por padrão, então pode retornar um número maior de valores de campo em uma única chamada.

Opções avançadas

As opções avançadas permitem que você personalize as configurações para seus modelos, selecione qual método de atribuição usar e use a substituição da solicitação.

Observação:

O uso da substituição de prompt é recomendado apenas em casos excepcionais.

Expandir a configuração para visualização de todas as opções disponíveis:

  • Atribuição - O método usado para atribuir previsões à parte ou texto relevante no documento. Selecione uma das seguintes opções:
    • Baseado em regras — usa um conjunto extenso de regras e heurística para corresponder os intervalos corretos em uma página aos valores previstos a partir do modelo. Essa é uma opção de baixa latência, mas herda o desempenho em termos de atribuições bem-sucedidas em comparação com a opção baseada em modelo.
    • Model-based - Uses an additional LLM call to successfully match the predicted values to the correct spans on the page, as these values can often be repeated in different parts of the page. This is the most performant option in terms of successful attributions, but it does add some latency to predictions. This option requires the Gemini 2.5 Flash model.
  • Temperatura – A temperatura de amostra a ser usada. Selecione um número entre 0.0 e 2.0. Valores mais altos tornam a saída mais aleatória.
  • P superior - Amostras apenas de tokens com a massa de probabilidade top_p . Selecione um número entre 0,0 e 1,0.
  • Semente – Se especificado, as solicitações repetidas com a mesma semente e parâmetros devem retornar o mesmo resultado.
  • Penalidade de frequência – Selecione um número entre -2.0 e 2.0. Valores positivos reduzem a probabilidade de o modelo repetir tokens que já apareceram no texto.
  • Substituição de prompt - Substitui o prompt padrão do sistema com um novo valor. Esta opção está desabilitada por padrão. Uma vez habilitada, o prompt de instruções Acrescentar tarefa e as opções de prompt de instruções de campo Acrescentar estarão habilitadas para configuração.
    Observação:

    A equipe da UiPath® pesquisou e otimizou os padrões para configurações de modelo, como Temperatura, P superior e Frequência. Como resultado, você não precisa ajustar esses valores a menos que saiba de quais configurações específicas precisa.

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades