Normalização e Validação de Dados

Mesmo formato, dados limpos para cada documento

De esquemas de caixa de entrada ao pós-processamento, cada valor extraído chega limpo, validado e pronto para os sistemas posteriores.

O que está incluído

Esquemas por caixa de entrada

Um esquema consistente é o que torna integrações e automações realmente confiáveis. Defina seus campos uma vez e todo documento que a caixa de entrada processar seguirá o mesmo formato.

  • Campos padrão para valores únicos e campos de tabela para dados repetidos
  • Instruções em linguagem simples orientam a IA sobre o que capturar em cada campo
  • Ajuste os campos a qualquer momento pela interface ou via API

Formatação por campo

Formatos integrados normalizam datas, números, endereços e muito mais. O formato correto é inferido pelo contexto do documento, com o padrão da caixa de entrada como alternativa.

  • Datas lidas em qualquer ordem, separador ou nome de mês, em vários idiomas
  • Números com qualquer separador decimal ou de milhares por região
  • Endereços geolocalizados e divididos em partes estruturadas

Validação de dados

A validação automatizada de dados verifica cada resultado extraído contra o esquema da caixa de entrada. As falhas são exibidas na interface, disparam uma notificação por e-mail e acionam um webhook, para que tanto as equipes de operações quanto as ferramentas sejam informadas.

  • A verificação de esquema confirma se o resultado da IA corresponde ao formato do campo
  • A verificação de campos obrigatórios sinaliza valores ausentes na origem
  • A verificação de campos de escolha barra valores fora da lista permitida

Regras de pós-processamento

Quando a formatação padrão e a validação não bastam, adicione um pequeno script Python. As regras são executadas após a extração para reformatar valores ou executar validações personalizadas de acordo com a lógica do seu negócio.

  • Combine, divida ou calcule novos campos a partir dos valores extraídos
  • Aplique lógica de negócios, buscas ou transformações condicionais
  • Disponível no plano Pro e superiores

Como funciona a Normalização de Dados

O que acabou de acontecer

Extração e Leitura de Documentos com IA

IA de Visão, IA de Texto, modelos ou OCR extraíram campos estruturados de cada documento.

Saiba mais
1

Mapear para o esquema

Os valores extraídos são mapeados para o conjunto fixo de campos definidos para a caixa de entrada. Todo documento, não importa o layout de origem, termina com a mesma estrutura de colunas na saída.

Campos da caixa
Texto Fornecedor Acme Ltda
Texto Fatura n.º INV-0142
Data Emitido em 2026-05-07
Número Total 2840
Tabela Itens 3 colunas, 2 linhas
Item Qtd Preço Consultoria 12 R$ 1.000 Equipamento 2 R$ 1.100
2

Formatar

Cada campo passa pela sua formatação configurada. Datas e números são normalizados entre variações regionais usando o contexto do documento, nomes são divididos em primeiro/meio/último, e endereços são analisados em partes estruturadas.

Data May 7, 2026 2026-05-07
Número R$ 1.234,56 1234.56
Endereço Av Paulista 1578, Sao Paulo
Av. Paulista 1578 São Paulo SP 01310-200 Brasil
3

Validar

Cada resultado passa pelas verificações de validação antes de prosseguir. Os documentos aprovados continuam para o pós-processamento, o restante é sinalizado para que nada saia do Parseur sem ser notado.

Validação
Fornecedor Acme Ltda
Emitido em 2026-04-15
Total Obrigatório faltando
Status recusado
Permitidos: aberto pago fechado
4

Pós-processar

Regras opcionais em Python são executadas por último, aplicando lógicas de negócios que a formatação em nível de campo não consegue expressar. Combine campos, busque dados de referência ou molde a saída para corresponder a um contrato exato do sistema posterior.

post_process.py
def post_process(data):
if data["Total"] > 1000:
data["Envio"] = "expresso"
else:
data["Envio"] = "padrão"
return data
Número Total 2840
Texto Envio expresso

O que acontece depois

Exportações e Integrações em Tempo Real

Dados normalizados são entregues em seu CRM, sistema contábil ou banco de dados em tempo real.

Saiba mais
Comece agora

Dados limpos, prontos para seus sistemas.

Defina os campos necessários, escolha os formatos adequados e veja cada extração chegar no formato correto.

Plano gratuito incluso, sem precisar de cartão de crédito
Processe seu primeiro documento em menos de 2 minutos
Cancele quando quiser, sem compromisso

Perguntas Frequentes

Dúvidas comuns sobre normalização e validação de dados no Parseur, desde formatos de datas e números até regras de validação e pós-processamento em Python.

A normalização de dados é a etapa que transforma valores extraídos crus em dados limpos e com formato consistente. Datas de documentos diferentes chegam no mesmo formato, números são lidos corretamente através de convenções regionais, endereços são divididos em partes estruturadas e cada campo é mapeado para um esquema fixo, para que os sistemas posteriores sempre recebam a mesma estrutura.

Sem a normalização, cada documento gera uma saída ligeiramente diferente: datas em ordens diferentes, números com separadores diferentes, nomes e endereços misturados em uma única string. As ferramentas posteriores acabam rejeitando linhas ou armazenando dados inconsistentes. A normalização corrige isso na origem para que as integrações permaneçam realmente confiáveis.

O campo Número aceita qualquer separador decimal e de milhares em formatos regionais, incluindo as convenções europeia 1.234,56 e americana 1,234.56, agrupamentos indianos como 1,00,00,000, e notação contábil onde parênteses indicam negativos como ($123,456,789.12). O formato correto é inferido pelo contexto do documento, com o padrão da caixa de entrada como alternativa.

O Parseur suporta os formatos de campo Texto, Data, Hora, Data e hora, Número, Nome completo, Endereço e Escolha. Cada formato possui suas próprias regras de análise e validação. Campos padrão capturam valores únicos, enquanto campos de tabela capturam dados repetidos linha por linha.

O status do documento é definido como Processamento com Falha (Process Failed) em vez de ser exportado silenciosamente, e uma notificação por e-mail é enviada. Se um webhook de falha no processamento estiver configurado, ele também será disparado. Você pode revisar e corrigir o documento manualmente, ou conectar as falhas ao seu próprio sistema de monitoramento.

Cada caixa de entrada possui seu próprio esquema e todos os documentos processados por ela são mapeados para o mesmo conjunto fixo de campos. Assim, uma única caixa de entrada pode receber faturas de muitos fornecedores diferentes, com muitos layouts variados, e ainda gerar a mesma estrutura de colunas para cada linha.

Defina uma vez os campos que seu sistema posterior espera em um esquema de caixa de entrada do Parseur, e cada documento será mapeado para esse formato. Os formatos de campo padronizam datas, números, nomes e endereços através de variações regionais, a validação automatizada de dados captura valores ausentes ou inválidos antes da exportação, e o pós-processamento opcional em Python lida com qualquer lógica de negócios que os formatos padrão não consigam expressar. Os dados chegam aos seus sistemas já consistentes, sem necessidade de scripts de limpeza intermediários.

O campo Data do Parseur analisa qualquer ordem, separador ou nome de mês em vários idiomas, e usa o contexto do documento para desambiguar valores ambíguos como 03/04/2026. A saída é normalizada para um formato consistente para que seu sistema posterior receba sempre a mesma estrutura.

Sim. O formato Nome completo divide os nomes em partes: primeiro, meio e último. O formato Endereço geolocaliza e divide os endereços em componentes estruturados. Ambos são executados automaticamente assim que o formato do campo é definido.

Sim. Cada resultado é verificado em relação ao esquema da caixa de entrada, regras de campos obrigatórios capturam valores ausentes e regras de campos de escolha sinalizam valores fora da lista permitida. As falhas aparecem na interface, enviam uma notificação por e-mail e acionam um webhook para que tanto as equipes de operações quanto suas ferramentas fiquem sabendo.

Sim. As regras de pós-processamento permitem que você insira um pequeno script Python que é executado após a extração e a validação padrão. Use-o para combinar, dividir ou calcular novos campos a partir dos valores extraídos, aplicar lógicas de negócios, executar buscas ou moldar a saída para corresponder a um contrato exato do sistema posterior. Disponível no plano Pro e superiores.