Normalización y Validación de Datos

Misma forma, datos limpios para cada documento

Desde esquemas de buzón hasta el post-procesamiento, cada valor extraído llega limpio, validado y listo para los sistemas posteriores.

Qué incluye

Esquemas a nivel de buzón

Un esquema consistente es lo que hace que las integraciones y automatizaciones posteriores sean realmente fiables. Define tus campos una vez y cada documento que procesa el buzón se asigna a la misma estructura.

  • Campos estándar para valores únicos, campos de tabla para datos repetidos
  • Instrucciones en lenguaje natural para guiar a la IA sobre qué capturar en cada campo
  • Ajusta los campos en cualquier momento desde la interfaz o programáticamente por API

Formato a nivel de campo

Los formatos integrados normalizan fechas, números, direcciones y más. El formato correcto se infiere del contexto del documento, con los valores predeterminados a nivel de buzón como respaldo.

  • Las fechas se analizan en cualquier orden, separador o nombre de mes en varios idiomas
  • Los números se analizan con cualquier separador decimal/miles en formatos regionales
  • Los campos de dirección geolocalizan y dividen las direcciones en partes estructuradas

Validación de datos

La validación automatizada de datos contrasta cada resultado extraído con el esquema del buzón. Los fallos aparecen en la interfaz, desencadenan una notificación por correo electrónico y disparan un webhook, para que tanto los equipos de operaciones como las herramientas se enteren.

  • La validación por esquema confirma que el resultado de la IA coincide con la forma del campo
  • El control de campo obligatorio detecta valores faltantes en el origen
  • El control de campo de elección marca los valores que están fuera de la lista permitida

Reglas de post-procesamiento

Cuando el formato y la validación estándar no son suficientes, inserta un pequeño script en Python. Las reglas se ejecutan después de la extracción para dar nueva forma a los valores o ejecutar una validación personalizada según tu lógica de negocio.

  • Combina, divide o calcula nuevos campos a partir de los valores extraídos
  • Aplica lógica de negocio, búsquedas o transformaciones condicionales
  • Disponible a partir del plan Pro

Cómo funciona la normalización de datos

Lo que acaba de ocurrir

Extracción y Análisis de Documentos con IA

IA de Visión, IA de Texto, plantillas u OCR extrajeron campos estructurados de cada documento.

Más información
1

Mapeo al esquema

Los valores extraídos se mapean al conjunto fijo de campos definidos para el buzón. Cada documento, sin importar el diseño original, termina con la misma forma de columnas en la salida.

Campos del buzón
Texto Proveedor Acme Corp
Texto Factura n.º INV-0142
Fecha Emitido el 2026-05-07
Número Total 2840
Tabla Conceptos 3 columnas, 2 filas
Artículo Cant. Precio Consultoría 12 200 € Equipamiento 2 220 €
2

Formatear

Cada campo se procesa según su formato configurado. Fechas y números se normalizan entre variaciones regionales usando el contexto del documento, los nombres se dividen en nombre/segundo nombre/apellidos, las direcciones se analizan en partes estructuradas.

Fecha May 7, 2026 2026-05-07
Número 1.234,56 € 1234.56
Dirección Calle Alcala 28, Madrid
Calle de Alcalá 28 Madrid Madrid 28014 España
3

Validar

Cada resultado pasa por los controles de validación antes de continuar. Los documentos que aprueban continúan al post-procesamiento, el resto se marcan para que nada salga de Parseur sin ser detectado.

Validación
Proveedor Acme Corp
Emitido el 2026-04-15
Total Obligatorio falta
Estado rechazado
Permitidos: abierto pagado cerrado
4

Post-procesar

Las reglas opcionales en Python se ejecutan al final, aplicando lógica de negocio que el formato a nivel de campo no puede expresar. Combina campos, busca datos de referencia o da forma a la salida para que coincida con un contrato exacto de sistemas posteriores.

post_process.py
def post_process(data):
if data["Total"] > 1000:
data["Envío"] = "exprés"
else:
data["Envío"] = "estándar"
return data
Número Total 2840
Texto Envío exprés

Lo que ocurre después

Exportaciones e Integraciones en Tiempo Real

Los datos normalizados se entregan a tu CRM, sistema contable o base de datos en tiempo real.

Más información
Empieza ya

Datos limpios, listos para tus sistemas.

Define los campos que necesitas, elige los formatos que se ajusten y observa cómo cada extracción llega con la forma correcta.

Plan gratuito incluido, sin tarjeta de crédito
Procesa tu primer documento en menos de 2 minutos
Cancela en cualquier momento, sin compromiso

Preguntas frecuentes

Respuestas a preguntas comunes sobre la normalización de datos y validación en Parseur, incluyendo formatos de fechas y números, reglas de validación y post-procesamiento en Python.

La normalización de datos es el paso que convierte los valores extraídos en bruto en datos limpios y con un formato coherente. Las fechas de distintos documentos llegan en el mismo formato, los números se analizan correctamente a través de convenciones regionales, las direcciones se dividen en partes estructuradas y cada campo se mapea a un esquema fijo, por lo que los sistemas posteriores siempre reciben la misma forma.

Sin normalización, cada documento genera una salida ligeramente distinta: fechas en distinto orden, números con diferentes separadores, nombres y direcciones agrupados en cadenas simples. Las herramientas posteriores terminan rechazando las filas o almacenando datos inconsistentes. La normalización soluciona esto en el origen para que las integraciones sean realmente fiables.

El campo Número analiza cualquier separador decimal y de miles a través de formatos regionales, incluidas las convenciones europeas (1.234,56) y estadounidenses (1,234.56), la agrupación india como 1,00,00,000 y la notación contable donde los paréntesis indican números negativos, como ($123,456,789.12). El formato correcto se infiere del contexto del documento, con los valores predeterminados a nivel de buzón como respaldo.

Parseur admite campos de tipo Texto, Fecha, Hora, Fecha y hora, Número, Nombre completo, Dirección y Campo de elección. Cada formato tiene sus propias reglas de análisis y validación, y los campos estándar capturan valores únicos mientras que los campos de tabla capturan datos repetidos fila por fila.

El estado del documento se cambia a Proceso Fallido en lugar de exportarse silenciosamente, y se envía una notificación por correo electrónico. Si hay un webhook de fallo de proceso configurado, este también se dispara. Puedes revisar y corregir el documento manualmente o integrar los fallos en tu propio monitoreo.

Cada buzón tiene su propio esquema y cada documento que procesa el buzón se asigna al mismo conjunto fijo de campos. Así que un solo buzón puede procesar facturas de muchos proveedores diferentes, con múltiples diseños, y aun así emitir la misma forma de columna para cada fila.

Define los campos que tu sistema posterior espera una vez, en un esquema de buzón de Parseur, y cada documento se ajustará a esa estructura. Los formatos de los campos estandarizan fechas, números, nombres y direcciones a través de variaciones regionales, la validación automatizada de datos detecta valores faltantes o no válidos antes de la exportación, y el post-procesamiento opcional en Python maneja cualquier lógica de negocio que los formatos estándar no puedan expresar. Los datos llegan a tus sistemas ya consistentes, sin scripts de limpieza intermedios.

El campo Fecha de Parseur analiza cualquier orden, separador o nombre de mes en varios idiomas y utiliza el contexto del documento para desambiguar valores ambiguos como 03/04/2026. La salida se normaliza a un formato consistente para que tu sistema posterior reciba siempre la misma forma.

Sí. El formato de Nombre completo divide los nombres en nombre, segundo nombre y apellidos. El formato de Dirección geolocaliza y divide las direcciones en componentes estructurados. Ambos se ejecutan automáticamente una vez que se establece el formato del campo.

Sí. Cada resultado se contrasta con el esquema del buzón, las reglas de obligatoriedad detectan valores faltantes y las reglas de los campos de elección marcan los valores fuera de la lista permitida. Los fallos aparecen en la interfaz de usuario, envían una notificación por correo electrónico y disparan un webhook para que tanto los equipos de operaciones como tus herramientas se enteren.

Sí. Las reglas de post-procesamiento te permiten insertar un pequeño script en Python que se ejecuta después de la extracción y la validación estándar. Úsalo para combinar, dividir o calcular nuevos campos a partir de los valores extraídos, aplicar lógica de negocio, ejecutar búsquedas o dar forma a la salida para que coincida exactamente con un contrato posterior. Disponible a partir del plan Pro.