Gegevensnormalisatie en validatie

Dezelfde structuur, schone data uit elk document

Van mailbox-schema's tot nabewerking, elke geëxtraheerde waarde landt schoon, gevalideerd en klaar voor downstream-systemen.

Wat je krijgt

Schema per mailbox

Een consistent schema is wat downstream-integraties en automatiseringen echt betrouwbaar maakt. Definieer je velden één keer en elk document dat de mailbox verwerkt, mapt naar exact dezelfde structuur.

  • Standaardvelden voor losse waarden, tabelvelden voor herhalende data
  • Vertel de AI in normaal Nederlands wat per veld nodig is
  • Pas velden op elk moment aan via de UI of de API

Formaten per veld

Ingebouwde formaten normaliseren datums, getallen, adressen en meer. Het juiste format wordt afgeleid uit de context van het document, met de mailbox-standaard als fallback.

  • Leest datums in elke volgorde, scheiding of taal
  • Begrijpt elk decimaal- of duizendtalteken in regionale getalformaten
  • Lokaliseert adressen en splitst ze automatisch in gestructureerde onderdelen

Gegevensvalidatie

Automatische gegevensvalidatie toetst elke geëxtraheerde waarde aan het mailbox-schema. Fouten verschijnen direct in de UI, sturen een e-mail en triggeren een webhook, zodat zowel ops-teams als tools direct op de hoogte zijn.

  • Schema-check toetst of het AI-resultaat past bij het veldformaat
  • Verplichte-veldcheck signaleert missende waarden bij de bron
  • Keuzevelden markeren waarden buiten de toegestane lijst

Nabewerkingsregels

Heb je meer nodig dan standaard formats en validatie? Voeg een kort Python-script toe. Regels draaien na extractie om velden te herstructureren of je eigen bedrijfslogica toe te passen.

  • Combineer, splits of bereken nieuwe velden uit de extractie
  • Pas bedrijfslogica toe, raadpleeg lookups, of voer conditionele transformaties uit
  • Beschikbaar vanaf het Pro-abonnement

Hoe gegevensnormalisatie werkt

Wat er net gebeurde

AI-documentextractie en parsing

Vision AI, Text AI, templates of OCR hebben gestructureerde velden uit elk document gehaald.

Meer informatie
1

Mappen naar schema

Geëxtraheerde waarden landen in de vaste set velden die je voor de mailbox hebt gedefinieerd. Elk document, ongeacht de lay-out, komt er met dezelfde kolomstructuur uit.

Mailboxvelden
Tekst Leverancier Acme BV
Tekst Factuurnr. INV-0142
Datum Uitgegeven op 2026-05-07
Getal Totaal 2840
Tabel Regels 3 kolommen, 2 rijen
Artikel Aantal Prijs Advies 12 € 200,00 Apparatuur 2 € 220,00
2

Formatteren

Elk veld loopt door het ingestelde format. Datums en getallen worden genormaliseerd over regionale verschillen heen, op basis van de context van het document. Namen worden gesplitst in voornaam, tussenvoegsel en achternaam. Adressen worden uitgesplitst in gestructureerde onderdelen.

Datum May 7, 2026 2026-05-07
Getal € 1.234,56 1234.56
Adres Herengracht 100, 1015BS Amsterdam
Herengracht 100 Amsterdam NH 1015 BS Nederland
3

Valideren

Elk resultaat gaat door een validatiecheck voordat het doorstroomt. Documenten die slagen gaan door naar nabewerking, de rest wordt gemarkeerd, zodat er nooit iets onopgemerkt Parseur verlaat.

Validatie
Leverancier Acme BV
Uitgegeven op 2026-04-15
Totaal Verplicht ontbreekt
Status afgewezen
Toegestaan: open betaald gesloten
4

Nabewerken

Optionele Python-regels draaien als laatste stap, zodat je bedrijfslogica kunt toevoegen die met veldformaten alleen niet lukt. Combineer velden, raadpleeg referentiedata, of pas de output aan op het exacte contract van jouw downstream-systeem.

post_process.py
def post_process(data):
if data["Totaal"] > 1000:
data["Verzending"] = "express"
else:
data["Verzending"] = "standaard"
return data
Getal Totaal 2840
Tekst Verzending express

Wat er daarna gebeurt

Realtime export en integraties

Genormaliseerde data wordt direct geleverd aan je CRM, boekhoudsysteem of database.

Meer informatie
Begin direct

Schone data, klaar voor jouw systemen.

Definieer de velden die je nodig hebt, kies het format dat past, en zie hoe elke extractie er in het juiste formaat uitkomt.

Gratis abonnement, geen creditcard nodig
Verwerk je eerste document in minder dan 2 minuten
Op elk moment opzegbaar, geen verplichtingen

Veelgestelde vragen

Veelvoorkomende vragen over normalisatie en validatie bij Parseur, van datum- en getalformaten tot validatieregels en Python-nabewerking.

Gegevensnormalisatie is de stap die ruwe geëxtraheerde waarden omzet naar schone, consistent gestructureerde data. Datums uit verschillende documenten landen in hetzelfde format, getallen worden correct uitgelezen over regionale verschillen heen, adressen worden netjes uitgesplitst, en elk veld mapt naar een vast schema. Zo ontvangen downstream-systemen altijd dezelfde structuur.

Zonder normalisatie geeft elk document een net iets ander resultaat: datums in andere volgorde, getallen met andere scheidingstekens, namen en adressen door elkaar gegooid als één tekstreeks. Downstream-tools weigeren records of slaan inconsistente data op. Normalisatie lost dat op bij de bron, zodat integraties blijvend betrouwbaar functioneren.

Het getalveld interpreteert elk decimaal- en duizendtalteken over regionale verschillen heen: van de Europese 1.234,56 tot de Amerikaanse 1,234.56 en Indiase grouping zoals 1,00,00,000. Ook boekhoudnotatie, waarbij haakjes negatieve bedragen aanduiden zoals ($123.456.789,12), wordt ondersteund. Het juiste format wordt afgeleid uit de context van het document, met mailbox-standaard als fallback.

Parseur ondersteunt Tekst, Datum, Tijd, Datum-tijd, Getal, Volledige naam, Adres en Keuzeveld. Elk format heeft zijn eigen parsing- en validatieregels. Standaardvelden vangen losse waarden, tabelvelden verwerken herhalende gegevens rij voor rij.

Het document krijgt dan de status 'Process Failed' in plaats van stilzwijgend te worden geëxporteerd, en er wordt een e-mail verzonden. Als er een process-failed webhook is geconfigureerd, wordt die ook getriggerd. Je kunt het document vervolgens zelf beoordelen, of de fouten opnemen in je eigen monitoring.

Elke mailbox heeft zijn eigen schema, en elk document dat die mailbox verwerkt mapt naar dezelfde vaste set velden. Eén mailbox kan dus facturen van uiteenlopende leveranciers met allerlei verschillende lay-outs verwerken, en levert altijd dezelfde kolomstructuur op voor elke rij.

Definieer één keer de velden die je downstream-systeem verwacht in een Parseur-mailboxschema, en elk document mapt naar die structuur. Veldformaten standaardiseren datums, getallen, namen en adressen over regionale verschillen heen. Automatische gegevensvalidatie vangt ontbrekende of ongeldige waarden af vóór de export, en optionele Python-nabewerking regelt alle bedrijfslogica die de standaardformaten niet kunnen uitdrukken. Data komt al consistent aan bij je systemen, zonder dat er opschoonscripts tussen hoeven te zitten.

Het datumveld van Parseur leest elke volgorde, scheiding of maandnaam in verschillende talen, en gebruikt de context van het document om een ambigue datum als 03/04/2026 juist te interpreteren. De output wordt genormaliseerd naar één vast format, zodat je downstream-systeem altijd dezelfde structuur ontvangt.

Ja. Het format 'Volledige naam' splitst namen in voornaam, tussenvoegsel en achternaam. Het format 'Adres' lokaliseert adressen en splitst ze in gestructureerde onderdelen. Beide draaien automatisch zodra het veldformat is ingesteld.

Jazeker. Elk resultaat wordt getoetst aan het mailbox-schema. Verplichte velden signaleren missende waarden, en keuzevelden markeren waarden buiten de toegestane lijst. Fouten verschijnen direct in de UI, sturen een e-mail en triggeren een webhook, zodat zowel ops-teams als jouw tools er direct van op de hoogte zijn.

Ja. Met nabewerkingsregels voeg je een kort Python-script toe dat na extractie en standaardvalidatie wordt uitgevoerd. Gebruik dit om velden te combineren, splitsen of berekenen uit geëxtraheerde waarden, bedrijfslogica of lookups toe te passen, of je output volledig aan te passen op het exacte contract van je downstream-systeem. Beschikbaar vanaf het Pro-abonnement.