AI documentextractie
AI documentextractie met de juiste parsing engine voor elk document
Parseur haalt gestructureerde data uit PDF's, scans, e-mails en bijlagen. Vision AI voor visuele lay-outs, Text AI voor platte tekst, sjablonen voor vaste formulieren. Alle drie de engines draaien binnen één mailbox.
Alles wat je nodig hebt om data uit documenten te halen
Vision AI-extractie
Vision-modellen lezen pagina's als afbeeldingen in plaats van als tekst. De AI bekijkt het document zoals een mens dat doet, met volledige lay-out en visuele context.
- Ideaal voor rijke PDF's, scans en formulieren met een complexe structuur
- Pakt handschrift, vinkjes, stempels en lay-outsignalen op
- Instellen met instructies in gewone taal, geen sjabloon nodig
Text AI-extractie
Documenten worden eerst omgezet naar platte tekst, met OCR als de bron geen eigen tekstlaag heeft. De AI verwerkt daarna uitsluitend de geëxtraheerde tekst en negeert de lay-out en afbeeldingen.
- Perfect voor e-mails, platte PDF's en andere tekstgerichte documenten
- Handig als de visuele lay-out geen extra informatie bevat
- Instellen met instructies in gewone taal, geen sjabloon nodig
Extractie op basis van sjablonen
Voeg zoveel sjablonen per mailbox toe als je nodig hebt. Parseur kiest automatisch het best passende sjabloon per document en levert elke keer dezelfde output, zonder dat er AI bij komt kijken.
- Top voor vaste formulieren en automatisch gegenereerde e-mails
- De meest betrouwbare extractiemethode als de lay-outs nooit veranderen
- Bouw sjablonen visueel, één per documentindeling
Extractie van tabellen en regels
Elke rij in een tabel wordt een eigen datarecord, geen enkelvoudig samengevoegd veld. Dit werkt met alle drie de parsing engines. Bij spreadsheets gebeurt het parsen van tabellen automatisch.
- Verwerkt wisselende aantallen rijen per document
- Pakt tabellen die meerdere pagina's beslaan
- AI-engines splitsen complexe, meerregelige rijen in losse velden
OCR voor scans en afbeeldingen
Optische tekenherkenning (OCR) leest tekst van scans, telefoonfoto's en PDF's die alleen uit afbeeldingen bestaan. Dit levert de tekst voor de Text AI en sjabloonengines als er geen eigen tekstlaag is.
- Werkt op scans, telefoonfoto's en PDF's zonder tekstlaag
- Meertalige OCR in meer dan 200 talen, inclusief handschrift
- Sjabloonengine maakt gebruik van zonale en dynamische OCR voor vaste of verschuivende lay-outs
Documentvoorverwerking
Nauwkeurige extractie begint met het opschonen en herstellen van inkomende documenten. De voorverwerking van Parseur is verfijnd door meer dan 100 miljoen documenten en tien jaar aan praktijkgerichte randgevallen.
- Zet scheve scans recht en herhaalt OCR op onleesbare tekst
- Herstelt corrupte PDF's, kapotte e-mailcodering en onjuiste HTML
- Detecteert landspecifieke datum- en nummerformaten automatisch
Zo werkt AI documentextractie
Wat er net gebeurde
Automatische documentintake
Documenten zijn automatisch binnengekomen via e-mail, API, uploads of gekoppelde opslag.
Voorverwerken
Elk document krijgt eerst een opschoningsronde. Parseur controleert de pagina-oriëntatie, zet scheve scans recht en herstelt onleesbare of verkeerd geordende inhoud waar nodig.
OCR
Voor scans, telefoonfoto's en PDF's zonder tekstlaag haalt Parseur de tekst eruit met OCR. Documenten met een eigen tekstlaag slaan deze stap over.
Engine kiezen
Parseur kiest automatisch de meest geschikte engine voor elk document. Is er een passend sjabloon, dan krijgt die voorrang. Anders behandelt Vision AI beeldrijke pagina's en pakt Text AI de platte tekst.
Extractie
De gekozen parsing engine haalt gestructureerde velden uit het document, gekoppeld aan het schema dat jij in jouw mailbox hebt gedefinieerd. Daarna gaan alle velden door normalisatie voor formattering en validatie.
Wat er daarna gebeurt
Gegevensnormalisatie en validatie
Geëxtraheerde velden worden gevalideerd, geformatteerd en klaargemaakt voor workflows verderop in het proces.