Belangrijkste punten:
- Een document extractie API geeft jou gelabelde velden, tabellen en line items uit een PDF, scan of e-mail. OCR geeft jou tekens en laat de betekenis aan jou over.
- Template-gebaseerde en AI-gestuurde extractie zijn verschillende producten. Templates breken wanneer een leverancier het totaal verplaatst, AI-extractie leest layouts die het nog nooit heeft gezien.
- Beoordeel vendors op veldniveau nauwkeurigheid met jouw eigen documenten. Het getal op hun datasheet is gemeten op die van hen.
- Parseur levert een developer API en een webapp die jouw operationele team kan beheren, zodat niemand de reviewtool hoeft te bouwen.
- Parseur wordt in de EU gehost, met gegevens die worden verwerkt en opgeslagen in de Europese Unie en nooit worden gebruikt om AI-modellen te trainen.
Een document extractie API is een dienst die een bestand zoals een PDF, een gescande afbeelding of een e-mail neemt en gestructureerde data zoals JSON of CSV retourneert. In tegenstelling tot ruwe OCR, die platte tekst retourneert en het aan jou overlaat om de betekenis erin te vinden, identificeert en behoudt een document extractie API structuur: key-value paren, tabellen, line items en gelabelde velden.
Drie buren worden ermee verward. Publieke data API's geven je een dataset die iemand anders al heeft samengesteld. Web scraping API's halen op wat er op een webpagina staat. OCR-engines? Tekens, geen structuur. Een document extractie API werkt op jouw documenten, de documenten die al in een inbox zitten, en zet ze om in data waar een systeem actie op kan ondernemen. Sommige vendors verkopen hetzelfde onder de naam 'document understanding API' of leveren het als een document extractie SDK. Ander label, zelfde taak. Nog steeds aan het uitzoeken welk probleem jij hebt? We hebben document parsing en web scraping naast elkaar gezet.
Volgens Research and Markets wordt de markt voor intelligente documentverwerking, die document extractie API's omvat, gewaardeerd op ongeveer $3,01 miljard en wordt verwacht dat deze groeit met een CAGR van 31,7%. Dat getal is in feite een telling van facturen, afschriften en formulieren, en elk daarvan moet ergens door worden gelezen. In veel bedrijven is dat "iets" nog steeds een persoon met een tweede monitor en een numeriek toetsenbord.
Snelle voorbeelden:
- PDF factuur → JSON met headervelden en een line-item array
- Onboarding formulier → gelabelde key-value paren (naam, adres, handtekening)
- Bankafschrift → transactietabel geëxporteerd naar CSV
Vijf Soorten Vendors met Hetzelfde Label
Zoek op "document extractie API" en je krijgt een dozijn vendors die een categorie delen en bijna niets anders. Ze concurreren niet echt met elkaar, omdat ze gebouwd zijn voor vijf verschillende taken. Ieder van hen zal zijn eigen demo winnen, dus de rij telt zwaarder dan de pitch. Bepaal in welke rij jij thuishoort voordat je één call boekt.
| Soort vendor | Voorbeelden | Gebouwd voor | Wat je zelf nog moet bouwen |
|---|---|---|---|
| Cloud bouwblokken | Google Document AI, Azure Document Intelligence, AWS Textract | Teams die al gestandaardiseerd zijn op die cloud en extractie willen als één van vele diensten | Inname, reviewschermen, uitzonderingsbeheer, retries, ERP posting |
| AP automation platforms | Rossum, Nanonets | Financiële teams die de hele factuurworkflow willen, niet alleen de velden | Weinig te bouwen, mits hun workflow dicht genoeg bij die van jou ligt |
| Developer-first parsing API's | Mindee, Veryfi, Parseur | Engineers die de workflow bezitten en schone JSON willen | Varieert per vendor. Parseur levert de review app mee |
| AI-native document parsers | LlamaParse, Reducto | RAG- en agent-pipelines die meer behoefte hebben aan trouwe structuur dan aan zakelijke velden | Veldmapping, validatie, alles wat lijkt op een workflow |
| Enterprise IDP suites | ABBYY, Hyperscience, UiPath | Gereguleerde, grote volumeoperaties met menselijke review en legacysystemen | Weinig te bouwen. Het werk verplaatst zich naar configuratie en uitrol |
Twee kanttekeningen bij die tabel. Ten eerste lopen de rijen in elkaar over: verschillende vendors zitten in twee rijen. Ten tweede staat Parseur in rij drie omdat dat de taak is waarvoor het is gebouwd: e-mails en operationele documenten omzetten in gestructureerde JSON met een app die jouw operationele team daadwerkelijk kan gebruiken. Als jouw documenten technische tekeningen zijn, past rij vier beter dan wij, en dat vertellen we je liever nu dan tijdens een proefperiode.
Template-gebaseerde vs AI-gestuurde Extractie (Slechts Eén Slaagt op Schaal)
Template-gebaseerde extractie vindt een veld door zijn positie op de pagina. AI-gestuurde extractie vindt het door de betekenis ervan. Dat is het hele verschil, en het bepaalt voor hoeveel werk jij je inschrijft.
Een template zegt: het factuurnummer staat 40mm van de bovenkant, 120mm van de linkerkant. Snel, deterministisch, heerlijk. Dit houdt stand tot de ochtend waarop een leverancier zijn factuur opnieuw ontwerpt, op welk moment het de verkeerde waarde retourneert, of helemaal niets, en iemand een ticket aanmaakt. Tweehonderd leveranciers, tweehonderd templates, één engineer die ze begrijpt.
AI-gestuurde extractie leest het document zoals een mens dat doet. Het vindt het totaal omdat het onder een regel staat die "Totaalbedrag" heet, rechtsonder, geformatteerd als valuta, en gelijk is aan de som erboven. Verplaats het, verander de stijl, vertaal de hele factuur naar het Duits. Nog steeds vindbaar.
Parseur draait twee AI-engines en geen templates: de Text AI-engine voor e-mails en tekstdocumenten, en de Vision AI-engine voor PDF's, scans en afbeeldingen. Je beschrijft de velden die je wilt hebben en extractie past zich aan per document in plaats van per layout, dus de setup bestaat uit minuten velddefinitie in plaats van weken templates bouwen.
De afweging is echt. AI-extractie is probabilistisch waar een template deterministisch is, wat de reden is waarom betrouwbaarheidsscores (confidence scores) bestaan, en waarom het evaluatiegedeelte hieronder meer tijd besteedt aan uitzonderingsbeheer dan aan accuraatheidsclaims.
Hoe een Document Extractie API Werkt, in Vijf Fasen
Vendors verschillen in de details, maar de document extractie pipeline heeft overal dezelfde vorm.
Waarom dit niet langer optioneel is: volume. Dream Factory citeert de veelgebruikte prognose dat wereldwijde data in 2025 de 175 zettabytes zou bereiken, een datum die nu achter ons ligt, en het aandeel daarvan dat binnenkomt als documenten in plaats van databaserijen is niet gekrompen. Handmatig overtypen kan dat niet aan. Een muur van templates ook niet.
Stap 1: Inname (Ingestion)
Hoe de vendor het ook noemt, dit is de document inname API: upload via HTTP, e-mail forwarding, of een webhook vanuit een ander systeem. E-mail is belangrijker dan het klinkt. Een groot deel van de zakelijke documenten raakt nooit een file picker aan, ze komen aan als bijlagen van een leverancier die nog nooit van jouw portal heeft gehoord.
Stap 2: AI OCR en layoutanalyse
AI OCR zet beeld- en scangedeeltes om in machine-leesbare tekst. Layoutanalyse bepaalt vervolgens de leesvolgorde, tekstblokken, regels, woorden en waar elk zich op de pagina bevindt. Dit is de stap die een moderne engine onderscheidt van eentje uit 2010: het produceert een structurele kaart, niet alleen tekens.
Stap 3: Parsing
- Key-value paren: labels gekoppeld aan waarden, zoals "Factuurnummer: 12345".
- Tabellen en line items: gereconstrueerde rijen en cellen, inclusief samengevoegde cellen (merged cells) en tabellen die over een pagina-einde heen doorlopen.
- Classificatie: uitzoeken wat het document is voordat besloten wordt naar welke velden gezocht moet worden.
Stap 4: Post-processing
Datums, valuta en leveranciersnamen worden genormaliseerd naar consistente formaten. Het resultaat wordt gevalideerd tegen een JSON Schema of Pydantic model zodat een verkeerd opgemaakte payload jouw ERP nooit bereikt.
Stap 5: Levering
De API retourneert het resultaat synchroon voor kleine bestanden, of asynchroon met een webhook-callback voor alles wat groter is. Retries en idempotentie zijn wat dit betrouwbaar houdt bij grote volumes. Vraag naar beide voordat je tekent, niet na de eerste stille vrijdagavond.
Laat me de JSON Zien
Vendorpagina's praten over "gestructureerde output" zonder er ooit een te laten zien. Hier is de vorm waarin een inkomende factuur terug zou moeten komen, en de vorm die het waard is om van elke vendor te eisen:
{
"document_type": "invoice",
"supplier": { "name": "", "tax_id": "", "supplier_id": "" },
"invoice": {
"invoice_number": "",
"invoice_date": "",
"due_date": "",
"currency": "",
"po_number": ""
},
"amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
"line_items": [
{
"description": "",
"sku": "",
"quantity": 0,
"unit_price": 0,
"line_total": 0
}
],
"confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}
Twee dingen daarin doen het meeste werk. line_items is een array, geen blob aan tekst, wat two-way en three-way matching mogelijk maakt. confidence is per veld, waardoor jij automatisch kunt beslissen of er een mens naar moet kijken.
Hoe je een Document Extractie API Kiest Zonder de Demo te Vertrouwen

Elke vendor wint zijn eigen demo, want elke vendor heeft de documenten ervoor geselecteerd. De enige evaluatie die de productie voorspelt, is de evaluatie die jij uitvoert op jouw documenten.
1. Bouw de testset voordat je met iemand praat
Haal 200 tot 500 echte documenten uit je afgelopen drie maanden, gewogen zoals je inbox daadwerkelijk is:
- ~70% jouw veelvoorkomende leveranciersformaten
- ~20% long-tail leveranciers die je één keer per kwartaal ziet
- ~10% de exemplaren die dingen kapot maken: slechte scans, handgeschreven notities, tabellen van meerdere pagina's, creditnota's, vreemde valuta, twee inkooporders (PO's) op één factuur
Laat de identieke set door elke kandidaat lopen. Laat een vendor nooit de steekproef kiezen.
2. Scoor velden, geen documenten
Nauwkeurigheid op documentniveau verbergt de fouten die je geld kosten. Scoor elk veld afzonderlijk en weeg het op basis van hoeveel een fout pijn doet:
| Veld | Waarom het uitmaakt |
|---|---|
| Factuurnummer, leveranciers-ID | Duplicaatdetectie en matching breken zonder deze |
| Totaal, btw, valuta | Verkeerd hier betekent verkeerde betalingen |
| PO nummer | De haak voor two-way en three-way matching |
| Line item kwantiteit en stukprijs | Waar de meeste engines daadwerkelijk falen |
| Datums | Goedkoop om te repareren, duur om te missen |
3. Het getal dat je moet volgen is straight-through processing
Tel de documenten die van binnenkomst naar geboekt gaan zonder dat iemand ze aanraakt. Bij 5.000 documenten per maand is de kloof tussen 90% en 96% straight-through processing 300 documenten die iemand handmatig opent. Dat is geen metriek, dat is een functieomschrijving.
4. Line items zijn het breekpunt
Headervelden zijn makkelijk. Elke engine op de shortlist zal het factuurnummer vinden. Gooi er tabellen van meerdere pagina's, herhaalde headers, ingepakte omschrijvingen (wrapped descriptions), vracht- en kortingsrijen, btw per regel, negatieve credits en gemengde eenheden tegenaan voordat je ook maar één getal gelooft.
5. Vraag wie de uitzonderingen opruimt
Bestandsgrootte-limieten, asynchrone verwerking, webhook retries, idempotentie, rate limits, SDK-dekking en wat er gebeurt met een veld met een lage betrouwbaarheid. Vraag vervolgens wie de uitzonderingen beoordeelt. Als het antwoord is "jouw engineers, in een tool die jij bouwt", dan is de prijs op de datasheet niet de werkelijke prijs. Parseur's eigen cijfers voor die lijst staan in de API documentatie, en het antwoord op de laatste vraag is de webapp, niet jouw sprint.
Wat een Document Extractie API Echt Kost
Prijsmodellen verschillen meer dan de marketing doet vermoeden, en de vorm telt zwaarder dan het tarief.
- Per pagina: goedkoopst bij korte documenten, pijnlijk bij lange. Een contract van 40 pagina's kost 40 keer zoveel als een bonnetje van één pagina voor dezelfde enkele set velden.
- Per document: voorspelbaar per bestand, maar premium functies zoals custom modellen, handschrift of query-gebaseerde extractie worden vaak extra in rekening gebracht.
- Abonnement op basis van volume: een vast maandelijks tarief voor een aantal documenten, aantal pagina's irrelevant.
Parseur gebruikt de derde. Een lange PDF en een korte e-mail kosten hetzelfde, wat de rekening voorspelbaar houdt wanneer jouw documentmix dat niet is. De huidige pakketten staan op de prijzenpagina.
De kosten die niemand noemt, zijn de engineering rondom de API: post-processing logica, een review-interface, retry handling, monitoring voor drift in extractie. Die rekening is meestal hoger dan de API-rekening, en dat is het deel dat de Parseur webapp doet verdwijnen.
Een PDF Parsen Naar JSON Met de Parseur API

Het hele traject van de PDF extractie API, van upload tot webhook, in vijf stappen.
Base URL: https://api.parseur.com/
1. Authenticatie
Vind jouw API key in de API-sectie van je Parseur-account en stuur deze mee in de Authorization header bij elk verzoek:
Authorization: <JOUW_API_KEY>
Volledige details staan in de Authenticatie Gids.
2. Zoek of maak een mailbox aan
Een mailbox is de container die jouw documenten en de velden die je geëxtraheerd wilt hebben, vasthoudt. Maak er een aan in de app, lijst vervolgens je mailboxen op om de ID te krijgen:
curl -X GET "https://api.parseur.com/parser" \
-H "Authorization: <JOUW_API_KEY>" \
--compressed
De mailbox ID verschijnt ook in de mailbox URL in de app, en in het id veld van de create-mailbox response.
3. Upload een document
cURL:
curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
-H "Authorization: <JOUW_API_KEY>" \
-F "file=@./invoice.pdf" \
--compressed
Python:
import requests
url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<JOUW_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}
response = requests.post(url, headers=headers, files=files)
print(response.json())
Node.js:
import fetch from "node-fetch"
import fs from "fs"
const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<JOUW_API_KEY>" }
const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))
const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())
Documenten kunnen ook per e-mail worden doorgestuurd in plaats van via upload. Zie E-mails en Documenten Uploaden voor beide routes.
4. Ontvang je data terug
Configureer een webhook op de mailbox en de geparste JSON belandt op jouw endpoint op het moment dat de verwerking klaar is. In productie is dit de juiste standaard: geen polling, geen cron, geen documenten die verloren gaan tussen checks door.
Alternatieven als een webhook geen optie is:
- Automatisering platforms: Zapier, Make, n8n of Power Automate.
- Polling:
GET /document/{id}voor de geparste JSON. - Exports: CSV, JSON of Excel downloads vanuit de mailbox.
5. Valideren en afstellen
Het Parseur dashboard toont document- en webhooklogs, zodat je precies kunt zien wat er is geëxtraheerd en wat er is geleverd. Wanneer een veld verkeerd terugkomt, pas het dan daar aan in plaats van het te patchen in je codebase.
Wat Parseur Extraheert, en Wat Het Nog Steeds Niet Kan
Parseur is een document extractie API gebouwd rondom één idee: het document mag geen voorbereiding nodig hebben voordat de software het kan lezen. Het heeft sinds 2016 meer dan 100 miljoen documenten verwerkt.
- Key-value paren en formulieren: namen, adressen, totalen, factuurnummers en referentie-ID's in gelabelde velden.
- Tabellen en line items: factuurregels, transacties op bankafschriften, verzendmanifesten, inclusief tabellen die over meerdere pagina's doorlopen. AI tabelextractie behandelt hoe dat werkt.
- Scans en foto's: de Vision AI-engine leest gescande en gefotografeerde documenten direct, niet alleen digitale PDF's.
- E-mails en bijlagen: een Parseur specialiteit. De e-mail zelf is een document, en dat geldt ook voor alles wat eraan is bijgevoegd.
- Layoutelementen: koppen, alinea's en selectievakjes waar je ze nodig hebt.
Waar het nog steeds moeilijk is: compact handschrift en handtekeningen. Die zijn in de hele categorie onopgelost, en aan elke vendor die het tegendeel beweert, zou de benchmark moeten worden gevraagd.
De meeste document extractie software stopt bij de API en laat de rest aan jou over. Parseur levert beide helften: de API voor jouw kant, en een webapp waar het operationele team velden definieert, documenten beoordeelt en resultaten corrigeert zonder een ticket aan te maken of te wachten op een sprint.
Waar teams het voor gebruiken
- Crediteurenadministratie - facturen, bonnetjes en inkooporders in gestructureerde JSON, en daarna direct het ERP in.
- Financiële Processen - bankafschriften en transactierapporten naar CSV of JSON voor reconciliatie.
- Operations en Logistiek - pakbonnen, vrachtbrieven en afleveringsbewijzen.
- E-mail automatisering - neem het bericht en de bijlagen in, extraheer, lever via webhook.
Beveiliging, GDPR en EU Data Residency
Parseur wordt in de EU gehost: klantgegevens worden verwerkt en opgeslagen in de Europese Unie, en het datacenter is ISO 27001 gecertificeerd. Dat is een toezegging van data residency, wat iets anders en sterker is dan een GDPR-compliance badge.
Parseur sluit aan bij de EU GDPR, UK GDPR, California CCPA/CPRA en Singapore PDPA. Klantdocumenten worden nooit hergebruikt om de AI-modellen van Parseur te trainen en worden nooit verkocht. Retentie is configureerbaar, dus documenten kunnen automatisch worden verwijderd op basis van een termijn die jij instelt. SOC 2 Type II en HIPAA complianceprogramma's zijn in volle gang, wat betekent dat geen van beide vandaag de dag is gecertificeerd.
Als residency een harde eis is, accepteer dan nooit "EU hosted" zonder te vragen waar vier specifieke dingen gebeuren: inferentie, tijdelijke cache, back-ups, en logs die documentinhoud bevatten. Een EU-database die vóór een Amerikaans inferentie-endpoint staat, is geen EU residency, en het is een veelvoorkomende vorm. Onze 12 vragen die een 'no-training'-claim testen voert dezelfde oefening uit voor modeltraining.
Document Extractie API's en LLM's: Overhandig Nooit de Ruwe PDF
Taalmodellen zijn buitengewoon in redeneren en onbetrouwbaar in het lezen van een PDF. Richt er een op een gescande factuur en het retourneert met volmaakte kalmte een totaal dat niet op de pagina staat. Een document extractie API produceert de basiswaarheid (ground truth). Het model werkt daar bovenop.
De werkverdeling die werkt: de API haalt factuurnummer, datums, totalen en line items op met betrouwbaarheidsscores, waarna het model de dingen doet waar modellen goed in zijn, zoals "01/03/25" omzetten in 2025-03-01, het documenttype taggen, en velden mappen in jouw interne taxonomie. Schemavalidatie zit onder beide en vangt op wat geen van beiden alleen opmerkt.
Een AI-agent heeft dezelfde discipline nodig. Deze is slechts zo goed als de data die hem wordt overhandigd, en een gehallucineerd line item wordt een echte inkooporder met een echte betaling erachter. Voor het bredere plaatje is de complete gids over data extractie API's de pilaar waar deze pagina onder valt.
Ga Nu Wat Vendors Kapot Maken
De beste document extractie API is niet degene met de langste featurelijst, het is degene die jouw lelijkste 10% van de documenten overleeft zonder een persoon in de loop. Bouw de testset, scoor de velden die geld kosten als ze verkeerd zijn, en tel hoeveel documenten aan de andere kant ongeschonden naar buiten komen. Test het ook op ons, in de volgorde die jij wilt.
Al het andere is een datasheet.
Laatst bijgewerkt op




