Document Extractie API - Elke Vendor Wint Zijn Eigen Demo

Belangrijkste punten:

  • Een document extractie API geeft jou gelabelde velden, tabellen en line items uit een PDF, scan of e-mail. OCR geeft jou tekens en laat de betekenis aan jou over.
  • Template-gebaseerde en AI-gestuurde extractie zijn verschillende producten. Templates breken wanneer een leverancier het totaal verplaatst, AI-extractie leest layouts die het nog nooit heeft gezien.
  • Beoordeel vendors op veldniveau nauwkeurigheid met jouw eigen documenten. Het getal op hun datasheet is gemeten op die van hen.
  • Parseur levert een developer API en een webapp die jouw operationele team kan beheren, zodat niemand de reviewtool hoeft te bouwen.
  • Parseur wordt in de EU gehost, met gegevens die worden verwerkt en opgeslagen in de Europese Unie en nooit worden gebruikt om AI-modellen te trainen.

Een document extractie API is een dienst die een bestand zoals een PDF, een gescande afbeelding of een e-mail neemt en gestructureerde data zoals JSON of CSV retourneert. In tegenstelling tot ruwe OCR, die platte tekst retourneert en het aan jou overlaat om de betekenis erin te vinden, identificeert en behoudt een document extractie API structuur: key-value paren, tabellen, line items en gelabelde velden.

Drie buren worden ermee verward. Publieke data API's geven je een dataset die iemand anders al heeft samengesteld. Web scraping API's halen op wat er op een webpagina staat. OCR-engines? Tekens, geen structuur. Een document extractie API werkt op jouw documenten, de documenten die al in een inbox zitten, en zet ze om in data waar een systeem actie op kan ondernemen. Sommige vendors verkopen hetzelfde onder de naam 'document understanding API' of leveren het als een document extractie SDK. Ander label, zelfde taak. Nog steeds aan het uitzoeken welk probleem jij hebt? We hebben document parsing en web scraping naast elkaar gezet.

Volgens Research and Markets wordt de markt voor intelligente documentverwerking, die document extractie API's omvat, gewaardeerd op ongeveer $3,01 miljard en wordt verwacht dat deze groeit met een CAGR van 31,7%. Dat getal is in feite een telling van facturen, afschriften en formulieren, en elk daarvan moet ergens door worden gelezen. In veel bedrijven is dat "iets" nog steeds een persoon met een tweede monitor en een numeriek toetsenbord.

Snelle voorbeelden:

  • PDF factuur → JSON met headervelden en een line-item array
  • Onboarding formulier → gelabelde key-value paren (naam, adres, handtekening)
  • Bankafschrift → transactietabel geëxporteerd naar CSV

Vijf Soorten Vendors met Hetzelfde Label

Zoek op "document extractie API" en je krijgt een dozijn vendors die een categorie delen en bijna niets anders. Ze concurreren niet echt met elkaar, omdat ze gebouwd zijn voor vijf verschillende taken. Ieder van hen zal zijn eigen demo winnen, dus de rij telt zwaarder dan de pitch. Bepaal in welke rij jij thuishoort voordat je één call boekt.

Soort vendor Voorbeelden Gebouwd voor Wat je zelf nog moet bouwen
Cloud bouwblokken Google Document AI, Azure Document Intelligence, AWS Textract Teams die al gestandaardiseerd zijn op die cloud en extractie willen als één van vele diensten Inname, reviewschermen, uitzonderingsbeheer, retries, ERP posting
AP automation platforms Rossum, Nanonets Financiële teams die de hele factuurworkflow willen, niet alleen de velden Weinig te bouwen, mits hun workflow dicht genoeg bij die van jou ligt
Developer-first parsing API's Mindee, Veryfi, Parseur Engineers die de workflow bezitten en schone JSON willen Varieert per vendor. Parseur levert de review app mee
AI-native document parsers LlamaParse, Reducto RAG- en agent-pipelines die meer behoefte hebben aan trouwe structuur dan aan zakelijke velden Veldmapping, validatie, alles wat lijkt op een workflow
Enterprise IDP suites ABBYY, Hyperscience, UiPath Gereguleerde, grote volumeoperaties met menselijke review en legacysystemen Weinig te bouwen. Het werk verplaatst zich naar configuratie en uitrol

Twee kanttekeningen bij die tabel. Ten eerste lopen de rijen in elkaar over: verschillende vendors zitten in twee rijen. Ten tweede staat Parseur in rij drie omdat dat de taak is waarvoor het is gebouwd: e-mails en operationele documenten omzetten in gestructureerde JSON met een app die jouw operationele team daadwerkelijk kan gebruiken. Als jouw documenten technische tekeningen zijn, past rij vier beter dan wij, en dat vertellen we je liever nu dan tijdens een proefperiode.

Template-gebaseerde vs AI-gestuurde Extractie (Slechts Eén Slaagt op Schaal)

Template-gebaseerde extractie vindt een veld door zijn positie op de pagina. AI-gestuurde extractie vindt het door de betekenis ervan. Dat is het hele verschil, en het bepaalt voor hoeveel werk jij je inschrijft.

Een template zegt: het factuurnummer staat 40mm van de bovenkant, 120mm van de linkerkant. Snel, deterministisch, heerlijk. Dit houdt stand tot de ochtend waarop een leverancier zijn factuur opnieuw ontwerpt, op welk moment het de verkeerde waarde retourneert, of helemaal niets, en iemand een ticket aanmaakt. Tweehonderd leveranciers, tweehonderd templates, één engineer die ze begrijpt.

AI-gestuurde extractie leest het document zoals een mens dat doet. Het vindt het totaal omdat het onder een regel staat die "Totaalbedrag" heet, rechtsonder, geformatteerd als valuta, en gelijk is aan de som erboven. Verplaats het, verander de stijl, vertaal de hele factuur naar het Duits. Nog steeds vindbaar.

Parseur draait twee AI-engines en geen templates: de Text AI-engine voor e-mails en tekstdocumenten, en de Vision AI-engine voor PDF's, scans en afbeeldingen. Je beschrijft de velden die je wilt hebben en extractie past zich aan per document in plaats van per layout, dus de setup bestaat uit minuten velddefinitie in plaats van weken templates bouwen.

De afweging is echt. AI-extractie is probabilistisch waar een template deterministisch is, wat de reden is waarom betrouwbaarheidsscores (confidence scores) bestaan, en waarom het evaluatiegedeelte hieronder meer tijd besteedt aan uitzonderingsbeheer dan aan accuraatheidsclaims.

Hoe een Document Extractie API Werkt, in Vijf Fasen

Vendors verschillen in de details, maar de document extractie pipeline heeft overal dezelfde vorm.

Waarom dit niet langer optioneel is: volume. Dream Factory citeert de veelgebruikte prognose dat wereldwijde data in 2025 de 175 zettabytes zou bereiken, een datum die nu achter ons ligt, en het aandeel daarvan dat binnenkomt als documenten in plaats van databaserijen is niet gekrompen. Handmatig overtypen kan dat niet aan. Een muur van templates ook niet.

Stap 1: Inname (Ingestion)

Hoe de vendor het ook noemt, dit is de document inname API: upload via HTTP, e-mail forwarding, of een webhook vanuit een ander systeem. E-mail is belangrijker dan het klinkt. Een groot deel van de zakelijke documenten raakt nooit een file picker aan, ze komen aan als bijlagen van een leverancier die nog nooit van jouw portal heeft gehoord.

Stap 2: AI OCR en layoutanalyse

AI OCR zet beeld- en scangedeeltes om in machine-leesbare tekst. Layoutanalyse bepaalt vervolgens de leesvolgorde, tekstblokken, regels, woorden en waar elk zich op de pagina bevindt. Dit is de stap die een moderne engine onderscheidt van eentje uit 2010: het produceert een structurele kaart, niet alleen tekens.

Stap 3: Parsing

  • Key-value paren: labels gekoppeld aan waarden, zoals "Factuurnummer: 12345".
  • Tabellen en line items: gereconstrueerde rijen en cellen, inclusief samengevoegde cellen (merged cells) en tabellen die over een pagina-einde heen doorlopen.
  • Classificatie: uitzoeken wat het document is voordat besloten wordt naar welke velden gezocht moet worden.

Stap 4: Post-processing

Datums, valuta en leveranciersnamen worden genormaliseerd naar consistente formaten. Het resultaat wordt gevalideerd tegen een JSON Schema of Pydantic model zodat een verkeerd opgemaakte payload jouw ERP nooit bereikt.

Stap 5: Levering

De API retourneert het resultaat synchroon voor kleine bestanden, of asynchroon met een webhook-callback voor alles wat groter is. Retries en idempotentie zijn wat dit betrouwbaar houdt bij grote volumes. Vraag naar beide voordat je tekent, niet na de eerste stille vrijdagavond.

Laat me de JSON Zien

Vendorpagina's praten over "gestructureerde output" zonder er ooit een te laten zien. Hier is de vorm waarin een inkomende factuur terug zou moeten komen, en de vorm die het waard is om van elke vendor te eisen:

{
  "document_type": "invoice",
  "supplier": { "name": "", "tax_id": "", "supplier_id": "" },
  "invoice": {
    "invoice_number": "",
    "invoice_date": "",
    "due_date": "",
    "currency": "",
    "po_number": ""
  },
  "amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
  "line_items": [
    {
      "description": "",
      "sku": "",
      "quantity": 0,
      "unit_price": 0,
      "line_total": 0
    }
  ],
  "confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}

Twee dingen daarin doen het meeste werk. line_items is een array, geen blob aan tekst, wat two-way en three-way matching mogelijk maakt. confidence is per veld, waardoor jij automatisch kunt beslissen of er een mens naar moet kijken.

Hoe je een Document Extractie API Kiest Zonder de Demo te Vertrouwen

Checklist voor het evalueren van een document extractie API op jouw eigen documenten
Document Extraction API Checklist

Elke vendor wint zijn eigen demo, want elke vendor heeft de documenten ervoor geselecteerd. De enige evaluatie die de productie voorspelt, is de evaluatie die jij uitvoert op jouw documenten.

1. Bouw de testset voordat je met iemand praat

Haal 200 tot 500 echte documenten uit je afgelopen drie maanden, gewogen zoals je inbox daadwerkelijk is:

  • ~70% jouw veelvoorkomende leveranciersformaten
  • ~20% long-tail leveranciers die je één keer per kwartaal ziet
  • ~10% de exemplaren die dingen kapot maken: slechte scans, handgeschreven notities, tabellen van meerdere pagina's, creditnota's, vreemde valuta, twee inkooporders (PO's) op één factuur

Laat de identieke set door elke kandidaat lopen. Laat een vendor nooit de steekproef kiezen.

2. Scoor velden, geen documenten

Nauwkeurigheid op documentniveau verbergt de fouten die je geld kosten. Scoor elk veld afzonderlijk en weeg het op basis van hoeveel een fout pijn doet:

Veld Waarom het uitmaakt
Factuurnummer, leveranciers-ID Duplicaatdetectie en matching breken zonder deze
Totaal, btw, valuta Verkeerd hier betekent verkeerde betalingen
PO nummer De haak voor two-way en three-way matching
Line item kwantiteit en stukprijs Waar de meeste engines daadwerkelijk falen
Datums Goedkoop om te repareren, duur om te missen

3. Het getal dat je moet volgen is straight-through processing

Tel de documenten die van binnenkomst naar geboekt gaan zonder dat iemand ze aanraakt. Bij 5.000 documenten per maand is de kloof tussen 90% en 96% straight-through processing 300 documenten die iemand handmatig opent. Dat is geen metriek, dat is een functieomschrijving.

4. Line items zijn het breekpunt

Headervelden zijn makkelijk. Elke engine op de shortlist zal het factuurnummer vinden. Gooi er tabellen van meerdere pagina's, herhaalde headers, ingepakte omschrijvingen (wrapped descriptions), vracht- en kortingsrijen, btw per regel, negatieve credits en gemengde eenheden tegenaan voordat je ook maar één getal gelooft.

5. Vraag wie de uitzonderingen opruimt

Bestandsgrootte-limieten, asynchrone verwerking, webhook retries, idempotentie, rate limits, SDK-dekking en wat er gebeurt met een veld met een lage betrouwbaarheid. Vraag vervolgens wie de uitzonderingen beoordeelt. Als het antwoord is "jouw engineers, in een tool die jij bouwt", dan is de prijs op de datasheet niet de werkelijke prijs. Parseur's eigen cijfers voor die lijst staan in de API documentatie, en het antwoord op de laatste vraag is de webapp, niet jouw sprint.

Wat een Document Extractie API Echt Kost

Prijsmodellen verschillen meer dan de marketing doet vermoeden, en de vorm telt zwaarder dan het tarief.

  • Per pagina: goedkoopst bij korte documenten, pijnlijk bij lange. Een contract van 40 pagina's kost 40 keer zoveel als een bonnetje van één pagina voor dezelfde enkele set velden.
  • Per document: voorspelbaar per bestand, maar premium functies zoals custom modellen, handschrift of query-gebaseerde extractie worden vaak extra in rekening gebracht.
  • Abonnement op basis van volume: een vast maandelijks tarief voor een aantal documenten, aantal pagina's irrelevant.

Parseur gebruikt de derde. Een lange PDF en een korte e-mail kosten hetzelfde, wat de rekening voorspelbaar houdt wanneer jouw documentmix dat niet is. De huidige pakketten staan op de prijzenpagina.

De kosten die niemand noemt, zijn de engineering rondom de API: post-processing logica, een review-interface, retry handling, monitoring voor drift in extractie. Die rekening is meestal hoger dan de API-rekening, en dat is het deel dat de Parseur webapp doet verdwijnen.

Een PDF Parsen Naar JSON Met de Parseur API

Vijf stappen van PDF upload naar geparste JSON op je webhook
Parsing PDFs Using Parseur API

Het hele traject van de PDF extractie API, van upload tot webhook, in vijf stappen.

Base URL: https://api.parseur.com/

1. Authenticatie

Vind jouw API key in de API-sectie van je Parseur-account en stuur deze mee in de Authorization header bij elk verzoek:

Authorization: <JOUW_API_KEY>

Volledige details staan in de Authenticatie Gids.

2. Zoek of maak een mailbox aan

Een mailbox is de container die jouw documenten en de velden die je geëxtraheerd wilt hebben, vasthoudt. Maak er een aan in de app, lijst vervolgens je mailboxen op om de ID te krijgen:

curl -X GET "https://api.parseur.com/parser" \
  -H "Authorization: <JOUW_API_KEY>" \
  --compressed

De mailbox ID verschijnt ook in de mailbox URL in de app, en in het id veld van de create-mailbox response.

3. Upload een document

cURL:

curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
  -H "Authorization: <JOUW_API_KEY>" \
  -F "file=@./invoice.pdf" \
  --compressed

Python:

import requests

url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<JOUW_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}

response = requests.post(url, headers=headers, files=files)
print(response.json())

Node.js:

import fetch from "node-fetch"
import fs from "fs"

const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<JOUW_API_KEY>" }

const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))

const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())

Documenten kunnen ook per e-mail worden doorgestuurd in plaats van via upload. Zie E-mails en Documenten Uploaden voor beide routes.

4. Ontvang je data terug

Configureer een webhook op de mailbox en de geparste JSON belandt op jouw endpoint op het moment dat de verwerking klaar is. In productie is dit de juiste standaard: geen polling, geen cron, geen documenten die verloren gaan tussen checks door.

Alternatieven als een webhook geen optie is:

  • Automatisering platforms: Zapier, Make, n8n of Power Automate.
  • Polling: GET /document/{id} voor de geparste JSON.
  • Exports: CSV, JSON of Excel downloads vanuit de mailbox.

5. Valideren en afstellen

Het Parseur dashboard toont document- en webhooklogs, zodat je precies kunt zien wat er is geëxtraheerd en wat er is geleverd. Wanneer een veld verkeerd terugkomt, pas het dan daar aan in plaats van het te patchen in je codebase.

Wat Parseur Extraheert, en Wat Het Nog Steeds Niet Kan

Parseur is een document extractie API gebouwd rondom één idee: het document mag geen voorbereiding nodig hebben voordat de software het kan lezen. Het heeft sinds 2016 meer dan 100 miljoen documenten verwerkt.

  • Key-value paren en formulieren: namen, adressen, totalen, factuurnummers en referentie-ID's in gelabelde velden.
  • Tabellen en line items: factuurregels, transacties op bankafschriften, verzendmanifesten, inclusief tabellen die over meerdere pagina's doorlopen. AI tabelextractie behandelt hoe dat werkt.
  • Scans en foto's: de Vision AI-engine leest gescande en gefotografeerde documenten direct, niet alleen digitale PDF's.
  • E-mails en bijlagen: een Parseur specialiteit. De e-mail zelf is een document, en dat geldt ook voor alles wat eraan is bijgevoegd.
  • Layoutelementen: koppen, alinea's en selectievakjes waar je ze nodig hebt.

Waar het nog steeds moeilijk is: compact handschrift en handtekeningen. Die zijn in de hele categorie onopgelost, en aan elke vendor die het tegendeel beweert, zou de benchmark moeten worden gevraagd.

De meeste document extractie software stopt bij de API en laat de rest aan jou over. Parseur levert beide helften: de API voor jouw kant, en een webapp waar het operationele team velden definieert, documenten beoordeelt en resultaten corrigeert zonder een ticket aan te maken of te wachten op een sprint.

Waar teams het voor gebruiken

  • Crediteurenadministratie - facturen, bonnetjes en inkooporders in gestructureerde JSON, en daarna direct het ERP in.
  • Financiële Processen - bankafschriften en transactierapporten naar CSV of JSON voor reconciliatie.
  • Operations en Logistiek - pakbonnen, vrachtbrieven en afleveringsbewijzen.
  • E-mail automatisering - neem het bericht en de bijlagen in, extraheer, lever via webhook.

Beveiliging, GDPR en EU Data Residency

Parseur wordt in de EU gehost: klantgegevens worden verwerkt en opgeslagen in de Europese Unie, en het datacenter is ISO 27001 gecertificeerd. Dat is een toezegging van data residency, wat iets anders en sterker is dan een GDPR-compliance badge.

Parseur sluit aan bij de EU GDPR, UK GDPR, California CCPA/CPRA en Singapore PDPA. Klantdocumenten worden nooit hergebruikt om de AI-modellen van Parseur te trainen en worden nooit verkocht. Retentie is configureerbaar, dus documenten kunnen automatisch worden verwijderd op basis van een termijn die jij instelt. SOC 2 Type II en HIPAA complianceprogramma's zijn in volle gang, wat betekent dat geen van beide vandaag de dag is gecertificeerd.

Als residency een harde eis is, accepteer dan nooit "EU hosted" zonder te vragen waar vier specifieke dingen gebeuren: inferentie, tijdelijke cache, back-ups, en logs die documentinhoud bevatten. Een EU-database die vóór een Amerikaans inferentie-endpoint staat, is geen EU residency, en het is een veelvoorkomende vorm. Onze 12 vragen die een 'no-training'-claim testen voert dezelfde oefening uit voor modeltraining.

Document Extractie API's en LLM's: Overhandig Nooit de Ruwe PDF

Taalmodellen zijn buitengewoon in redeneren en onbetrouwbaar in het lezen van een PDF. Richt er een op een gescande factuur en het retourneert met volmaakte kalmte een totaal dat niet op de pagina staat. Een document extractie API produceert de basiswaarheid (ground truth). Het model werkt daar bovenop.

De werkverdeling die werkt: de API haalt factuurnummer, datums, totalen en line items op met betrouwbaarheidsscores, waarna het model de dingen doet waar modellen goed in zijn, zoals "01/03/25" omzetten in 2025-03-01, het documenttype taggen, en velden mappen in jouw interne taxonomie. Schemavalidatie zit onder beide en vangt op wat geen van beiden alleen opmerkt.

Een AI-agent heeft dezelfde discipline nodig. Deze is slechts zo goed als de data die hem wordt overhandigd, en een gehallucineerd line item wordt een echte inkooporder met een echte betaling erachter. Voor het bredere plaatje is de complete gids over data extractie API's de pilaar waar deze pagina onder valt.

Ga Nu Wat Vendors Kapot Maken

De beste document extractie API is niet degene met de langste featurelijst, het is degene die jouw lelijkste 10% van de documenten overleeft zonder een persoon in de loop. Bouw de testset, scoor de velden die geld kosten als ze verkeerd zijn, en tel hoeveel documenten aan de andere kant ongeschonden naar buiten komen. Test het ook op ons, in de volgorde die jij wilt.

Al het andere is een datasheet.

Maak een gratis account aan
Bespaar tijd en moeite met Parseur. Automatiseer je documenten.

Laatst bijgewerkt op

Aan de slag

Klaar om je data-extractie
uit documenten te automatiseren?

Start gratis in een paar minuten en ontdek hoe Parseur in jouw workflow past.

Geen modeltraining nodig
Automatiseert data-invoer uit elk document
Schaalbaar van point-and-click tot API

Veelgestelde Vragen

De vragen die engineers daadwerkelijk stellen tussen de eerste API call en de uitrol in productie.

Een typische pipeline heeft vijf fasen: inname (ingestion), AI OCR en layoutanalyse, het parsen van key-value paren en tabellen, post-processing voor normalisatie en validatie, en gestructureerde levering via webhook of export. Moderne API's voeren ze alle vijf automatisch uit, zonder eerst een template te hoeven bouwen.

Template-gebaseerde extractie matcht velden op basis van positie, dus het werkt totdat een leverancier zijn totaal twee centimeter naar links verplaatst. AI-gestuurde extractie leest het document op de manier waarop een mens dat doet, en identificeert het totaal vanwege de omgeving in plaats van waar het staat. Het praktische verschil is zichtbaar in de long tail: templates vereisen één setup per layout, AI-extractie kan layouts verwerken die het nog nooit heeft gezien.

Verzamel 200 tot 500 van jouw echte documenten, gewogen zoals je inbox daadwerkelijk is: ongeveer 70% veelvoorkomende formaten, 20% long-tail leveranciers, 10% echt lelijke randgevallen. Laat dezelfde set door elke kandidaat lopen en scoor veld voor veld, niet document per document. Laat een vendor nooit de steekproef kiezen.

Bouw als jouw documenten schaars, stabiel en door machines gegenereerd zijn. Koop op het moment dat de layouts variëren, want de kosten zitten nooit in de parser, maar in het onderhoud. Elk nieuw formaat van een leverancier wordt een ticket, en de engineer die het schreef wordt de enige persoon die het kan repareren.

De eerste succesvolle API call is een middagwerk. Productie is alles eromheen: het veldschema, het uitzonderingspad wanneer de betrouwbaarheid is laag, en iemand die eigenaar is van de webhook wanneer deze om 2 uur 's nachts faalt. Template-gebaseerde tools voegen daar bovenop één setup per layout toe, wat een project van twee weken verandert in een project van twee kwartalen. Vraag elke vendor om een tijdlijn die ook de reviewstap omvat, niet alleen de eerste 200 response.

Ja. Asynchrone verwerking, webhooks, retries en batchbewerkingen maken duizenden documenten per dag routine. De beperking bij schaalvergroting is zelden de doorvoer, het is het foutpercentage, en dat is een vraagstuk over personeelsbezetting in plaats van infrastructuur.

De extractie API levert de basiswaarheid (ground truth), en de LLM redeneert erover. Een ruwe PDF aan een taalmodel voeren, leidt tot verwarring over de layout en verzonnen waarden. Extraheer eerst de gestructureerde velden, laat het model ze dan normaliseren, classificeren of verrijken, en een agent heeft iets betrouwbaars om op te handelen.

Vraag dit, en vraag naar de uitzonderingen. Parseur hergebruikt nooit klantgegevens om zijn modellen te trainen en verkoopt ze nooit. Talloze beleidslijnen beloven 'geen training', maar behouden wel het recht om te trainen op geanonimiseerde of geaggregeerde versies van dezelfde documenten. Zorg er dus voor dat die uitzondering benoemd en afgedicht wordt in het contract.

OCR beantwoordt "welke tekens staan er op deze pagina". Een document extractie API beantwoordt "welke waarden doen ertoe en hoe zijn ze gerelateerd". OCR geeft je een muur van tekst zonder structuur, dus jij moet nog steeds de logica schrijven die het factuurnummer vindt. Een extractie API retourneert gelabelde velden, line-item arrays en tabellen die je direct in een database kunt wegschrijven.

Goede API's doen dat, en het is belangrijker dan de algemene nauwkeurigheid. Een betrouwbaarheidsscore op veldniveau is wat jou in staat stelt om de 90% die zeker zijn automatisch goed te keuren en de rest naar een mens te sturen. Een vendor met 92% nauwkeurigheid en een goed gekalibreerde betrouwbaarheid is veiliger in productie dan één die 97% claimt en stilletjes faalt.

Dit is waar de meesten stukgaan, dus test het als eerste. Voor een tabel van meerdere pagina's moet de API een herhalende headerrij herkennen, de kolommapping over de paginagrens heen meenemen en een subtotaal niet als nog een line item behandelen. Headervelden zoals factuurnummer en totaal zijn in vergelijking hiermee eenvoudig, dus een vendor-demo die alleen dat laat zien, vertelt je niets.

Drie modellen domineren: per pagina, per document en een vast abonnement op basis van volume. Prijzen per pagina lijken het goedkoopst totdat er een contract van 40 pagina's binnenkomt, en premium functies zoals custom modellen of query-gebaseerde extractie worden vaak apart in rekening gebracht. Parseur rekent een abonnement op basis van documentvolume, dus een lange PDF kost hetzelfde als een korte.

Elke API die echt volume verwerkt, zou dat moeten doen. Grote bestanden worden in de wachtrij geplaatst en asynchroon verwerkt, en het resultaat wordt naar jouw endpoint gepusht in plaats van dat je erom moet pollen. Vraag specifiek naar het gedrag bij retries en idempotentie, want een webhook die één keer afgaat en het dan opgeeft, zal stilletjes documenten verliezen.

Crediteurenadministratie is de koploper qua volume, waaronder facturen, bonnetjes en inkooporders. Financiële operaties volgen met bankafschriften en transactierapporten, daarna logistiek met pakbonnen en vrachtbrieven, en vervolgens elke workflow waarbij het document als e-mailbijlage binnenkomt en in een systeem terecht moet komen.

Sommige wel, en het is de moeite waard dit los te zien van een algemene GDPR-claim. Parseur wordt in de EU gehost: gegevens worden verwerkt en opgeslagen in de Europese Unie, en het datacenter is ISO 27001 gecertificeerd. Vraag een vendor om hetzelfde zwart-op-wit, inclusief inferentie, cache, back-ups en logs, want een EU-database vóór een Amerikaans inferentie-endpoint is geen EU residency.

Een JSON schema is het contract tussen de extractie API en alles wat daarop volgt. Het valideert datatypen, vangt een datum op die als een string is aangekomen, en voorkomt dat een verkeerd opgemaakte payload jouw ERP bereikt. Bepaal het schema dat jij nodig hebt voordat je met vendors praat, en vraag hen vervolgens om precies datgene terug te sturen.