Dokumentextraktions-API - Varje leverantör vinner sin egen demo

Viktiga insikter:

  • Ett dokumentextraktions-API ger dig etiketterade fält, tabeller och rader från en PDF, skanning eller e-post. OCR ger dig tecken och överlåter innebörden till dig.
  • Mallbaserad och AI-driven extraktion är olika produkter. Mallar slutar fungera när en leverantör flyttar totalsumman, AI-extraktion läser layouter den aldrig har sett förut.
  • Bedöm leverantörer utifrån precision på fältnivå på dina egna dokument. Siffran i produktbladet mättes på deras egna.
  • Parseur levererar ett API för utvecklare och en webbapp som ditt driftteam kan hantera, så ingen behöver bygga ett eget granskningsverktyg.
  • Parseur driftas i EU, med data som bearbetas och lagras inom Europeiska unionen och aldrig används för att träna AI-modeller.

Ett dokumentextraktions-API är en tjänst som tar en fil, såsom en PDF, en inskannad bild eller ett e-postmeddelande, och returnerar strukturerad data som JSON eller CSV. Till skillnad från rå OCR, som returnerar ren text och låter dig hitta innebörden i den, upptäcker och bevarar ett dokumentextraktions-API strukturen: nyckel-värdepar, tabeller, radrader och etiketterade fält.

Tre besläktade tekniker förväxlas ofta med det. Offentliga data-API:er ger dig ett dataset som någon annan redan har sammanställt. Web scraping-API:er hämtar det som finns på en webbsida. OCR-motorer? Tecken, ingen struktur. Ett dokumentextraktions-API arbetar med dina dokument, de som redan ligger i en inkorg, och förvandlar dem till data som ett system kan agera på. Vissa leverantörer säljer samma sak under namnet dokumentförståelse-API (document understanding API) eller levererar det som en dokumentextraktions-SDK. Annan etikett, samma jobb. Fortfarande osäker på vilket problem du har? Vi jämför dokumenttolkning och web scraping sida vid sida.

Enligt Research and Markets värderas marknaden för intelligent dokumentbehandling, som inkluderar dokumentextraktions-API:er, till cirka 3,01 miljarder dollar och förväntas växa med en CAGR på 31,7 %. Den siffran är egentligen en räkning av fakturor, kontoutdrag och formulär, och varenda ett av dem måste läsas av någonting. På många företag är detta någonting fortfarande en person med en andra skärm och en knappsats.

Snabba exempel:

  • PDF-faktura → JSON med rubrikfält och en radarray
  • Onboarding-formulär → etiketterade nyckel-värdepar (namn, adress, signatur)
  • Kontoutdrag → transaktionstabell exporterad till CSV

Fem typer av leverantörer under samma etikett

Sök på "dokumentextraktions-API" och du får fram ett dussin leverantörer som delar kategori men nästan inget annat. De konkurrerar egentligen inte med varandra, eftersom de är byggda för fem olika jobb. Varenda en av dem kommer att vinna sin egen demo, så vilken rad du tittar på spelar större roll än säljsnacket. Ta reda på vilken rad du tillhör innan du bokar ett enda samtal.

Typ av leverantör Exempel Byggd för Vad du fortfarande måste bygga själv
Molnbyggstenar Google Document AI, Azure Document Intelligence, AWS Textract Team som redan standardiserat på det molnet och vill ha extraktion som en tjänst bland många Inläsning, granskningsskärmar, undantagshantering, omförsök, ERP-postering
Plattformar för AP-automatisering Rossum, Nanonets Ekonomiteam som vill ha hela fakturaflödet, inte bara fälten Lite att bygga, om deras arbetsflöde är tillräckligt likt ditt
Utvecklarfokuserade tolknings-API:er Mindee, Veryfi, Parseur Ingenjörer som äger arbetsflödet och vill ha ren JSON ur det Varierar beroende på leverantör. Parseur inkluderar granskningsappen
AI-inbyggda dokumenttolkare LlamaParse, Reducto RAG- och agentpipelines som behöver trogen struktur mer än affärsfält Fältmappning, validering, allt som liknar ett arbetsflöde
Enterprise IDP-sviter ABBYY, Hyperscience, UiPath Reglerade verksamheter med stora volymer, mänsklig granskning och äldre system Lite att bygga. Arbetet flyttas till konfiguration och utrullning

Två reservationer till den tabellen. För det första suddas raderna ut: flera leverantörer sitter i två. För det andra är Parseur på rad tre eftersom det är jobbet det är byggt för, att förvandla e-post och operativa dokument till strukturerad JSON med en app som ditt driftteam faktiskt kan hantera. Om dina dokument är tekniska ritningar är rad fyra en bättre passform än vi, och vi vill hellre berätta det för dig nu än under en testperiod.

Mallbaserad vs AI-driven extraktion (Endast en av dem skalar)

Mallbaserad extraktion hittar ett fält genom dess position på sidan. AI-driven extraktion hittar det genom dess innebörd. Det är hela skillnaden, och det avgör hur mycket arbete du binder upp dig för.

En mall säger: fakturanumret finns 40 mm från toppen, 120 mm från vänster. Snabbt, deterministiskt, underbart. Det fungerar ända fram till den morgon en leverantör designar om sin faktura, varpå den returnerar fel värde, eller ingenting, och någon öppnar ett ärende. Tvåhundra leverantörer, tvåhundra mallar, en ingenjör som förstår dem.

AI-driven extraktion läser dokumentet på det sätt en människa gör. Den hittar totalsumman eftersom den sitter under en rad som heter "Att betala", nere till höger, är formaterad som valuta och är lika med summan ovanför den. Flytta den, ändra stil på den, översätt hela fakturan till tyska. Fortfarande hittbar.

Parseur kör två AI-motorer och inga mallar: Text AI-motorn för e-post och textdokument, Vision AI-motorn för PDF:er, skanningar och bilder. Du beskriver fälten du vill ha och extraktionen anpassar sig per dokument istället för per layout, så installationen består av minuter av fältdefinition istället för veckor av mallbygge.

Avvägningen är verklig. AI-extraktion är probabilistisk där en mall är deterministisk, vilket är anledningen till att konfidensvärden existerar, och varför utvärderingsavsnittet nedan ägnar mer tid åt undantagshantering än åt precisionspåståenden.

Hur ett dokumentextraktions-API fungerar, i fem steg

Leverantörer skiljer sig åt i detaljerna, men dokumentextraktions-pipelinen har samma struktur överallt.

Varför detta slutade vara valfritt: volym. Dream Factory citerar den allmänt citerade prognosen att global data skulle nå 175 zettabyte år 2025, ett datum som nu ligger bakom oss, och andelen som anländer som dokument snarare än databasrader har inte krympt. Manuell inmatning skalar inte till det. Det gör inte heller en vägg av mallar.

Steg 1: Inläsning

Oavsett vad leverantören kallar det, är detta dokumentinläsnings-API:et: uppladdning via HTTP, e-postvidarebefordran eller en webhook från ett annat system. E-post spelar större roll än det låter. En stor andel affärsdokument rör aldrig en filväljare, de anländer som bilagor från en leverantör som aldrig har hört talas om din portal.

Steg 2: AI OCR och layoutanalys

AI OCR konverterar bilder och skannat innehåll till maskinläsbar text. Layoutanalys räknar sedan ut läsordning, textblock, rader, ord och var och en sitter på sidan. Detta är steget som skiljer en modern motor från en från 2010: den producerar en strukturell karta, inte bara tecken.

Steg 3: Parsing

  • Nyckel-värdepar: etiketter matchade mot värden, såsom "Fakturanummer: 12345".
  • Tabeller och rader (line items): rader och celler som återskapas, inklusive sammanslagna celler, spann och tabeller som fortsätter över en sidbrytning.
  • Klassificering: att räkna ut vad dokumentet är innan man bestämmer vilka fält man ska leta efter.

Steg 4: Efterbearbetning

Datum, valutor och leverantörsnamn normaliseras till konsekventa format. Resultatet valideras mot ett JSON-schema eller en Pydantic-modell så att en felformaterad payload aldrig når ditt ERP-system.

Steg 5: Leverans

API:et returnerar resultatet synkront för små filer, eller asynkront med ett webhook-anrop för något större. Omförsök (retries) och idempotens är det som håller detta pålitligt vid stora volymer. Fråga om båda innan du skriver på, inte efter den första tysta fredagskvällen.

Visa mig JSON-koden

Leverantörssidor pratar om "strukturerad utdata" utan att någonsin visa en. Här är formatet som en leverantörsfaktura bör returneras i, och formatet som det är värt att kräva att varje leverantör matchar:

{
  "document_type": "invoice",
  "supplier": { "name": "", "tax_id": "", "supplier_id": "" },
  "invoice": {
    "invoice_number": "",
    "invoice_date": "",
    "due_date": "",
    "currency": "",
    "po_number": ""
  },
  "amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
  "line_items": [
    {
      "description": "",
      "sku": "",
      "quantity": 0,
      "unit_price": 0,
      "line_total": 0
    }
  ],
  "confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}

Två saker där i gör det mesta av arbetet. line_items är en array, inte en klump av text, vilket är det som gör tvåvägs- och trevägsmatchning möjlig. confidence är per fält, vilket är det som låter dig automatiskt besluta om en människa behöver titta på det.

Hur man väljer ett dokumentextraktions-API utan att lita på demon

Checklist for evaluating a document extraction API on your own documents
Document Extraction API Checklist

Varje leverantör vinner sin egen demo, eftersom varje leverantör valde dokumenten i den. Den enda utvärderingen som förutsäger produktion är den du kör på dina egna.

1. Bygg testuppsättningen innan du pratar med någon

Dra 200 till 500 riktiga dokument från dina senaste tre månader, viktade på det sätt som din inkorg faktiskt ser ut:

  • ~70 % dina vanliga leverantörsformat
  • ~20 % sällsynta leverantörer du ser en gång i kvartalet
  • ~10 % de som förstör saker: dåliga skanningar, handskrivna anteckningar, flersidiga tabeller, krediteringar, utländsk valuta, två inköpsordrar på en faktura

Kör den identiska uppsättningen genom varje kandidat. Låt aldrig en leverantör välja urvalet.

2. Poängsätt fält, inte dokument

Noggrannhet på dokumentnivå döljer de misslyckanden som kostar dig pengar. Poängsätt varje fält separat och vikta det efter hur mycket ett misstag kostar:

Fält Varför det spelar roll
Fakturanummer, leverantörs-ID Dubblettdetektering och matchning bryter ihop utan dem
Total, moms, valuta Fel här betyder felaktiga betalningar
Inköpsordernummer (PO) Kroken för tvåvägs- och trevägsmatchning
Kvantitet och styckpris på rader Där de flesta motorer faktiskt misslyckas
Datum Billiga att åtgärda, dyra att missa

3. Siffran att spåra är straight-through processing (STP)

Räkna de dokument som går från ankomst till bokförda utan att någon rör dem. Vid 5 000 dokument i månaden är klyftan mellan 90 % och 96 % automatisk hantering 300 dokument som någon öppnar för hand. Det är inte ett mätvärde, det är en arbetsbeskrivning.

4. Det är vid raderna det spricker

Rubrikfält är enkla. Varje motor på kortlistan kommer att hitta fakturanumret. Kasta in flersidiga tabeller, upprepade rubriker, radbrutna beskrivningar, frakt- och rabattrader, skatt per rad, negativa krediteringar och blandade enheter innan du tror på en enda siffra.

5. Fråga vem som rensar upp undantagen

Filstorleksgränser, asynkron bearbetning, webhook-omförsök, idempotens, hastighetsbegränsningar (rate limits), SDK-täckning, och vad som händer med ett fält med lågt konfidensvärde. Fråga sedan vem som granskar undantagen. Om svaret är "dina ingenjörer, i ett verktyg ni bygger", är priset i produktbladet inte det verkliga priset. Parseurs egna siffror för den listan finns i API-dokumentationen, och svaret på den sista frågan är webbappen, inte din utvecklingssprint.

Vad ett dokumentextraktions-API egentligen kostar

Prismodeller skiljer sig mer än marknadsföringen antyder, och modellen spelar större roll än taxan.

  • Per sida: billigast för korta dokument, bestraffande för långa. Ett 40-sidigt avtal kostar 40 gånger mer än ett ensidigt kvitto för samma enda uppsättning fält.
  • Per dokument: förutsägbart per fil, men premiumfunktioner som anpassade modeller, handstil eller frågebaserad extraktion debiteras ofta extra.
  • Abonnemang per volym: ett fast månadspris för en dokumentkvot, sidantalet är irrelevant.

Parseur använder den tredje. En lång PDF och ett kort e-postmeddelande kostar lika mycket, vilket håller notan förutsägbar när din dokumentmix inte är det. Aktuella nivåer finns på prissättningssidan.

Kostnaden som ingen citerar är ingenjörsarbetet runt API:et: efterbearbetningslogik, ett gränssnitt för granskning, omförsökshantering, övervakning av extraktionsdrift. Den räkningen är vanligtvis större än API-räkningen, och det är den delen som Parseurs webbapp finns till för att radera.

Tolka en PDF till JSON med Parseur API

Five steps from PDF upload to parsed JSON on your webhook
Parsing PDFs Using Parseur API

Hela vägen för PDF-extraktions-API:et, från uppladdning till webhook, i fem steg.

Bas-URL: https://api.parseur.com/

1. Autentisera

Hitta din API-nyckel i API-sektionen på ditt Parseur-konto och skicka den i Authorization-headern vid varje begäran:

Authorization: <YOUR_API_KEY>

Fullständiga detaljer finns i autentiseringsguiden.

2. Hitta eller skapa en postlåda

En postlåda (mailbox) är behållaren som rymmer dina dokument och fälten du vill extrahera. Skapa en i appen, och lista sedan dina postlådor för att få dess ID:

curl -X GET "https://api.parseur.com/parser" \
  -H "Authorization: <YOUR_API_KEY>" \
  --compressed

Postlåde-ID:t visas också i postlådans URL i appen, och i id-fältet i svaret när du skapar en postlåda.

3. Ladda upp ett dokument

cURL:

curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
  -H "Authorization: <YOUR_API_KEY>" \
  -F "file=@./invoice.pdf" \
  --compressed

Python:

import requests

url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<YOUR_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}

response = requests.post(url, headers=headers, files=files)
print(response.json())

Node.js:

import fetch from "node-fetch"
import fs from "fs"

const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<YOUR_API_KEY>" }

const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))

const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())

Dokument kan också anlända via vidarebefordrad e-post i stället för uppladdning. Se Ladda upp e-post och dokument för båda ruttarna.

4. Hämta din data

Konfigurera en webhook på postlådan så landar den tolkade JSON-koden på din endpoint i samma ögonblick som bearbetningen är klar. I produktion är detta det rätta standardvalet: ingen polling, ingen cron, inga dokument förlorade mellan kontroller.

Alternativ när en webhook inte är ett alternativ:

  • Automatiseringsplattformar: Zapier, Make, n8n eller Power Automate.
  • Polling: GET /document/{id} för att hämta tolkad JSON.
  • Exporter: CSV, JSON eller Excel-nedladdningar från postlådan.

5. Validera och finjustera

Parseurs instrumentpanel visar dokument- och webhook-loggar, så att du exakt kan se vad som extraherades och vad som levererades. När ett fält kommer tillbaka fel, åtgärda det där istället för att patcha runt det i din kodbas.

Vad Parseur extraherar, och vad det fortfarande inte kan

Parseur är ett dokumentextraktions-API byggt kring en idé: dokumentet ska inte behöva förberedas innan mjukvaran kan läsa det. Det har bearbetat mer än 100 miljoner dokument sedan 2016.

  • Nyckel-värdepar och formulär: namn, adresser, totalsummor, fakturanummer och referens-ID:n till etiketterade fält.
  • Tabeller och rader: fakturarader, transaktioner på kontoutdrag, fraktlistor, inklusive tabeller som sträcker sig över flera sidor. AI-tabelextraktion beskriver hur det fungerar.
  • Skanningar och fotografier: Vision AI-motorn läser skannade och fotograferade dokument direkt, inte bara digitala PDF:er.
  • E-post och bilagor: en Parseur-specialitet. Själva e-postmeddelandet är ett dokument, och det är också allt som är bifogat det.
  • Layout-element: rubriker, stycken och markeringsrutor där du behöver dem.

Där det fortfarande är svårt: tät handstil och signaturer. Dessa är olösta över hela kategorin, och alla leverantörer som påstår motsatsen bör ombedjas att visa sitt benchmark.

De flesta program för dokumentextraktion stannar vid API:et och överlåter resten till dig. Parseur levererar båda halvorna: API:et för din sida, och en webbapp där driftteamet definierar fält, granskar dokument och korrigerar resultat utan att skapa ärenden eller vänta på en utvecklingssprint.

Var team använder det

  • Leverantörsreskontra - fakturor, kvitton och inköpsordrar till strukturerad JSON, sedan rakt in i ERP:t.
  • Finansiella processer - kontoutdrag och transaktionsrapporter till CSV eller JSON för avstämning.
  • Drift och logistik - packsedlar, fraktsedlar och följesedlar.
  • E-postautomatisering - ta emot meddelandet och dess bilagor, extrahera, leverera via webhook.

Säkerhet, GDPR och datalagring i EU

Parseur är driftat i EU: kunddata bearbetas och lagras i Europeiska unionen, och det underliggande datacentret är ISO 27001-certifierat. Det är ett åtagande om datalagring, vilket är en annorlunda och starkare sak än ett märke för GDPR-efterlevnad.

Parseur är i linje med EU GDPR, UK GDPR, California CCPA/CPRA och Singapore PDPA. Kunddokument återanvänds aldrig för att träna Parseurs AI-modeller och säljs aldrig. Lagringstiden är konfigurerbar, så dokument kan raderas automatiskt baserat på en tidsram du anger. Program för SOC 2 Type II och HIPAA-efterlevnad pågår, vilket innebär att ingetdera är certifierat idag.

Om lagringsplats är ett absolut krav, acceptera aldrig "Driftas i EU" utan att fråga var fyra specifika saker händer: inferens, temporär cache, säkerhetskopior och loggar som innehåller dokumentinnehåll. En EU-databas som sitter framför en amerikansk inferens-endpoint är inte EU-datalagring, och det är en vanlig uppsättning. Våra 12 frågor som testar ett påstående om att ingen träning sker utför samma övning för modellträning.

Dokumentextraktions-API:er och LLM:er: Överlämna aldrig rå-PDF:en

Språkmodeller är fantastiska på att resonera och opålitliga på att läsa en PDF. Peka en mot en inskannad faktura och den kommer att returnera en totalsumma som inte finns på sidan, med perfekt lugn. Ett dokumentextraktions-API producerar sanningen. Modellen arbetar ovanpå den.

Arbetsfördelningen som fungerar: API:et hämtar fakturanummer, datum, totalsummor och radrader med konfidensvärden, sedan gör modellen de saker som modeller är bra på, förvandlar "01/03/25" till 2025-03-01, taggar dokumenttypen, mappar fält i din interna taxonomi. Schemavalidering sitter under båda och fångar det som ingen av dem upptäcker ensam.

En AI-agent behöver samma disciplin. Den är bara så bra som den data som överlämnas till den, och en hallucinerad rad blir en verklig inköpsorder med en verklig betalning bakom sig. För den bredare bilden är den kompletta guiden till dataextraktions-API:er den pelare som denna sida vilar på.

Gå nu och testa leverantörerna till bristningsgränsen

Det bästa dokumentextraktions-API:et är inte det med den längsta funktionslistan, det är det som överlever dina 10 % fulaste dokument utan en människa i loopen. Bygg testuppsättningen, poängsätt fälten som kostar pengar när de är fel, och räkna hur många dokument som kommer ut på andra sidan orörda. Kör det mot oss också, i vilken ordning du vill.

Allt annat är ett produktblad.

Skapa ditt gratis konto
Spara tid och ansträngning med Parseur. Automatisera dina dokument.

Senast uppdaterad

Kom igång

Redo att automatisera er
datautvinning ur dokument?

Skapa ett gratis konto på några minuter och se hur Parseur kan förenkla ert arbetsflöde.

Ingen modellträning krävs
Byggt för verkliga arbetsflöden, inte för experiment
Från enkelt gränssnitt till full API-integration

Vanliga frågor

De frågor ingenjörer faktiskt ställer mellan det första API-anropet och produktionslanseringen.

En typisk pipeline har fem steg: inläsning, AI OCR och layoutanalys, extrahering av nyckel-värdepar och tabeller, efterbearbetning för normalisering och validering, och strukturerad leverans via webhook eller export. Moderna API:er kör alla fem automatiskt, utan någon mall att bygga i förväg.

Mallbaserad extraktion matchar fält utifrån position, så det fungerar tills en leverantör flyttar sin totalsumma två centimeter åt vänster. AI-driven extraktion läser dokumentet på det sätt som en människa gör, och identifierar totalsumman på grund av vad som omger den snarare än var den sitter. Den praktiska skillnaden visar sig i the long tail: mallar kräver en uppsättning per layout, AI-extraktion hanterar layouter den aldrig har sett förut.

Samla 200 till 500 av dina riktiga dokument, viktade på det sätt som din inkorg faktiskt ser ut: ungefär 70 % vanliga format, 20 % udda leverantörer, 10 % genuint svåra specialfall. Kör den identiska uppsättningen genom varje kandidat och poängsätt fält för fält, inte dokument för dokument. Låt aldrig en leverantör välja urvalet.

Bygg om dina dokument är få, stabila och maskingenererade. Köp direkt om layouterna varierar, eftersom kostnaden aldrig är tolken, det är underhållet. Varje nytt leverantörsformat blir ett ärende, och ingenjören som skrev koden blir den enda personen som kan fixa den.

Det första framgångsrika API-anropet tar en eftermiddag. Produktion är allt runt omkring det: fältschemat, undantagshanteringen när konfidensen är låg, och vem som tar hand om webhooken när den kraschar klockan 02:00. Mallbaserade verktyg lägger till en installation per layout utöver det, vilket är det som förvandlar ett tvåveckorsprojekt till ett halvårsprojekt. Fråga varje leverantör om en tidsplan som inkluderar granskningssteget, inte bara det första 200-svaret.

Ja. Asynkron bearbetning, webhooks, omförsök och batchåtgärder gör tusentals dokument om dagen till rutin. Begränsningen i stor skala är sällan genomströmning, det är felmarginalen (exception rate), och det är en personalfråga snarare än en infrastrukturfråga.

Extraktions-API:et tar fram grundfaktan (ground truth), och LLM:en resonerar över den. Att mata in en rå PDF i en språkmodell bjuder in layoutförvirring och påhittade värden. Extrahera de strukturerade fälten först, och låt sedan modellen normalisera, klassificera eller berika dem, så har agenten något pålitligt att agera på.

Fråga det, och fråga om undantagen. Parseur återanvänder aldrig kunddata för att träna sina modeller och säljer den aldrig. Många policyer lovar att ingen träning sker samtidigt som de förbehåller sig rätten att träna på anonymiserade eller aggregerade versioner av samma dokument, så se till att det undantaget namnges och stängs i avtalet.

OCR svarar på "vilka tecken finns på denna sida". Ett dokumentextraktions-API svarar på "vilka värden spelar roll och hur relaterar de till varandra". OCR ger dig en vägg av text utan struktur, så du måste fortfarande skriva logiken som hittar fakturanumret. Ett extraktions-API returnerar etiketterade fält, radarrayer och tabeller som du kan skriva rakt in i en databas.

De bra gör det, och det spelar större roll än övergripande noggrannhetssiffror. Ett konfidensvärde på fältnivå är det som låter dig auto-godkänna de 90 % som är säkra och skicka resten till en människa. En leverantör med 92 % noggrannhet med välkalibrerade konfidensvärden är säkrare i produktion än en som påstår sig ha 97 % men som misslyckas i tysthet.

Det är här de flesta av dem bryter ihop, så testa det först. En flersidig tabell kräver att API:et känner igen en upprepad rubrikrad, bär med sig kolumnmappningen över sidbrytningen och inte behandlar en delsumma som ytterligare en rad. Rubrikfält som fakturanummer och totalsumma är enkla i jämförelse, så en leverantörsdemo som bara visar dessa berättar ingenting för dig.

Tre modeller dominerar: per sida, per dokument och ett fast abonnemang per volym. Prissättning per sida ser billigast ut tills ett 40-sidigt avtal anländer, och premiumfunktioner som anpassade modeller eller frågebaserad extraktion faktureras ofta separat. Parseur tar betalt via ett abonnemang baserat på dokumentvolym, så en lång PDF kostar lika mycket som en kort.

Varje API som hanterar verklig volym bör göra det. Stora filer köas och bearbetas asynkront, och resultatet skickas (pushas) till din endpoint istället för att du måste polla efter det. Fråga specifikt om omförsöksbeteende (retries) och idempotens, eftersom en webhook som avfyras en gång och ger upp tyst kommer att förlora dokument.

Leverantörsreskontra leder vad gäller volym, vilket täcker fakturor, kvitton och inköpsordrar. Finansiella processer följer med kontoutdrag och transaktionsrapporter, därefter logistik med packsedlar och fraktsedlar, sedan vilket arbetsflöde som helst där dokumentet anländer som en e-postbilaga och måste hamna i ett system.

Vissa kan, och det är värt att skilja från ett generiskt GDPR-påstående. Parseur driftas i EU: data bearbetas och lagras i Europeiska unionen, och det underliggande datacentret är ISO 27001-certifierat. Be varje leverantör om samma sak skriftligt, som täcker inferens, cache, säkerhetskopior och loggar, eftersom en EU-databas framför en amerikansk inferens-endpoint inte är EU-datalagring.

Ett JSON-schema är kontraktet mellan extraktions-API:et och allt i efterled. Det validerar typer, fångar upp ett datum som anlände som en sträng och stoppar en felformaterad payload från att nå ditt ERP-system. Definiera schemat du behöver innan du pratar med leverantörer, och be sedan var och en av dem att returnera exakt det.