ドキュメント抽出API - どのベンダーも独自のデモでは勝利する

要点まとめ:

  • ドキュメント抽出APIは、PDF、スキャン、またはメールからラベル付きのフィールド、テーブル、明細行を提供します。OCRは文字を提供するだけで、意味付けはあなたに委ねられます。
  • テンプレートベースとAI駆動の抽出は異なる製品です。サプライヤーが合計金額の位置を移動するとテンプレートは壊れますが、AI抽出は見たことのないレイアウトも読み取ります。
  • 自身のドキュメントに対するフィールドレベルの精度でベンダーを判断してください。データシートの数字は彼らのドキュメントで測定されたものです。
  • Parseurは開発者向けAPIと、運用チームが実行できるWebアプリを提供するため、誰もレビューツールを構築する必要がありません。
  • ParseurはEUホスト型であり、データは欧州連合内で処理および保存され、AIモデルのトレーニングに使用されることはありません。

ドキュメント抽出APIは、PDFやスキャン画像、メールなどのファイルをJSONやCSVなどの構造化データへ変換するサービスです。プレーンテキストのみを返し、意味付けはユーザーに委ねる生のOCRとは異なり、ドキュメント抽出APIは構造を識別して保持します:キーバリューペア、テーブル、明細行、ラベル付きフィールドです。

3つの類似ツールがよく混同されます。パブリックデータAPIは、誰かがすでに組み立てたデータセットを渡します。WebスクレイピングAPIは、Webページ上にあるものを取得しに行きます。OCRエンジンは、文字だけで構造はありません。ドキュメント抽出APIは、受信トレイにすでにある_あなたの_ドキュメントを対象とし、システムが処理できるデータに変換します。一部のベンダーは、同じものをドキュメント理解APIという名前で販売したり、ドキュメント抽出SDKとして提供したりしています。ラベルは違っても、役割は同じです。まだ自分がどの問題を抱えているか見極めている段階ですか?ドキュメントのパースとWebスクレイピングを比較しています。

Research and Marketsによると、ドキュメント抽出APIを含むインテリジェントドキュメントプロセッシング市場は、約30億1千万ドルと評価され、年平均成長率(CAGR)31.7%で成長すると予測されています。 この数字は実際には請求書、明細書、フォームの数であり、そのすべてを「何か」が読み取る必要があります。多くの企業において、その「何か」は依然として、セカンドモニターとテンキーを持つ人間なのです。

クイック例:

  • PDFの請求書 → ヘッダーフィールドと明細行配列を含むJSON
  • オンボーディングフォーム → ラベル付きのキーバリューペア(氏名、住所、署名)
  • 銀行明細 → CSVにエクスポートされた取引テーブル

同じラベルを付けた5種類のベンダー

「ドキュメント抽出API」を検索すると、カテゴリを共有しているだけで他にほとんど共通点のない十数社のベンダーが見つかります。彼らは5つの異なるジョブのために構築されているため、実際には競合していません。どのベンダーも独自のデモで勝利を収めるため、ピッチよりもどの列に属しているかの方が重要です。電話予約をする前に、自分がどの列にいるかを見極めてください。

ベンダーの種類 対象者 自社で構築する必要があるもの
クラウドの構成要素 Google Document AI, Azure Document Intelligence, AWS Textract すでにそのクラウドを標準化しており、多くのサービスの一つとして抽出を行いたいチーム 取り込み、レビュー画面、例外処理、リトライ、ERPへの投稿
買掛金(AP)自動化プラットフォーム Rossum, Nanonets フィールドだけでなく請求書ワークフロー全体を求めている財務チーム 彼らのワークフローが自社のものと十分に近ければ、構築するものは少ない
開発者ファーストのパースAPI Mindee, Veryfi, Parseur ワークフローを所有し、クリーンなJSONを求めているエンジニア ベンダーによる。Parseurはレビューアプリを提供
AIネイティブのドキュメントパーサー LlamaParse, Reducto ビジネスフィールドよりも忠実な構造を必要とするRAGやエージェントパイプライン フィールドマッピング、検証、ワークフローの形をしたあらゆるもの
エンタープライズIDPスイート ABBYY, Hyperscience, UiPath 人間によるレビューとレガシーシステムを伴う、規制の厳しい大規模オペレーション 構築するものは少ない。作業は設定と展開に移行する

この表には2つの注意点があります。第一に、行の境界は曖昧です:いくつかのベンダーは2つの行にまたがっています。第二に、Parseurは3行目に位置しています。なぜなら、それがParseurの構築された目的であり、メールや業務ドキュメントを構造化されたJSONに変換し、運用チームが実際に実行できるアプリを提供するからです。もしあなたのドキュメントが設計図面であるなら、私たちよりも4行目のほうが適しています。私たちは、トライアル中ではなく今の段階でそれをお伝えしたいのです。

テンプレートベースとAI駆動の抽出(スケールするのはどちらか一方だけ)

テンプレートベースの抽出はページ上の位置によってフィールドを見つけます。AI駆動の抽出はその意味によって見つけます。 違いはそれだけであり、あなたがどれだけの作業を背負い込むかを決定します。

テンプレートはこう言います:請求書番号は上から40mm、左から120mmにあります。高速で、確定的で、素晴らしいです。これはサプライヤーが請求書を再設計する朝までは持ちこたえますが、その時点で間違った値を返すか、何も返さなくなり、誰かがチケットを起票することになります。200のサプライヤー、200のテンプレート、そしてそれらを理解しているエンジニアが1人。

AI駆動の抽出は、人が読むのと同じようにドキュメントを読み取ります。右下の「Amount due」という行の下にあり、通貨としてフォーマットされ、その上の合計と等しいため、合計金額を見つけ出します。移動させても、スタイルを変更しても、請求書全体をドイツ語に翻訳しても、依然として見つけることができます。

Parseurはテンプレートなしで2つのAIエンジンを実行します。メールやテキストドキュメント向けのText AIエンジンと、PDF、スキャン、画像向けのVision AIエンジンです。必要なフィールドを記述すれば、レイアウトごとではなくドキュメントごとに抽出が適応するため、セットアップは数週間のテンプレート構築ではなく、数分間のフィールド定義で済みます。

トレードオフは実在します。テンプレートが確定的であるのに対し、AI抽出は確率的です。これが信頼度スコアが存在する理由であり、以下の評価セクションが精度の主張よりも例外処理に多くの時間を費やしている理由です。

ドキュメント抽出APIの基本パイプライン(5つの段階)

ベンダーごとに詳細は異なりますが、ドキュメント抽出パイプラインの構造はどこも同じです。

なぜこれがオプションではなくなったのか:ボリュームのせいです。Dream Factoryは、世界のデータ量が2025年までに175ゼタバイトに達するという広く引用されている予測を挙げていますが、その年はすでに過ぎ去り、データベースの行ではなくドキュメントとして到着するデータの割合は縮小していません。手作業による入力はこれにスケールしません。テンプレートの壁も同様です。

ステップ1:取り込み

ベンダーが何と呼ぼうとも、これはドキュメント取り込みAPIです:HTTP経由のアップロード、メール転送、または別システムからのWebhook。メールは想像以上に重要です。ビジネス文書の大部分はファイルピッカーに触れることはなく、自社ポータルなど聞いたこともないサプライヤーから添付ファイルとして到着します。

ステップ2:AI OCRとレイアウト解析

AI OCRは画像やスキャンコンテンツを機械可読なテキストに変換します。その後、レイアウト解析によって読み取り順序、テキストブロック、行、単語、およびそれぞれのページ上の位置が算出されます。これが最新のエンジンと2010年のエンジンを分けるステップです。単なる文字だけでなく、構造マップを生成するのです。

ステップ3:パース処理

  • キーバリューペア(KVP)"請求書番号: 12345" のように、ラベルを値に一致させる。
  • テーブルと明細行:結合されたセル、スパン、改ページをまたいで続くテーブルを含め、行とセルを再構築する。
  • 分類:どのフィールドを探すか決定する前に、そのドキュメントが何であるかを判断する。

ステップ4:後処理

日付、通貨、業者名は一貫したフォーマットに正規化されます。結果はJSONスキーマやPydanticモデルと照らし合わせて検証されるため、不正な形式のペイロードがERPに到達することはありません。

ステップ5:配信

APIは小規模なファイルに対しては同期的に結果を返し、大規模なファイルに対してはWebhookコールバックで非同期的に結果を返します。リトライと冪等性こそが、大量処理時における信頼性を保つものです。最初の静かな金曜日の夜を迎える後ではなく、契約する前に両方について尋ねてください。

JSONを見せてください

ベンダーのページは「構造化された出力」について語りますが、実際にそれを見せることはありません。ここでは、サプライヤーの請求書が返ってくるべき形式と、すべてのベンダーに一致させる価値のある形式を紹介します:

{
  "document_type": "invoice",
  "supplier": { "name": "", "tax_id": "", "supplier_id": "" },
  "invoice": {
    "invoice_number": "",
    "invoice_date": "",
    "due_date": "",
    "currency": "",
    "po_number": ""
  },
  "amounts": { "subtotal": 0, "tax": 0, "freight": 0, "total": 0 },
  "line_items": [
    {
      "description": "",
      "sku": "",
      "quantity": 0,
      "unit_price": 0,
      "line_total": 0
    }
  ],
  "confidence": { "invoice_number": 0.98, "total": 0.99, "line_items": 0.91 }
}

ここにある2つの要素がほとんどの作業をこなします。line_itemsはテキストの塊ではなく配列であり、これによって2ウェイおよび3ウェイのマッチングが可能になります。confidenceはフィールドごとになっており、これによって人間が確認する必要があるかどうかを自動的に判断できます。

デモを信じずにドキュメント抽出APIを選ぶ方法

Checklist for evaluating a document extraction API on your own documents
Document Extraction API Checklist

どのベンダーも独自のデモで勝利を収めます。なぜなら、どのベンダーもそこにあるドキュメントを自ら選んだからです。本番環境を予測できる唯一の評価は、あなた自身のドキュメントで実行する評価です。

1. 誰かと話す前にテストセットを構築する

過去3ヶ月の中から200〜500件の実際のドキュメントを抽出し、実際の受信トレイと同じ比率で重み付けします:

  • 約70% 一般的なサプライヤーのフォーマット
  • 約20% 四半期に一度目にするロングテールのサプライヤー
  • 約10% 問題を起こすもの:画質の悪いスキャン、手書きのメモ、複数ページのテーブル、クレジット、外貨、1枚の請求書に2つの注文書

すべての候補にまったく同じセットを実行します。決してベンダーにサンプルを選ばせてはいけません。

2. ドキュメントではなく、フィールドをスコアリングする

ドキュメントレベルの精度は、金銭的損失をもたらす失敗を隠してしまいます。各フィールドを個別にスコアリングし、ミスによる被害の大きさに応じて重み付けします:

フィールド なぜ重要なのか
請求書番号、サプライヤーID これらがないと重複検出とマッチングが破綻する
合計、税金、通貨 ここでの間違いは間違った支払いを意味する
注文書(PO)番号 2ウェイおよび3ウェイマッチングのためのフック
明細行の数量と単価 多くのエンジンが実際に失敗する箇所
日付 修正は安価だが、見逃すと高くつく

3. 追跡すべき数字はストレートスループロセッシング(自動処理)率

到着から投稿まで、誰も手を触れずに進むドキュメントの数を数えます。月に5,000件のドキュメントがある場合、90%と96%のストレートスルー率の差は、誰かが手動で開く300件のドキュメントになります。これは指標ではなく、職務記述書です。

4. 明細行こそが壊れる場所

ヘッダーフィールドは簡単です。候補リストにあるどのエンジンも請求書番号を見つけるでしょう。数字を一つでも信じる前に、複数ページのテーブル、繰り返されるヘッダー、折り返された説明、運賃や割引の行、行ごとの税金、マイナスのクレジット、混在する単位を投げかけてみてください。

5. 誰が例外処理のクリーンアップをするか尋ねる

ファイルサイズ制限、非同期処理、Webhookのリトライ、冪等性、レート制限、SDKのカバレッジ、そして信頼度の低いフィールドがどうなるか。次に、誰がその例外をレビューするのか尋ねてください。もし答えが「あなたのエンジニアが、あなたが構築したツールで」であれば、データシートの価格は本当の価格ではありません。このリストに対するParseur自身の数字はAPIドキュメントにあり、最後の質問に対する答えはあなたのスプリントではなく、Webアプリです。

ドキュメント抽出APIの本当のコスト

価格設定の形態はマーケティングが示唆する以上に異なっており、料金そのものよりもその形態が重要です。

  • ページ単位: 短いドキュメントでは最も安いですが、長いドキュメントでは負担になります。40ページの契約書は、まったく同じ1セットのフィールドに対して、1ページの領収書の40倍のコストがかかります。
  • ドキュメント単位: ファイルごとの予測は可能ですが、カスタムモデル、手書き文字、クエリベースの抽出などのプレミアム機能は別途請求されることがよくあります。
  • ボリュームに応じたサブスクリプション: ページ数に関係なく、ドキュメント許容量に対する定額の月額料金。

Parseurは3つ目を使用しています。長いPDFも短いメールも同じコストであるため、ドキュメントの構成が一定でない場合でも請求額を予測可能に保ちます。現在の階層は料金ページにあります。

誰も見積もらないコストは、API周辺のエンジニアリングです:後処理ロジック、レビューインターフェース、リトライ処理、抽出のズレを監視すること。その請求額は通常APIの請求額よりも大きく、これこそがParseurのWebアプリが排除するために存在している部分です。

Parseur APIでPDFをJSONに変換する手順

Five steps from PDF upload to parsed JSON on your webhook
Parsing PDFs Using Parseur API

アップロードからWebhookまでのPDF抽出APIのパス全体を5つのステップで紹介します。

ベースURL: https://api.parseur.com/

1. 認証

ParseurアカウントのAPIセクションでAPIキーを見つけ、すべてのリクエストのAuthorizationヘッダーで送信します:

Authorization: <YOUR_API_KEY>

詳細は認証ガイドをご覧ください。

2. メールボックスの作成または取得

メールボックスは、ドキュメントと抽出したいフィールドを保持するコンテナです。アプリ内で作成し、メールボックスを一覧表示してIDを取得します:

curl -X GET "https://api.parseur.com/parser" \
  -H "Authorization: <YOUR_API_KEY>" \
  --compressed

メールボックスIDは、アプリ内のメールボックスURL、およびcreate-mailboxレスポンスのidフィールドにも表示されます。

3. Upload a document

cURL:

curl -X POST "https://api.parseur.com/parser/<MAILBOX_ID>/upload" \
  -H "Authorization: <YOUR_API_KEY>" \
  -F "file=@./invoice.pdf" \
  --compressed

Python:

import requests

url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
headers = {"Authorization": "<YOUR_API_KEY>"}
files = {"file": open("invoice.pdf", "rb")}

response = requests.post(url, headers=headers, files=files)
print(response.json())

Node.js:

import fetch from "node-fetch"
import fs from "fs"

const url = "https://api.parseur.com/parser/<MAILBOX_ID>/upload"
const headers = { Authorization: "<YOUR_API_KEY>" }

const formData = new FormData()
formData.append("file", fs.createReadStream("./invoice.pdf"))

const response = await fetch(url, { method: "POST", headers, body: formData })
console.log(await response.json())

ドキュメントはアップロードではなく、メール転送で届くこともあります。両方のルートについてはメールとドキュメントのアップロードを参照してください。

4. 抽出データの受け取り

メールボックスにWebhookを設定すれば、処理が完了した瞬間に解析されたJSONがエンドポイントに届きます。本番環境ではこれが正しいデフォルト設定です:ポーリングなし、cronなし、チェックの間にドキュメントが失われることもありません。

Webhookが利用できない場合の代替手段:

  • オートメーションプラットフォーム: Zapier、Make、n8n、Power Automateなど。
  • ポーリング: 解析済みJSONを取得するための GET /document/{id}
  • エクスポート: メールボックスからCSV、JSON、またはExcelのダウンロード。

5. 検証と最適化

ParseurダッシュボードにはドキュメントとWebhookのログが表示されるため、何が抽出され、何が配信されたかを正確に確認できます。フィールドが間違って返ってきた場合は、コードベースでパッチを当てるのではなく、そこで修正してください。

Parseurで抽出できるもの、まだできないもの

Parseurは、「ソフトウェアが読み取る前にドキュメントを準備する必要はない」という1つのアイデアを中心に構築されたドキュメント抽出APIです。2016年以来、1億件以上のドキュメントを処理してきました。

  • キーバリューペア(KVP)とフォーム:氏名、住所、合計、請求書番号、参照IDをラベル付きフィールドへ抽出。
  • テーブルと明細行:請求書の明細、銀行明細の取引、船荷目録など、複数ページにまたがるテーブルを含みます。AIテーブル抽出でその仕組みを解説しています。
  • スキャンと写真:Vision AIエンジンは、デジタルPDFだけでなく、スキャンや撮影されたドキュメントを直接読み取ります。
  • メールと添付ファイル:Parseurの専門分野です。メール自体がドキュメントであり、添付されているすべてのものも同様です。
  • レイアウト要素:必要な場所にある見出し、段落、選択マーク。

依然として難しい領域:密集した手書き文字や署名。これらはカテゴリ全体で未解決であり、そうでないと主張するベンダーにはベンチマークを求めるべきです。

ほとんどのドキュメント抽出ソフトウェアはAPIで止まり、残りはあなたに任せます。Parseurは両方の半分を提供します:あなたの側のためのAPIと、運用チームがチケットを起票したりスプリントを待つことなく、フィールドを定義し、ドキュメントをレビューし、結果を修正できるWebアプリです。

主なユースケース

セキュリティ、GDPR、EUデータレジデンシー

ParseurはEUホスト型です:顧客データは欧州連合内で処理および保存され、ホスティングデータセンターはISO 27001認証を受けています。 これはデータレジデンシーのコミットメントであり、GDPR準拠のバッジとは異なる、より強力なものです。

Parseurは、EU GDPR、英国GDPR、カリフォルニア州CCPA/CPRA、およびシンガポールPDPAに準拠しています。顧客のドキュメントがParseurのAIモデルのトレーニングに再利用されることはなく、販売されることも決してありません。保持期間は設定可能であるため、設定した期間でドキュメントを自動的に削除できます。SOC 2 Type IIおよびHIPAAコンプライアンスプログラムは進行中であり、現時点ではどちらも認証されていません。

もしレジデンシー(データ保存地)が絶対条件であるなら、推論、一時キャッシュ、バックアップ、そしてドキュメントのコンテンツを含むログという4つの特定の事柄がどこで行われるかを尋ねずに、「EUホスト型」という言葉を決して受け入れないでください。米国の推論エンドポイントの前にあるEUのデータベースはEUレジデンシーではなく、よくある形です。私たちの「トレーニングなし」の主張をテストする12の質問では、モデルトレーニングについて同じ検証を行っています。

ドキュメント抽出APIとLLM連携:生のPDFを決して渡さない

言語モデルは推論においては並外れていますが、PDFを読み取ることにおいては信頼できません。スキャンした請求書に向けさせれば、ページにはない合計金額を、完璧に落ち着き払って返してきます。ドキュメント抽出APIはグラウンドトゥルース(正解データ)を生成します。モデルはその上で機能するのです。

うまくいく分業とは:APIが請求書番号、日付、合計、明細行を信頼度スコア付きで抽出し、その後、モデルが得意なことを行います。"01/03/25"を2025-03-01に変換したり、ドキュメントタイプをタグ付けしたり、内部の分類体系にフィールドをマッピングしたりします。スキーマの検証は両方の下に位置し、単独ではどちらも気付かないものを捉えます。

AIエージェントにも同じ規律が必要です。渡されたデータが良くなければ機能せず、ハルシネーション(幻覚)による明細行は、実際の支払いを伴う本物の発注書になってしまいます。より広い視点については、このページが属する柱であるデータ抽出APIの完全ガイドをご覧ください。

さあ、ベンダーを打ち負かしに行こう

最高のドキュメント抽出APIとは、最も長い機能リストを持つものではなく、あなたの最も厄介な10%のドキュメントを、人間を介在させることなく生き残るものです。テストセットを構築し、間違えるとコストがかかるフィールドをスコアリングし、反対側から手付かずで出てくるドキュメントの数を数えてください。好きな順序で構いませんので、私たちに対しても実行してみてください。

それ以外はすべてデータシートに過ぎません。

無料アカウントを作成
Parseurで時間と労力を節約。ドキュメント処理を自動化しましょう。

最終更新日

さらに詳しく

こちらもおすすめ

今すぐ始める

ドキュメントデータ抽出、
そろそろ自動化しませんか?

数分で設定完了。Parseurがどう業務フローに収まるか、無料でお試しいただけます。

AIモデルの学習は不要
あらゆるドキュメントからのデータ入力を自動化
クリック操作からAPIまで柔軟に対応

よくある質問

最初のAPI呼び出しから本番環境への展開までの間に、エンジニアが実際に尋ねる質問です。

一般的なパイプラインは5つの段階からなります:ファイルの取り込み、AI OCRとレイアウト解析、キーバリューペアやテーブルのパース、正規化と検証のためのポストプロセッシング、そしてWebhookまたはエクスポートによる構造化された配信です。最新のAPIは事前に構築するテンプレートなしで、これら5つすべてを自動的に実行します。

テンプレートベースの抽出は位置によってフィールドを照合するため、サプライヤーが合計金額を左に2センチずらすまでは機能します。AI駆動の抽出は人が読むのと同じようにドキュメントを読み取り、合計が「どこにあるか」ではなく「何に囲まれているか」によって識別します。実用上の違いはロングテールに現れます:テンプレートはレイアウトごとに1つのセットアップが必要ですが、AI抽出は見たことのないレイアウトも処理します。

実際のドキュメントを200〜500集め、実際の受信トレイと同じ比率で重み付けします:およそ70%が一般的なフォーマット、20%がロングテールのサプライヤー、10%が本当に厄介なエッジケースです。すべての候補に同じセットを実行し、ドキュメントごとではなくフィールドごとにスコアを付けます。ベンダーにサンプルを選ばせてはいけません。

ドキュメントが少なく、安定的で機械生成されたものであれば構築してください。レイアウトが変化した瞬間には購入してください。なぜなら、コストは決してパーサー自体ではなく、メンテナンスにあるからです。新しいサプライヤーのフォーマットのたびにチケットが発生し、それを書いたエンジニアだけが修正できる状態になってしまいます。

最初の成功するAPI呼び出しは午後だけで終わります。本番環境とはその周りのすべてです:フィールドのスキーマ、信頼度が低い場合の例外パス、そして午前2時にWebhookが失敗したときの責任者などです。テンプレートベースのツールは、さらにレイアウトごとに1つのセットアップを追加するため、2週間のプロジェクトが2四半期に延びる原因になります。すべてのベンダーに、最初の200レスポンスだけでなく、レビューのステップを含めたタイムラインを尋ねてください。

はい。非同期処理、Webhook、リトライ、バッチ操作により、1日何千ものドキュメントを日常的に処理します。大規模環境での制約はスループットではなく例外率であり、それはインフラの問題というより人員の問題です。

抽出APIがグラウンドトゥルース(正解データ)を生成し、LLMがそれに基づいて推論します。生のPDFを言語モデルに与えると、レイアウトの混乱や架空の値の発明を招きます。まず構造化されたフィールドを抽出し、モデルにそれらを正規化、分類、または強化させることで、エージェントは信頼できる行動の基盤を得ることができます。

質問してください。そして、例外規定についても尋ねてください。Parseurは顧客データをモデルのトレーニングに再利用することはなく、決して販売しません。多くのポリシーは、トレーニングを行わないと約束しながら、同じドキュメントの匿名化または集約化されたバージョンでトレーニングする権利を留保しているため、その例外を契約で特定して閉鎖させてください。

OCRは「このページにどんな文字があるか」に答えます。ドキュメント抽出APIは「どの値が重要で、それらがどう関連しているか」に答えます。OCRは構造のない文字の壁を渡すため、請求書番号を見つけるロジックを自分で書く必要があります。抽出APIは、直接データベースに書き込めるラベル付きフィールド、明細行の配列、およびテーブルを返します。

優れたAPIは返します。そしてそれは見出しの精度よりも重要です。フィールドレベルの信頼度スコアがあるからこそ、確実な90%を自動承認し、残りを人間にルーティングすることができます。精度92%でよく調整された信頼度を持つベンダーは、静かに失敗する精度97%を主張するベンダーよりも本番環境で安全です。

これが多くのAPIが壊れる部分なので、最初にテストしてください。複数ページのテーブルでは、APIが繰り返されるヘッダー行を認識し、ページ境界を越えて列のマッピングを維持し、小計を別の明細行として扱わないことが必要です。請求書番号や合計などのヘッダーフィールドはそれに比べて簡単なので、それらだけを見せるベンダーのデモは何も教えてくれません。

3つのモデルが主流です:ページ単位、ドキュメント単位、そしてボリュームに応じた定額サブスクリプションです。ページ単位の価格設定は最も安く見えますが、40ページの契約書が届いたときにそうではなくなります。また、カスタムモデルやクエリベースの抽出などのプレミアム機能は別途請求されることがよくあります。Parseurはドキュメントのボリュームに基づいたサブスクリプションを請求するため、長いPDFも短いPDFも同じコストになります。

実際のボリュームを処理するAPIであれば当然サポートしているはずです。大きなファイルはキューに入れられて非同期に処理され、結果はポーリングされるのではなくエンドポイントにプッシュされます。リトライの動作と冪等性については具体的に尋ねてください。なぜなら、一度だけ発火して諦めるWebhookは静かにドキュメントを失うからです。

ボリュームでリードしているのは買掛金で、請求書、領収書、発注書をカバーしています。それに続いて銀行報告書や取引レポートの金融オペレーション、次に梱包明細書や船荷証券の物流、そしてドキュメントがメールの添付ファイルとして到着しシステムに入力する必要があるあらゆるワークフローです。

一部のものは可能であり、一般的なGDPRの主張とは区別する価値があります。ParseurはEUホスト型です:データは欧州連合内で処理および保存され、ホスティングデータセンターはISO 27001の認証を受けています。推論、キャッシュ、バックアップ、ログをカバーする同じ内容を書面でベンダーに要求してください。米国の推論エンドポイントの前にあるEUのデータベースはEUレジデンシーではないからです。

JSONスキーマは、抽出APIと下流のすべてのものとの間の契約です。型を検証し、文字列として到着した日付を捕捉し、不正な形式のペイロードがERPに到達するのを防ぎます。ベンダーと話す前に必要なスキーマを定義し、各ベンダーに正確にそれを返すよう求めてください。