VLM Powered OCR

OCR API — 開発者向け文書テキストと構造化データ抽出

多くのOCR APIは生テキストと座標を返すだけ — 文書タイプごとに解析コードを書く必要があります。この統合アプローチは、テキスト抽出とフィールド理解を1回の処理で行い、定義した列名で構造化データを出力します。

Enterprise-grade security · TLS 1.3 encrypted

REST API
PDF/JPG/PNG
XLSX/CSV/JSON
無料枠

あらゆる文書から抽出できるデータ

必要な列名を入力するだけで、AIが各ページの値の意味を理解して抽出します。位置情報は不要です。1回のエンドポイント呼び出しで、構造化JSON、CSV行、またはExcelファイルとして出力できます。

文書の生テキスト
請求書番号
日付
合計金額
取引先名
明細行
発注番号
税額
支払期限
文書タイプ

OCR APIではここまでしかできません

OCR APIが返すのはテキストと座標だけです。Invoice Number: INV-2024-0892 のように構造化された情報を得るには、検出された単語の中から "INV-2024-0892" という文字列を取り出すための、第二の処理層が必要です。

01
構造のない生のテキストダンプ

OCR APIはフラットな文字列か、座標付きの単語リストを返します。数値 $322.38 とラベル "TOTAL" は、出力内の他のテキストと区別がつきません。コードで、どの数値が合計で、どの数値が小計で、どの数値が明細項目なのかを自力で判断する必要があります。

02
文書レイアウトごとにカスタム解析コードが必要

座標はページに相対的です。位置 (x=100, y=200) で請求書番号を抽出するルールは、別のベンダーのレイアウトが (x=300, y=150) に配置した瞬間に機能しなくなります。ベンダーごとの解析ロジックを維持するのはスケールしません。

03
後処理パイプラインが複雑さとコストを増大させる

Redditの開発者は、OCR出力と利用可能なデータのギャップを「非常にイライラする」と一貫して述べています。APIは仕事をしましたが、データはまだ使用できる状態ではありません。

01
列名で構造化データを出力

必要なフィールド(Invoice NumberTotalVendorなど)を定義するだけで、AIがJSONやスプレッドシートの名前付き列として返します。生テキストのラベル付けや並べ替えは不要です。

02
レイアウトに依存しないセマンティック抽出

AIがInvoice Numberの意味を理解しているため、ページ上の位置に関係なく見つけ出します。ベンダーがテンプレートを変更しても、ルールを更新することなく抽出は機能し続けます。

03
アップロードから構造化出力までワンパイプライン

OCR、パース、フィールド抽出を別々に行う必要はありません。PDFや画像をアップロードし、列を定義するだけで、1つのレスポンスで構造化データを受け取れます。エンドツーエンドの構造化データが必要なチームにとって、この統合アプローチはOCR→パース→抽出のチェーンを維持するよりもシンプルです。

アップロードから構造化データまで、一つのフローで完結

APIで請求書のバッチを処理する際の流れをご紹介します。中間の解析ステップは不要です。

1

APIまたはWebインターフェースでファイルをアップロード

PDF、JPG、PNGを送信 — 単一のドキュメントでも、同一バッチ内で異なる形式のファイルを混在させることも可能です。APIはマルチパートアップロードを受け付け、ステータスポーリング用のタスクIDを即座に返します。各ファイルはキューに入れられ、非同期で処理されます。Web UIとAPIエンドポイントは同一のエンジンで動作します。

2

カラムスキーマを定義

必要なフィールドを指定します — Invoice NumberDateVendorLine Items (Description / Quantity / Unit Price / Total)TaxGrand Total。AIが各ドキュメントをセマンティックに読み取り、ページ上の位置に関係なく、値をカラム名にマッピングします。

3

構造化データを取得 — JSON、CSV、またはExcel

各ドキュメントは、指定したカラム名が入力された1行として返されます。バッチ全体をフォーマット済みのExcelワークブックとしてダウンロードしたり、個別の結果をフィールド:値のペアを持つJSONとして取得したり、複数行のCSVとしてエクスポートすることもできます。正規表現パターンを書いたり、座標マッチングをデバッグしたり、後処理パイプラインを維持する必要は一切ありません。

このアプローチが適しているケース

最適なケース

  • 文書から生のテキストではなく、構造化されたフィールド:値のペアが必要な場合。
  • 異なるレイアウトの文書が複数のソースから届く場合 — セマンティック抽出はルール変更なしで適応します。
  • 後処理パイプラインを省略したい場合 — 抽出結果をそのままデータベース、APIレスポンス、スプレッドシートに読み込めます。
  • チームに抽出ルールを構築・維持する専任のNLPや文書解析エンジニアがいない場合。

注意が必要なケース

  • 自由形式のテキスト再構成のために、文字単位の正確なバウンディングボックス座標付きの生OCRテキストが必要な場合 — このアプローチは名前付きフィールドを出力し、完全なレイアウトジオメトリは提供しません。
  • パイプラインが月間数百万件の文書を1ページあたり1セント未満で処理する場合 — スループット要件に対して従量課金制を評価してください。
  • 極端に筆記体の手書き文字や、物理的な劣化が激しいスキャン文書では抽出精度が低下する可能性があります — 鮮明な印刷文書やスキャン文書で最も高い信頼性が得られます。

よくある質問

スキャンしたPDFからAPIで請求書番号合計金額を抽出できますか?

はい。スキャンPDFは画像として扱われ、ビジュアルAIがページを直接読み取るため、テキストレイヤーに依存しません。請求書番号合計金額を列名として定義すれば、PDFがデジタル生成かスキャンかにかかわらず、APIは名前付きフィールドとして値を返します。

Google Cloud VisionやAWS Textractとどう違うのですか?

Google Cloud VisionやAWS Textractは、すでにフィールドがラベル付けされた文書に対して、バウンディングボックス付きの生テキストやキー・バリューペアを返します。このAPIは、セマンティック理解によってあなたが定義したフィールドを返します。仕入先名を指定すれば、文書に明示的なラベルがなくても仕入先名を見つけます。出力スキーマを定義するのは文書ではなく、あなたです。

文書ごとに行数が異なる明細項目はどう扱えばよいですか?

明細項目のような列を、ネストされたサブフィールド(説明数量単価合計)とともに定義します。AIは、行数が3行でも30行でも、文書ごとにすべての明細項目を検出し、JSONの配列またはエクスポート時の展開行として返します。

本契約前にOCR APIを評価できる無料枠はありますか?

はい。Web UIのゲストデモで、API統合なしに出力品質を評価できます。APIキー付きの有料プランは月額$9からで、毎日の無料クレジット枠が含まれます。WebインターフェースとAPIは同じ抽出エンジンを共有しているため、結果は一貫しています。

対応している入力形式と出力形式は?

アップロード:PDF(パスワード保護ファイルを含む)、JPG、PNG、WebP、AVIF。出力:列名をキーとする構造化JSON、CSV行、またはフォーマット済みExcelワークブック。APIはバッチレベルのエクスポートとしてダウンロード可能な.xlsxファイルもサポートしています。

📮 contact email: [email protected]