HMRC自己申告データ抽出

英国SA100税務申告書データをExcelに抽出 — ボックス位置ではなく、税務項目名で指定

ほとんどのSA100抽出ツールはAPI専用プラットフォームで、スプレッドシートを確認するまでにパイプラインと年次テンプレートが必要です。しかし、このツールは各ボックスの意味に基づいてSA100とその補助ページを読み取るため、同じ列名が毎年そのまま使えます。PDFをドロップするだけで、5〜10秒でフィールドを抽出できます。

Enterprise-grade security · TLS 1.3 encrypted

PDF・紙スキャン
XLSX / CSV
UTR・国民保険番号
バッチ申告

英国SA100申告書パケットから抽出できる項目

必要な列名を入力するだけで、AIが主フォームや補助ページ上の各数値を、ボックスの位置ではなくラベルの意味に基づいて見つけ出します。同じ列設定が、HMRCのポータルPDF、TaxCalcのダウンロード、スキャンした紙の申告書のいずれでも機能します。

UTR(納税者固有参照番号)
国民保険番号
雇用所得(ボックス1)
利子所得(ボックス2)
配当所得(ボックス3)
自営業所得(SA103S)
不動産所得(SA105)
総所得
個人控除
課税所得
納付税額
学生ローン返済額

出力項目はお客様が定義し、AIが文書を読み取ります。クライアントの申告書に含まれる任意の項目を追加できます。上記のリストは、英国の申告者の大半が必要とする初期セットです。

SA100抽出が位置情報では失敗し、意味で成功する理由

SA100は1つのフォームではなく、パケットです。メインの申告書(TR1〜TR6)に加えて、最大7つの補助ページ(SA102雇用、SA103S自営業、SA104組合、SA105不動産、SA106外国、SA108キャピタルゲイン、SA109居住)が合計値をメインフォームに送り込み、各ソフトウェアはそれらのボックスを異なる方法で描画します。競合他社はエンタープライズAPIや年別テンプレートでこれを解決します。ここが違いです。

問題点

01 主要フォームの数字が6ページ前で計算されている

主要SA100のボックス8の課税利益は、SA103Sの合計に由来します。ページ単位で孤立して読むと関連が切れてしまい、手動転記者はボックスがそのソースと一致するかを確認するために文書を行き来しなければなりません。

02 5つのレンダラーが同じフィールドを5つの異なる場所に配置する

HMRCポータルのダウンロード、TaxCalcのPDF、FreeAgentのエクスポート、紙の申告書のスキャン — いずれも同じUTRと同じ所得ボックスを含んでいますが、座標は異なります。あるレイアウトで学習したテンプレートは他のレイアウトを誤読します。これはまさに、r/UKPersonalFinanceの納税者が 「期待する項目が、探した場所にない」と報告している問題です。

02 HMRCがレイアウトを改訂すると、テンプレートも使えなくなる

SA100のレイアウトは税年度ごとに変更され、所得税のデジタル税務申告(MTD for ITSA)によって申告方法も変わりつつあります。改訂のたびに座標ベースの領域は無効になり、位置情報で学習する抽出方法は毎シーズン作り直しが必要です。古い申告書では正しく動作しないこともあります。

03 5つのレンダラーが同じ項目を5つの異なる場所に配置する

HMRCポータルのダウンロード、TaxCalcのPDF、FreeAgentのエクスポート、紙の申告書 — どれも同じUTRと所得ボックスを含みますが、配置はそれぞれ異なります。あるレイアウトで学習したテンプレートは、他のレイアウトを誤読します。これはまさに、納税者が 期待する項目が期待する場所にない と感じる問題です。

カスタム列抽出がこの問題をどう解決するか

01 フィールド名を指定するだけで、AIが意味に基づいて見つけます

カスタム列抽出とは、必要なフィールド(「UTR」「納付税額」「不動産所得」など)を入力するだけで、AIがラベルの意味に基づいて各欄を読み取る仕組みです。ラベルがパケット内のどこにあっても対応します。座標も、レンダラーごとのゾーンも、モデルのトレーニングも不要です。

02 1つの列定義でパケット全体をカバー

「自営業所得」を一度定義すればSA103Sから取得し、「不動産所得」を定義すればSA105から読み取ります。同じ定義セットで、メインフォームのボックス1の雇用所得も取得できます。補助ページに別のテンプレートや追加設定は不要です。

03 年度ごとのテンプレート保守が不要

抽出は位置ではなく意味に基づくため、HMRCがレイアウトを変更したり、クライアントがソフトウェアを切り替えたりしても、同じ列名がそのまま機能します。昨年の定義は今年も、そして来年もそのまま使えます。

クライアントのSA100書類一式から、3ステップでスプレッドシートへ

1月の期限に向けてSelf Assessment申告書を準備している方(ご自身の分でもクライアントの分でも)、アップロードから、税務ソフト(またはご自身のレビュー)が実際に必要とするスプレッドシートができるまでの流れをご紹介します。

1

書類一式をそのままアップロード

メインのSA100に加え、自営業用のSA103Sや不動産所得用のSA105などの補助ページを、PDFまたは写真のままドロップしてください。HMRC(英国歳入関税庁)ポータルからのダウンロード、TaxCalcのファイル、スキャンした紙の申告書も、すべて同じバッチにまとめて入れられます。AIがレンダラーごとに事前分類する必要はありません。クライアントがご自身でファイルを送る場合は、コレクションリンクを共有すれば、登録なしで直接あなたのキューにアップロードできます。

2

必要な税務項目を入力

列名を一度だけ設定します:「UTR(納税者固有参照番号)」「国民保険番号」「雇用所得」「自営業所得」「不動産所得」「総所得」「個人控除」「課税所得」「納付税額」「学生ローン返済額」。AIは各ボックスのラベル意味を読み取り、書類一式の全ページにわたって行を埋めていきます。「残高(納付税額 − 予納額)」のような計算列を追加すれば、抽出中に計算も実行されます。

3

申告書ごとにExcelを1つ、またはクライアントごとに1行でダウンロード

XLSXまたはCSVでエクスポートします。申告書のバッチを処理すると、それぞれが1行になります:先頭列にUTR、名前付き列に所得と税額が入り、帳簿との照合や申告ソフトへの受け渡しがすぐにできます。レビューモードでは各値が元のページのどこから来たかをハイライト表示するので、スポットチェックは6ページを読み返す代わりに数秒で完了します。

最適なケースと、出力を確認すべきケース

最適なケース

デジタルまたは鮮明にスキャンされたSA100。 HMRCポータルのPDF、TaxCalcやFreeAgentで生成された申告書、200〜300DPIのフラットベッドスキャンは、ボックスラベルが機械印字されているため、高い精度で抽出できます。

補助ページを含む複数ページの申告書。 SA103Sの自営業所得とSA105の不動産所得の数値は、メインフォームと同時に同じパスで抽出されます。これは英国の申告者の多くが必要とする項目です。

顧客の申告書の一括処理。 複数のSA100を一度にアップロードし、申告書ごとに1行のスプレッドシートをエクスポートできます。この形式により、1月の照合作業が実用的になります。

注意が必要なケース

手書きが多い、または画質の低い画像。 手書きのボックスは精度を低下させ、影がかかったり斜めからのスマホ撮影では、小さな文字の補助ページの数値がぼやける可能性があります。急いで撮影した写真よりも、鮮明なスキャンの方が常に良い結果が得られます。

これはデータ抽出であり、申告書の提出を行うものではありません。 このツールは構造化されたスプレッドシートを生成します。HMRCへの提出は引き続きお使いの申告ソフトウェアを通じて行います。提出に使用する前に、数値を確認してください。

空白のボックスは空白のままです。 AIは印字された内容のみを抽出します。申告書に実際に不動産所得がない場合、不動産所得の列は空のままになります。推測したり、他の場所から数値を取得したりすることはありません。

よくある質問

スキャンした紙のSA100からデータを抽出できますか?

はい、印刷された文字が人間の目で判読できる限り可能です。AIは「納付税額」や「UTR」などのフィールドラベルを座標ではなく意味で読み取るため、スキャンした紙の申告書もHMRCポータルのPDFと同じように処理されます。200〜300DPIのフラットベッドスキャンが最適です。影が写ったスマホ写真しかない場合は、レビューモードで補助ページの小さな数字を確認する必要があります。

SA103SやSA105などの補助ページに個別の設定は必要ですか?

いいえ。1セットの列名で書類全体をカバーできます。「自営業所得」を定義すればAIがSA103S上で見つけ、「不動産所得」を定義すればSA105を読み取ります。同じ列で本体フォームのボックス1の雇用所得やボックス3の配当所得も取得できます。抽出はボックスの意味に従うため、補助ページごとのテンプレートを作成・管理する必要はありません。

すべてではなく、UTRと納付税額など一部のフィールドだけを取得できますか?

まさにそのように動作します。カスタム列抽出では、指定した列だけが出力されます。「UTR」と「納付税額」と入力すれば、出力テーブルにはその2列だけが含まれます。これが、このツールと固定スキーマのAPI抽出ツールとの違いです。固定スキーマのAPIは定義済みのフィールドセットを返すため、後で絞り込む必要があります。2つのフィールドでも20でも、AIは指定したものだけを読み取ります。

HMRCがフォームのレイアウトを変更したり、MTD for ITSAの下でも機能しますか?

はい。位置ベースのテンプレートは、HMRCがレイアウトを改訂したり、別のソフトウェアレンダラーから申告書が届いたりすると機能しなくなります。これは競合プラットフォームがユーザーに転嫁するメンテナンス負担です。意味ベースの抽出は座標に依存しないため、同じ列定義がレイアウト改訂後も機能し続けます。また、過去の文書も同じ方法で読み取るため、所得税のデジタル税務申告(MTD for ITSA)で新しい申告方法に変わった後も、過去のSA100は抽出可能です。

手書きや不完全な申告書ではどの程度正確ですか?

印刷されたSA100のフィールドは非常に高い精度で抽出できます。これはHMRCポータルやソフトウェア生成の申告書で一般的なケースです。手書きは正直な限界です。明確に書かれた数字は問題なく抽出できますが、補助ページの小さく急いで書かれた文字やにじんだ手書きは、個々の数字の精度を下げる可能性があります。手書きがある申告書や、クライアントの数字が通常と異なる場合は、レビューモードを実行して、抽出された各値が元のページのどの部分から来たのかを確認してから、数字をどこかに送信してください。

📮 contact email: [email protected]