英国SA100税務申告データをExcelに抽出 — 税務項目名で指定、ボックス位置は不要
ほとんどのSA100抽出ツールはAPI専用プラットフォームで、スプレッドシートを確認するまでにパイプラインと年次テンプレートが必要です。しかし本ツールは、各ボックスの意味に基づいてSA100とその補助ページを読み取るため、同じ列名が毎年そのまま使えます。PDFをドロップするだけで、5〜10秒でフィールドを抽出できます。
Enterprise-grade security · TLS 1.3 encrypted
英国SA100申告書パケットから抽出できる項目
必要な列名を入力するだけで、AIが主フォームや補助ページ上の各数値を、ボックスの位置ではなくラベルの意味に基づいて見つけ出します。同じ列は、HMRCポータルのPDF、TaxCalcのダウンロード、スキャンした紙の申告書でもそのまま使えます。
出力項目はお客様が定義し、AIが文書を読み取ります。クライアントの申告書に含まれる任意の項目を追加できます。上記のリストは、英国の申告者の大半が必要とする初期セットです。
SA100抽出が「位置」ではなく「意味」で成功する理由
SA100は1つのフォームではなく、パケット(一式)です。メインの申告書(TR1〜TR6)に加え、最大7つの補助ページ(SA102雇用所得、SA103S自営業所得、SA104パートナーシップ、SA105不動産所得、SA106国外所得、SA108キャピタルゲイン、SA109居住)からメインフォームへ合計値が集約されます。そして各ソフトウェアはこれらのボックスを異なる方法で表示します。競合他社はエンタープライズAPIや年次テンプレートでこの問題を解決しようとします。ここに違いがあります。
課題
メインのSA100のボックス8の課税所得は、SA103Sの合計に由来します。ページを個別に読むだけではその関連性が失われます。手動で転記する人は、ボックスがそのソースと一致するかを確認するために、文書を行き来しなければなりません。
HMRCポータルのダウンロード、TaxCalcのPDF、FreeAgentのエクスポート、スキャンした紙の申告書はすべて、同じUTRと同じ所得ボックスを異なる座標で保持しています。あるレイアウトでトレーニングされたテンプレートは他のレイアウトを誤読します。これはまさに、r/UKPersonalFinanceの納税者が 期待するフィールドが探した場所にないと説明している問題です。
SA100のレイアウトは税年度ごとに変更され、所得税のデジタル税務申告(MTD for ITSA)は申告方法を変えつつあります。改訂のたびに座標ベースのゾーンが無効になるため、位置情報でトレーニングされた抽出は毎シーズン再調整が必要になるか、古い申告書では静かに失敗します。
カスタム列抽出がこれを解決する方法
カスタム列抽出とは、必要なフィールド(「UTR」「納付税額」「不動産所得」など)を入力するだけで、AIが各ボックスのラベルの意味を読み取り、そのラベルが書類のどこにあっても抽出する仕組みです。座標も、レンダラーごとのゾーンも、モデルのトレーニングも不要です。
「自営業所得」を一度定義すればSA103Sから抽出し、「不動産所得」を定義すればSA105から読み取ります。同じ定義セットで、メインフォームのボックス1の雇用所得も取得できます。補助ページに別のテンプレートや追加設定は不要です。
抽出は位置ではなく意味に基づくため、HMRCがレイアウトを変更したり、クライアントがソフトウェアを切り替えたりしても、同じ列名がそのまま機能します。昨年の定義は今年も、そして来年もそのまま使えます。
クライアントのSA100一式から、わずか3ステップでスプレッドシートへ
1月の期限に向けて自己申告(Self Assessment)を準備している方——ご自身の分でもクライアントの分でも——アップロードから、税務ソフト(またはご自身での確認)に必要なスプレッドシートができるまでの流れをご紹介します。
一式をそのままアップロード
メインのSA100に加え、補助ページ(自営業用のSA103S、不動産所得用のSA105など)をPDFまたは写真のまま取り込みます。HMRCポータルからのダウンロード、TaxCalcのファイル、スキャンした紙の申告書もすべて同じバッチにまとめてOK。AIがレンダラーごとに事前分類する必要はありません。クライアント自身がファイルを送ってくる場合は、コレクションリンクを共有すれば、登録なしで直接あなたのキューにアップロードされます。
必要な税務項目を入力
列名を一度設定するだけ:「UTR」「国民保険番号」「雇用所得」「自営業所得」「不動産所得」「総所得」「個人控除」「課税所得」「納付税額」「学生ローン返済額」。AIが各欄をラベルの意味で読み取り、一式の全ページにわたって行を埋めていきます。「差引残高(納付税額 − 予納額)」のような計算列を追加すれば、抽出中に計算も実行されます。
申告書ごとにExcelを1つ、またはクライアントごとに1行でダウンロード
XLSXまたはCSVでエクスポート。バッチ処理した各申告書が1行になります:1列目にUTR、名前の付いた列に所得と税額が入り、帳簿との照合や申告ソフトへの受け渡しがすぐにできます。レビューモードでは各値の出典が元のページ上でハイライト表示されるため、スポットチェックは6ページを読み返す代わりに数秒で完了します。
最適なケースと、出力の確認が必要なケース
最適なケース
デジタルまたは鮮明にスキャンされたSA100。 HMRCポータルのPDF、TaxCalcやFreeAgentなどのソフトウェアで作成された申告書、200〜300DPIのフラットベッドスキャンは、ボックスラベルが機械印字されているため、高い精度で抽出できます。
補助ページを含む複数ページの申告書。 SA103Sの自営業所得とSA105の不動産所得の数字は、メインフォームと同時に同じパスで抽出されます。これは英国の申告者の多くが必要とする項目です。
顧客の申告書の一括処理。 複数のSA100を一度にアップロードし、申告書ごとに1行のスプレッドシートを書き出すことができます。この形式により、1月の申告調整が実用的になります。
注意が必要なケース
手書きが多い、または画質の低い画像。 手書きのボックスは精度を低下させ、影や角度のあるスマホ写真では、小さな文字の補助ページの数字がぼやける可能性があります。急いで撮った写真よりも、きれいなスキャンの方が常に良い結果が得られます。
データを抽出するものであり、申告書を提出するものではありません。 このツールは構造化されたスプレッドシートを作成します。HMRCへの提出は、引き続きお使いの申告ソフトウェアを通じて行います。提出に使用する前に、数字を確認してください。
空白のボックスは空白のままです。 AIは印字された内容のみを抽出します。申告書に不動産所得が本当にない場合、不動産所得の列は空のままになります。推測したり、他の場所から数字を引っ張ってきたりすることはありません。
よくある質問
スキャンした紙のSA100からデータを抽出できますか?
はい、印刷された文字が肉眼で判読できる限り可能です。AIは「納付税額」や「UTR」などのフィールドラベルを座標ではなく意味で読み取るため、スキャンした紙の申告書もHMRCポータルのPDFと同じように処理されます。200〜300DPIのフラットベッドスキャンが最も良好な結果を得られます。影が写り込んだスマホ写真しかない場合は、レビューモードで補助ページの小さな数字を確認する必要があります。
SA103SやSA105などの補助ページ用に別途設定が必要ですか?
いいえ。1セットの列名で書類一式をカバーできます。「自営業所得」を定義すればAIがSA103S上でそれを見つけ、「不動産所得」を定義すればSA105を読み取ります。同じ列で、メインフォームのボックス1の雇用所得とボックス3の配当所得も取得できます。抽出はボックスの意味に従うため、補助ページごとのテンプレートを作成・管理する必要はありません。
すべてではなく、UTRと納付税額など一部のフィールドだけを取得できますか?
まさにそのように動作します。カスタム列抽出では、指定した列のみが出力されます。「UTR」と「納付税額」と入力すれば、出力テーブルにはその2列だけが含まれます。これが、このツールと固定スキーマのAPI抽出ツールとの違いです。後者は定義済みのフィールドセットを返すため、後で絞り込む必要があります。2つのフィールドでも20でも、AIは指定したものだけを読み取ります。
HMRCがフォームのレイアウトを変更したり、MTD for ITSAの下でも機能しますか?
はい。位置ベースのテンプレートは、HMRCがレイアウトを改訂したり、別のソフトウェアレンダラーで生成された申告書の場合に破綻します。これは競合プラットフォームがユーザーに負担として転嫁しているメンテナンスコストです。意味ベースの抽出は座標に依存しないため、同じ列定義がレイアウト改訂後も機能し続けます。また、過去の文書も同じ方法で読み取るため、所得税のデジタル税務申告(MTD for ITSA)によって新しい申告の提出方法が変わった後も、過去のSA100は抽出可能です。
手書きや不完全な申告書では精度はどうですか?
印刷されたSA100のフィールドは非常に高い精度で抽出されます。これはHMRCポータルやソフトウェア生成の申告書で一般的なケースです。手書きが正直な限界です。明確に書かれた数字は良好に抽出されますが、補助ページの小さく走り書きされた、またはにじんだ手書き文字は、個々の数字の精度を低下させる可能性があります。手書きがある場合や、クライアントの数字が通常と異なる場合は、レビューモードを実行して、抽出された各値が元のページのどの部分から来たのかを正確に確認してから、数字をどこかに送信してください。