UK SA100 세금 신고 데이터를 Excel로 추출 — 세금 필드 이름을 지정하세요, 박스 위치가 아니라
대부분의 SA100 추출기는 파이프라인과 연도별 템플릿이 있어야 스프레드시트를 볼 수 있는 API 전용 플랫폼입니다. 하지만 이 도구는 각 박스의 의미를 기준으로 SA100과 보충 페이지를 읽으므로, 동일한 열 이름을 매년 사용할 수 있습니다. PDF를 넣으면 5~10초 안에 필드를 얻을 수 있습니다.
Enterprise-grade security · TLS 1.3 encrypted
영국 SA100 서류에서 추출할 수 있는 항목
필요한 열 이름을 입력하세요. AI는 각 수치가 기본 양식이나 보충 페이지 중 어디에 있는지가 아니라 상자 라벨의 의미를 기준으로 찾아냅니다. 동일한 열이 HMRC 포털 PDF, TaxCalc 다운로드, 스캔한 종이 신고서에서도 동일하게 작동합니다.
출력 항목을 직접 정의하고 AI가 문서를 읽습니다. 고객의 신고서에 포함된 모든 필드를 추가할 수 있으며, 위 목록은 대부분의 영국 신고자가 필요로 하는 기본 항목입니다.
SA100 추출이 위치가 아닌 의미에 기반해야 하는 이유
SA100은 단일 양식이 아니라 문서 묶음입니다. 본 신고서(TR1~TR6)와 최대 7개의 보충 페이지의 합계가 본 양식으로 집계되며, 각 소프트웨어는 이러한 입력란을 서로 다르게 렌더링합니다. 경쟁사는 엔터프라이즈 API와 연도별 템플릿으로 이 문제를 해결합니다. 여기에 차이가 있습니다.
문제점
SA100 기본 양식의 8번 상자에 있는 과세 소득은 SA103S의 합계에서 비롯됩니다. 페이지별로 단독으로 읽으면 이러한 연결이 끊어지며, 수동으로 필사하는 사람은 문서 사이를 오가며 상자 값이 출처와 일치하는지 확인해야 합니다.
HMRC 포털 다운로드, TaxCalc PDF, FreeAgent 내보내기, 스캔한 종이 신고서 모두 동일한 UTR과 동일한 소득 상자를 담고 있지만 좌표는 서로 다릅니다. 한 레이아웃으로 학습된 템플릿은 다른 레이아웃을 잘못 읽게 되며, 이는 r/UKPersonalFinance의 납세자들이 기대한 필드가 찾는 위치에 없을 때 겪는 문제와 정확히 일치합니다.
SA100 레이아웃은 과세 연도마다 변경되며, 소득세 디지털 신고(MTD for ITSA)는 신고 방식을 재편하고 있습니다. 개정 때마다 좌표 기반 영역이 무효화되므로 위치 기반 추출은 매 시즌 재작업이 필요하거나, 오래된 신고서에서는 조용히 오작동합니다.
맞춤 열 추출이 이 문제를 해결하는 방법
맞춤 열 추출은 원하는 필드를 입력하기만 하면 됩니다. 예를 들어 "UTR", "총 납부 세액", "부동산 소득"을 입력하면 AI가 해당 라벨의 의미를 기준으로 각 항목을 읽어냅니다. 라벨이 문서 묶음의 어디에 있든 상관없습니다. 좌표도, 렌더러별 영역도, 모델 학습도 필요 없습니다.
"자영업 소득"을 한 번 정의하면 SA103S에서 추출하고, "부동산 소득"을 정의하면 SA105에서 읽어옵니다. 동일한 정의가 기본 양식의 1번 근로소득 항목도 포착합니다. 보충 페이지에 별도의 템플릿이나 추가 설정이 필요 없습니다.
추출이 위치가 아닌 의미를 따르기 때문에, HMRC가 양식 구성을 변경하거나 고객이 소프트웨어를 바꿔도 동일한 열 이름이 계속 작동합니다. 작년의 정의가 올해도, 내년에도 그대로 사용됩니다.
고객의 SA100 서류 묶음에서 준비된 스프레드시트까지, 세 단계로
1월 마감을 앞두고 Self Assessment 신고서를 준비 중이시라면 — 본인 것이든 고객의 것이든 — 업로드부터 세무 소프트웨어에 실제로 필요한 스프레드시트가 만들어지기까지의 작업 흐름을 소개합니다.
서류 묶음 전체를 있는 그대로 업로드
메인 SA100 양식과 보충 페이지를 PDF나 사진으로 넣으세요. HMRC 포털 다운로드 파일, TaxCalc 파일, 스캔한 종이 신고서 모두 같은 배치에 넣을 수 있으며, AI가 생성 도구별로 미리 분류할 필요가 없습니다. 고객이 직접 파일을 보내는 경우 Collection Link를 공유하면 고객이 회원가입 없이 바로 대기열에 업로드할 수 있습니다.
필요한 세금 항목을 입력
열 이름을 한 번만 지정하세요: "UTR", "국민보험번호", "근로소득", "자영업 소득", "부동산 소득", "총소득", "개인 공제", "과세 소득", "납부 세액", "학자금 대출 상환액". AI가 각 입력란을 라벨 의미로 읽고 서류 묶음의 모든 페이지에 걸쳐 행을 채웁니다. "잔액" 같은 계산 열을 추가하면 추출 중에 계산이 자동으로 실행됩니다.
신고서별 Excel 하나 또는 고객별 행 하나를 다운로드
XLSX 또는 CSV로 내보내세요. 신고서 배치를 처리하면 각 건이 하나의 행이 됩니다. 첫 번째 열에는 UTR, 명명된 열에는 소득 및 세액 수치가 입력되어 장부와 대사하거나 신고 소프트웨어에 넘길 준비가 됩니다. 검토 모드에서 각 값이 원본 페이지의 어디에서 왔는지 강조 표시되므로 6페이지를 다시 읽는 대신 몇 초 만에 표본 검증을 마칠 수 있습니다.
가장 효과적인 경우 — 그리고 결과물을 확인해야 하는 경우
가장 효과적인 경우
디지털 및 깨끗하게 스캔된 SA100. HMRC 포털 PDF, TaxCalc 또는 FreeAgent에서 생성된 소프트웨어 신고서, 200–300 DPI 평판 스캔은 박스 라벨이 기계 인쇄되어 있어 높은 정확도로 추출됩니다.
보충 페이지가 포함된 다중 페이지 문서. SA103S 자영업 및 SA105 부동산 수치는 기본 양식과 동일한 패스에서 함께 추출됩니다 — 대부분의 영국 신고자가 필요로 하는 항목입니다.
고객 신고서 일괄 처리. 여러 SA100을 한 번에 업로드하고 신고서당 한 행씩 하나의 스프레드시트로 내보내면 1월 정산 작업이 실용적으로 이루어집니다.
주의가 필요한 경우
손글씨가 많거나 저화질 이미지. 손으로 기입한 박스는 정확도를 떨어뜨리며, 그림자가 지거나 각도가 기울어진 휴대폰 사진은 작은 글씨의 보충 수치를 흐리게 할 수 있습니다. 깨끗한 스캔이 급하게 찍은 사진보다 항상 더 나은 성능을 보입니다.
데이터 추출 도구입니다 — 신고서를 제출하지 않습니다. 이 도구는 구조화된 스프레드시트를 생성하며, HMRC 제출은 여전히 신고 소프트웨어를 통해 이루어집니다. 제출에 사용하기 전에 수치를 대조 확인하세요.
빈 박스는 빈 채로 유지됩니다. AI는 인쇄된 내용만 추출합니다. 신고서에 실제로 부동산 소득이 없다면 부동산 소득 열은 비어 있습니다 — 추측하거나 다른 곳에서 수치를 가져오지 않습니다.
자주 묻는 질문
스캔한 종이 SA100에서 데이터를 추출할 수 있나요?
네, 인쇄된 텍스트가 사람의 눈으로 읽을 수 있을 만큼 선명하다면 가능합니다. AI는 "Total Tax Due"나 "UTR" 같은 필드 라벨을 좌표가 아닌 의미로 읽기 때문에, 스캔한 종이 신고서도 HMRC 포털 PDF와 동일하게 처리됩니다. 200–300 DPI의 깨끗한 평판 스캔이 가장 좋은 결과를 제공합니다. 그림자가 진 휴대폰 사진만 있는 경우, 검토 모드에서 작은 글씨의 보충 페이지 수치를 확인해야 합니다.
SA103S나 SA105 같은 보충 페이지를 위해 별도 설정이 필요한가요?
아니요. 하나의 열 이름 세트로 전체 서류 묶음을 처리합니다. "자영업 소득"을 정의하면 AI가 SA103S에서 찾아내고, "부동산 소득"을 정의하면 SA105에서 읽어냅니다. 동시에 같은 열이 기본 양식의 근로소득과 배당소득도 포착합니다. 추출이 박스의 의미를 따르기 때문에 보충 페이지별 템플릿을 만들거나 유지 관리할 필요가 없습니다.
모든 항목 대신 UTR과 Total Tax Due 같은 일부 필드만 추출할 수 있나요?
바로 그렇게 작동합니다. Custom Column Extraction은 이름을 지정한 열만 반환합니다. "UTR"과 "Total Tax Due"를 입력하면 출력 테이블에는 그 두 열만 포함됩니다. 이것이 이 도구와 고정 스키마 API 추출기의 차이점입니다. 고정 스키마 방식은 미리 정의된 필드 세트를 반환하므로 이후에 필터링해야 하지만, 이 도구는 두 개든 스무 개든 정의한 필드만 읽습니다.
HMRC가 양식 레이아웃을 변경하거나 MTD for ITSA가 도입되어도 작동하나요?
네. 위치 기반 템플릿은 HMRC가 레이아웃을 개정하거나 다른 소프트웨어 렌더러에서 생성된 신고서가 들어오면 깨집니다. 이것이 경쟁 플랫폼이 사용자에게 전가하는 유지 관리 부담입니다. 의미 기반 추출은 좌표에 의존하지 않으므로 동일한 열 정의가 레이아웃 개정 후에도 계속 작동합니다. 또한 과거 문서도 같은 방식으로 읽기 때문에, 소득세 디지털 신고(MTD for ITSA)가 새 신고서 제출 방식을 바꾼 후에도 과거 SA100은 계속 추출할 수 있습니다.
손글씨나 불완전한 신고서에서는 정확도가 어떤가요?
인쇄된 SA100 필드는 매우 높은 정확도로 추출됩니다. HMRC 포털 및 소프트웨어 생성 신고서의 일반적인 경우입니다. 손글씨는 솔직히 한계가 있습니다. 또렷하게 적힌 숫자는 잘 추출되지만, 보충 페이지의 작고 급하게 쓰였거나 번진 손글씨는 개별 수치의 정확도를 낮출 수 있습니다. 손글씨가 있거나 고객의 수치가 특이한 신고서는 숫자가 어디에도 사용되기 전에 검토 모드를 실행하여 추출된 각 값이 원본 페이지의 어느 부분에서 왔는지 정확히 확인하세요.