Why Financial Statements
Lose Units, Signs and Subtotals
"단위: 천"으로 시작하는 대차대조표는 단순히 숫자 표 위에 메모가 붙은 형태가 아닙니다. 그 메모는 모든 숫자의 일부입니다. 해당 표제 아래의 모든 수치는 표시된 숫자 자체의 1,000배를 의미하며, 배수를 선언하는 그 한 줄에는 숫자가 전혀 포함되지 않습니다. 산술만 읽고 구조는 읽지 않는 추출 방식은 각 값을 표기 그대로 읽어 배수를 누락시키므로, 단위가 천인 재무제표에서 156,857로 표기된 항목이 $156.9 million이 아닌 $156,857로 처리됩니다.
이는 재무제표가 숫자 자체 외부에 의미를 담는 세 가지 지점 중 하나입니다. 마이너스 금액은 마이너스 부호 대신 괄호로 표기됩니다. 소계는 자신이 요약하는 항목 위에 위치하므로, 계층 구조에 따라 어떤 수치를 더할 수 있고 어떤 수치를 더할 수 없는지가 결정됩니다. 재무제표를 평평한 그리드로 가져오면 이 세 가지 관례가 모두 한꺼번에 사라질 수 있으며, 완전해 보이지만 어떤 것에도 연결되지 않는 스프레드시트가 남게 됩니다.

핵심 요약
- "단위: 천"으로 표시된 재무제표는 겉으로는 정확해 보이는 셀에 1,000배의 오류를 가져올 수 있습니다.
- 깨끗한 그리드에는 이를 경고할 수단이 없습니다. 추출이 계층 구조를 평평하게 만들기 때문에 열 합계가 동일한 금액을 두세 번 계산하게 됩니다.
- 단위, 부호 및 각 소계를 재무제표 자체의 산술과 대조하면, 모든 형식 검사를 통과하는 오류도 몇 분 안에 드러납니다.
회계사와 재무팀은 대차대조표와 손익계산서를 스프레드시트로 가져와 작업 문서, 연결, 비율 분석 및 3개 재무제표 모델에 활용합니다. 출처는 QuickBooks 또는 Xero 내보내기, NetSuite 또는 Sage 보고서, 스캔한 감사 재무제표, 또는 Excel로 작성되어 PDF로 인쇄된 이사회 자료일 수 있습니다. 추출 과정은 이제 빠릅니다. 결과의 유용성을 결정하는 것은 위의 세 가지 구조가 이동 중에 유지되었는지 여부입니다. 이 글에서는 각 구조, 손실 시 발생하는 비용, 그리고 추출된 수치를 사용하기 전에 확인하는 방법을 설명합니다. 문서 추출이라는 범주가 처음이라면, AI 문서 추출이 무엇인지에 대한 쉬운 설명이 먼저 기본을 잡아줍니다.
재무제표는 숫자 나열이 아닌 세 가지 구조입니다
재무제표와 인보이스를 구분하는 것은 숫자가 아닙니다. 숫자가 의존하는 세 가지, 즉 전체 재무제표에 한 번 선언된 단위 표시, 음수에 대한 부호 규칙, 그리고 항목을 상위 합계로 묶는 소계의 계층 구조입니다. 재무제표는 이미 세 가지 관례를 알고 있는 사람이 읽도록 설계되었으므로, 이를 가볍게 한 번만 명시합니다.
인보이스에서 각 줄은 독립적입니다. 한 항목의 수량, 단가 및 합계는 다음 항목에 대해 아무것도 알려주지 않으며, 이를 별도의 열로 읽어도 손실이 없습니다. 연결하는 것이 없었기 때문입니다. 대차대조표는 그 반대입니다. 자산 쪽을 아래로 읽으면 표제, 그 아래 계정, 소계, 다음 표제 순으로 지나갑니다. 소계는 위 행들의 동료가 아닙니다. 그것은 그들의 합계이며, 그 아래의 총계는 소계들의 합계입니다. 모든 표시된 숫자를 추출할 셀로 취급하는 도구는 트리를 목록으로 취급하는 것입니다.
인보이스에서는 모든 행이 독립적입니다. 재무제표에서는 행이 동료가 아니며, 페이지 상단의 줄은 그 아래 모든 수치의 의미를 바꿉니다.
"단위: 천" 표시를 빼뜨 것이 가장 비용이 큰 실수입니다

재무제표에서 가장 중요한 요소는 숫자가 없는 줄, 즉 캡션의 단위 표시입니다. IAS 1 문단 51(e)에 따라 기업은 사용하는 반올림 수준을 공시해야 하며, 문단 53은 해당 반올림 수준이 명시되고 중요한 정보가 누락되지 않는 한 표시 통화의 천 단위 또는 백만 단위로 재무제표를 제시하는 것을 허용합니다 (IFRS Foundation, IAS 1). 미국 서류도 SEC Regulation S-X에 따라 동일하게 적용되며, 금액을 정수 달러 또는 그 배수로 표시하도록 허용하고, 해당 배수를 재무제표 캡션 바로 아래 또는 금액 열 상단에 표시하도록 요구합니다 (17 CFR § 210.4-01(b)).
바로 그 위치가 문제의 전부입니다. 단위 표시는 숫자 격자 밖, 종종 제목 아래 작은 텍스트로 위치하는 반면, 숫자는 열 안에 있습니다. 금액 열을 읽는 추출은 숫자 하나하나는 정확하지만 천 배의 오차가 있는 값을 반환합니다. SEC에 제출되고 "$ in Thousands"라는 제목이 붙은 연결 대차대조표는 현금 및 현금성 자산이 156,857로 표시됩니다. 달러로 읽으면 $156,857입니다. 캡션을 적용하면 $156.9 million입니다 (SEC EDGAR 예시). "단위: 천" 표시를 놓치면 1,000배 오류가 발생하며, 숫자 오독과 달리 셀 안에서는 보이지 않습니다.
두 가지 세부 사항으로 인해 이는 단순히 각주 하나가 누락된 것보다 더 심각합니다. 첫째, 승수는 기업이 발행하는 모든 자료에 걸쳐 균일하지 않습니다. 한 재무제표는 천 단위, 같은 보고서의 부문 주석은 백만 단위, 지속가능성 부록은 또 다른 단위일 수 있으며, 이는 전체 서류에 단일 가정을 적용하면 어딘가에서 틀릴 수 있음을 의미합니다. 둘째, 캡션은 종종 "주당 금액 제외" 또는 백분율로 스스로를 한정합니다. 주당 수치에 일괄 승수를 적용하는 것 자체가 오류입니다. 해당 행은 천 단위가 아니기 때문입니다. SEC 데이터에 대해 정확히 이 문제를 해결하는 데 수개월을 보낸 개발자는 이를 명확히 설명합니다: "승수(천, 백만 등)를 감지하세요... 그 정보는 때로는 표 머리글에, 때로는 기간 내에, 때로는 아래에, 때로는 완전히 없습니다." (r/datasets).
해결책은 단위가 숫자와 함께 이동하도록 하는 것입니다. 단위 표시는 페이지의 인쇄된 텍스트이므로 자체 열로 추출할 수 있으며, 각 행이 읽힌 척도를 가지게 되어 하류의 누구든 볼 수 있습니다. 배치가 균일한 것으로 알려진 경우, 승수를 추출 규칙의 고정 요소로 한 번 적용할 수 있지만, 이는 배치의 모든 재무제표가 동일한 단위를 사용하는 경우에만 유효합니다. 어느 쪽이든, 검사는 동일한 질문입니다: 이 셀의 모든 수치에 1,000을 곱해도 재무제표가 여전히 말이 됩니까? 대답이 아니오라면, 승수가 누락되었거나 두 번 적용된 것입니다.
괄호는 음수 표시이지, 서식이 아니다

재무 보고에서 괄호 안의 값은 음수 금액을 의미하므로, (1,049,779)는 마이너스 1,049,779이며 양수 금액을 꾸미는 장식이 아니다. SEC Regulation S-X는 이를 명시한다. 과거에 빨간 숫자로 표시되던 음수 금액은 음수 속성을 명확히 구분할 수 있는 방식으로 표시해야 하며, 규칙은 표시 방법 선택 시 복제 방식의 한계를 고려하도록 요구한다(17 CFR § 210.4-01(c)). 괄호 관례가 존재하는 이유는 정확히 빨간 잉크가 복사기나 스캐너에서 살아남지 못하기 때문이다.
대차대조표에서 음수 수치는 예외 사례가 아니다. 그것들은 핵심 정보가 담긴 곳이다: 누적 적자, 자기주식, 누적 기타포괄손실, 순영업손실, 그리고 합계를 줄이는 모든 "차감:" 항목이 여기에 해당한다. 괄호를 제거하면 적자는 이익잉여금이 되고, 손실은 이익이 되며, 자본 섹션은 자산 합계와 더 이상 일치하지 않게 된다. 이 오류는 단위 오류와 같은 이유로 조용히 발생한다. 셀 안의 숫자는 완전히 평범한 양수이며, 셀에 숫자가 포함되어 있는지만 확인하는 모든 검사를 통과하기 때문이다.
괄호는 자동으로 보존하기 어려운 두 가지 부호 신호 중 하나이다. 앞에 붙는 마이너스 기호는 파서가 기대하는 문자이지만, 값을 감싸는 괄호 쌍은 값 주변의 구두점이기 때문이다. 실질적인 방어책은 추출된 부호를 그 자체로 확인하는 대신 회계 구조와 대조하는 것이다. 명세서에서 적자나 손실로 표시된 항목은 음수로 추출되어야 한다. 그렇지 않다면 부호가 누락된 것이며, 이를 확인할 곳은 스프레드시트가 아니라 원본 페이지이다.
소계는 항목이 아니므로 열을 합산하면 이중 계산됩니다

세 번째 구조는 독자의 눈에는 그럴듯해 보이지만 수식에서는 실패할 가능성이 가장 높은 경우입니다. 재무제표의 행은 독립적이지 않으며, 가장 흔한 추출 실수는 소계를 단순히 더할 또 하나의 항목으로 취급하는 것입니다. 유동자산 합계는 그 위의 계정들의 합입니다. 자산 합계는 유동자산, 비유동자산 및 기타 자산 소계의 합입니다. 모든 숫자 행을 추출한 다음 열을 합산하면 동일한 금액이 두세 번 계산되어, 정밀해 보이지만 의미 없는 총계가 됩니다.
차감 항목은 두 번째 문제 계층을 추가합니다. "차감: 감가상각누계액"은 총 유형자산 금액을 순액으로 환산하므로, 이를 양수 금액으로 합산하면 자산이 감소하는 대신 부풀려집니다. 동일한 패턴이 "차감: 대손충당금", "차감: 자기주식", "차감: 상각누계액"으로 나타납니다. 각각은 섹션 중간에 항목으로 표시되는 실제 음수이며, 부호를 올바르게 읽을 때만 해당 소계에 영향을 미칩니다.
| 구조 요소 | 페이지에서의 모습 | 추출이 그리드를 평면으로 취급할 때의 실패 |
|---|---|---|
| 단위 표시 | 작은 캡션 텍스트, 예: "천 단위, 주당 금액 제외" | 모든 수치가 1,000배 오류, 또는 주당 행이 잘못 스케일링됨 |
| 음수 부호 규칙 | 괄호, 예: (1,049,779) | 적자를 수익으로, 손실을 이익으로 읽어 자본이 더 이상 일치하지 않음 |
| 소계 계층 구조 | 들여쓰기된 행이 제목 아래 그룹화되고 소계 행이 있음 | 전체 열을 합산하면 동일한 금액이 두세 번 계산됨 |
| 차감 항목 | "차감: 감가상각누계액" | 공제액이 양수로 더해져 섹션 합계가 부풀려짐 |
| 비교 기간 열 | 두 개 이상의 연도 열이 나란히 있음 | 전년도 수치가 당기 열에, 당기 수치가 전년도 열에 배치됨 |
비교 열은 동일한 문제의 또 다른 버전을 지닙니다. 재무제표는 올해와 작년을 나란히, 때로는 세 기간을 가로로 보여줍니다. 기간 레이블은 수치와 구조적으로 분리된 헤더 행에 있으므로, 숫자는 추출하지만 기간 할당은 추출하지 않으면 전년도 값을 당기 열에 배치할 수 있습니다. 셀에서 그 뒤바뀜을 드러내는 것은 없습니다. 이는 나중에, 작성한 추세가 반대 방향으로 가거나 계산한 변화의 부호가 잘못되었을 때 표면화됩니다.
추출된 재무제표 검증 방법
검증이란 추출 과정에서 가장 누락되기 쉬운 네 가지, 즉 단위, 부호, 소계 산술, 각 수치가 속한 기간을 확인하는 것을 의미합니다. 이러한 검사는 재무제표 자체의 내부 논리를 기준으로 실행되므로 외부 데이터가 필요 없으며, 세 가지 함정이 만드는 공백을 메워 줍니다.
단위를 확인하고 정확히 한 번만 적용합니다
단위 표시를 찾아 해당 단위가 적용되는 수치를 확인합니다. 재무제표에 "in thousands"라고 표시되어 있고 추출된 셀이 여전히 156,857로 읽히는 경우, 승수를 셀에 적용할지 또는 하위 열에 적용할지 결정하고 한 곳에만 적용합니다. 승수를 두 번 적용하는 것은 누락하는 것만큼이나 잘못된 것입니다.
셀이 아닌 라벨을 기준으로 각 부호를 확인합니다
재무제표에서 적자, 손실 또는 "Less:" 항목으로 표시된 행은 음수로 표시되어야 합니다. 괄호 안의 값이 부호를 유지하는지 확인합니다. 부호가 잘못된 것 같으면 검토 모드를 사용하여 셀에서 원본 페이지의 강조 표시된 소스 영역으로 이동하여 괄호를 직접 읽어 보십시오.
각 소계를 구성 요소에서 다시 계산합니다
소계의 하위 항목을 더하고 그 결과를 재무제표에 인쇄된 소계와 비교한 다음, 한 단계 위의 합계에 대해서도 동일한 작업을 수행합니다. 전체 열을 합산하지 마십시오. 인쇄된 소계가 정확한데 열 합계가 잘못된 경우, 이는 숫자를 잘못 읽은 것이 아니라 평면 합계 오류가 확인된 것입니다.
마지막으로 회계 항등식을 테스트합니다
대차대조표에서 총자산은 총부채와 총자본의 합과 같아야 합니다. 이 검사가 실패하면 앞선 검사들을 순서대로 다시 검토하십시오. 잘못된 부호나 잘못 읽은 소계가 일반적인 원인입니다. 손익계산서의 경우, 구성 요소가 순이익에 조정되는지 확인하는 것이 동등한 검사입니다.
이러한 검사는 기계적이며 추출 과정에서 일부를 처리할 수 있습니다. 맞춤 열 추출을 사용하면 "단위 표시", "계정", "당기", "전기"와 같은 원하는 필드를 지정할 수 있으며, AI는 페이지에서의 위치가 아닌 의미에 따라 각 값을 찾습니다. 따라서 "in thousands"와 같은 인쇄된 단위 표시는 자체 열로 반환되고 배율은 수치와 함께 이동합니다. 계산 열은 이 기능을 한 단계 더 발전시킬 수 있습니다. 섹션 내 교차 행 집계와 합계가 일치하지 않을 때 차이를 출력하는 조건부 논리를 지원하므로, 소계-합계 관계와 자산-부채-자본 항등식을 추출 중에 평가할 수 있습니다. 따라서 조정되지 않는 재무제표는 모델에 도달하기 전에 스스로 표시됩니다. 그리고 여전히 사람의 눈이 필요한 수치가 있는 경우, 검토 모드와 bbox 위치 확인 기능은 소스 페이지에서 해당 수치가 정확히 어디서 왔는지 강조 표시하므로 괄호나 단위 표시를 확인하는 데 PDF를 스크롤하는 대신 클릭 한 번이면 됩니다.
파일은 안전하게 처리되며 저장되지 않습니다.
열 정렬, 행 수, 누락 필드 감사, 셀을 수동으로 수정하는 대신 재추출해야 하는 경우를 포함한 광범위한 검증 절차는 7단계 추출 QA 체크리스트에 정리되어 있으며, 1차 검토에서 살아남는 오류 유형은 추출 후 데이터 오류가 증폭되는 이유에서 다룹니다. 해당 문서들은 일반적인 검증을 다루지만, 재무제표에 특화된 것은 위의 세 가지 구조입니다. 다른 문서 유형은 단위를 한 번만 명시하고, 음수를 괄호로 표기하며, 소계 계층 구조에 의미를 숨기지 않기 때문입니다.
추출로 확인할 수 없는 것과 감사 추적이 여전히 중요한 이유
어떤 추출 도구도 회계적 의미에서 수치가 올바른지 판단하지 않으며, 주석에 있는 재무제표의 일부는 도구의 범위 밖입니다. 리스가 운용리스인지 금융리스인지, 충당금이 적정한지, 이전 기간을 재작성해야 하는지 여부는 판단의 문제이며 표에 포함되지 않습니다. 핵심 수치가 각주, 보조 명세서, 또는 업로드하지 않은 첨부 문서에 있다면 어떤 도구도 찾을 수 없습니다. 거기에 없기 때문입니다.
단일 인보이스보다 위험이 더 큰 이유는 출력이 단순한 지불이 아닌 보고에 사용되기 때문입니다. PCAOB 감사 기준 2810은 감사인이 명백히 경미한 오류를 제외하고 감사 중 식별된 오류를 누적하고, 항목의 분류와 "금액의 근거"를 포함한 재무제표 표시를 평가하도록 요구합니다(PCAOB AS 2810). 잘못된 규모로 적용된 단위 또는 자본에서 누락된 부호는 바로 그 기준이 포착하도록 작성된 미수정 오류의 전형입니다.
해당 명세서로 흘러 들어가는 데이터는 이미 오류가 발생하기 쉽습니다. 운영 중인 스프레드시트 25개를 대상으로 한 현장 연구에서는 수식 셀의 0.8%~1.8%에서 오류가 발견되었으며, 확인된 오류 중 가장 큰 단일 오류는 1억 달러를 초과했습니다(Powell, Baker and Lawson, 2009). 이전 현장 감사에서는 감사 대상 스프레드시트의 94%에 최소 하나 이상의 오류가 포함되어 있고, 평균 셀 오류율은 약 5.2%인 것으로 나타났습니다. 누락된 단위 표시나 잃어버린 괄호는 그 기준선을 대체하는 것이 아니라 더욱 악화시킵니다. 그래서 모델을 구축하는 사람들이 숫자를 그토록 철저히 관리하는 이유입니다. 한 재무 모델링 실무자가 말했듯이, "모든 것이 100% 정확한지 확인하고, 소수점 하나라도 어긋나면 해고입니다." (r/financialmodelling).
이것이 깔끔해 보이는 표보다 출처 근거를 중시해야 하는 이유입니다. 명세서의 해당 줄까지 추적할 수 있는 수치는 감사가 가능하지만, 그저 그럴듯해 보이는 수치는 감사가 불가능합니다. 팀이 이미 추출하는 인접 재무 명세서에도 동일한 논리가 적용되며, 그래서 은행 명세서 추출 오류 파이프라인과 총계정원장 추출 워크플로는 검증을 마지막 단계가 아닌 핵심 단계에 둡니다.
자주 묻는 질문
추출한 재무 명세서가 1,000배나 작게 나오는 이유는 무엇인가요?
가장 가능성 높은 원인은 누락된 단위 표시입니다. "in thousands" 또는 "in millions"로 표시된 명세서는 그 배율을 금액 열 외부의 캡션에 한 번만 명시하므로, 수치만 읽는 추출은 승수를 적용하지 않은 숫자만 반환합니다. 명세서 캡션을 확인하고, 해당 캡션이 적용되는 수치를 확인한 다음, 승수를 정확히 한 곳에만 적용하세요.
괄호로 표시된 음수 부호가 유실되지 않도록 하려면 어떻게 해야 하나요?
괄호를 서식이 아닌 값으로 취급하세요. 추출 후 각 음수를 명세서가 부여한 라벨과 대조하세요. 적자, 손실 또는 "Less:" 줄은 음수여야 합니다. 부호가 잘못된 것 같으면 검토 보기를 사용하여 출처 영역으로 이동하고, 셀을 신뢰하기보다 원본 페이지의 괄호를 확인하세요.
AI가 스캔하거나 촬영한 대차대조표를 추출할 수 있나요?
네. 시각 모델은 페이지를 보고 스캔하거나 촬영한 명세서를 읽으므로 텍스트 레이어 없이도 인쇄된 텍스트, 손으로 쓴 주석, 표 구조를 파악할 수 있습니다. 제한 요소는 스캔 품질과 스캔이 단위를 명시하는 캡션과 여백의 괄호를 포함한 전체 페이지를 포착했는지 여부입니다.
개별 수치가 모두 정확한데 열 합계가 잘못된 이유는 무엇인가요?
열에 소계가 포함되어 있기 때문입니다. 재무 명세서의 소계는 그 위 행들의 합계이므로 모든 숫자 행을 더하면 같은 금액을 두 번 이상 계산하게 됩니다. 각 소계를 해당 하위 항목에서 다시 계산하여 인쇄된 소계와 비교하고, 열 전체를 합산하지 마세요.
"in millions" 또는 "except per share amounts"가 추출에 영향을 미치나요?
네. "In millions"는 다른 승수를 설정하며, "except per share amounts"나 백분율과 같은 한정어가 있으면 해당 특정 행에는 배율이 전혀 적용되지 않습니다. 명세서 전체에 단일 일괄 승수를 가정하면 예외 항목에서 오류가 발생하므로 캡션 텍스트를 포착하고 실제로 적용되는 범위를 읽으세요.
추출 결과가 재무제표를 확인하지 않고 사용할 수 있을 만큼 정확한가요?
저희 도구를 포함한 어떤 도구도 재무제표의 단위, 부호, 소계를 확인해야 하는 필요성을 없애지 못합니다. 저희 추출은 인쇄된 표 데이터에서 최대 99%의 정확도를 달성하며, 재무제표에는 여전히 위의 세 가지 구조와 도구가 판단할 수 없는 회계적 판단이 포함되어 있습니다. 각 새 출처의 첫 번째 재무제표에 네 가지 검증 확인을 실행한 다음, 각 배치를 표본 검사하세요.
구조는 데이터의 일부입니다
대부분의 재무제표 추출 문제의 배후에 있는 실수는 구조를 표현 방식으로 생각하는 것입니다. 그렇지 않습니다. 단위, 부호, 소계 그룹화는 데이터입니다. 그것들이 없으면 수치가 같은 의미를 갖지 않기 때문입니다. 깔끔한 그리드로 추출된 대차대조표는 그 세 가지가 유지되었는지에 따라 가치가 결정되며, 이를 확인하는 검사는 재무제표 자체의 산술에 기반하므로 몇 분이면 충분하고 모든 형식 검사를 통과하는 오류를 잡아냅니다. 사람이 거의 인식하지 못하고 추출 과정에서 흔적 없이 누락될 수 있는 캡션과 괄호부터 시작하세요.
추출된 재무제표를 신뢰하기 전에 세 가지를 확인하세요: 단위가 한 번 적용되었는지, 음수가 부호를 유지했는지, 소계가 자체 행에서 합산되는지. 이 세 가지 검사는 평면 그리드가 숨기는 오류를 잡아냅니다.