하도급업체 공인 급여 보고서 추출 방법:
Davis-Bacon 규정 준수
연방 고속도로 프로젝트에 하도급업체가 15곳인 경우, 원도급업체의 급여 관리 담당자는 매주 데이터 집계 작업을 수행해야 합니다. 이 작업은 Davis-Bacon 규정을 이해하는 것과는 무관하며, 15가지 서로 다른 형식으로 도착한 15개 문서에서 데이터를 추출하는 작업의 연속입니다. 한 하도급업체는 WH-347 그리드와 맞지 않는 열로 구성된 Sage 300 CRE 내보내기 파일을 보냅니다. 다른 업체는 QuickBooks PDF를 이메일로 보냅니다. 세 번째 업체 — 직원 2명 규모의 토공(土工) 업체 — 는 양식을 손으로 작성해 스캔한 후 JPEG로 보냅니다. 규정 준수에 대한 지식은 충분합니다. 병목 현상은 추출 과정에 있습니다.

핵심 요점
- 템플릿 기반 OCR은 고정된 양식 레이아웃이 필요하지만, 하도급업체 15곳이 보내는 보고서 형식은 15가지로 각각 다릅니다.
- 소규모 하도급업체는 급여 소프트웨어를 바꿀 때마다 보고서 형식을 변경하며, 형식이 바뀔 때마다 처음부터 새 추출 템플릿을 구축해야 합니다.
- 의미 기반 추출은 WH-347 필드가 페이지에서 어디에 위치하는지가 아니라 의미를 이해하여 읽어내므로, 모든 형식이 별도의 설정 없이 첫 접촉부터 작동합니다.
WH-347 데이터 추출이 일반 급여 추출과 다른 이유

일반적인 급여 데이터 추출 작업은 급여 명세서나 타임시트에서 직원 이름, 총액, 순급여를 추출하는 것입니다. 필요한 정보가 문서에 인쇄된 필드와 일대일로 대응되기 때문에 추출이 간단합니다. 그러나 Davis-Bacon Act(40 U.S.C. §3141 et seq.)에 따른 인증 급여(certified payroll)는 추출을 근본적으로 더 어렵게 만드는 세 가지 구조적 복잡성이 있습니다.
첫째, 동일한 근로자가 같은 주에 여러 직종 분류로 나타날 수 있습니다. 목수가 월요일부터 수요일까지 거푸집 작업을 하고 목요일부터 금요일까지 건식벽체 설치를 했다면, WH-347에는 해당 근로자에 대해 각 분류별로 고유한 prevailing wage rate가 적용된 두 개의 별도 행이 필요합니다. 단순히 "근로자 이름"과 "총 근무 시간"만 읽는 추출 도구는 이 중요한 차이를 놓치게 되며, 각 분류마다 다른 기본 요율과 후생 혜택 배분이 필요하기 때문에 컴플라이언스 제출이 잘못될 수 있습니다.
둘째, 요율 구조에는 별도로 추적해야 하는 두 가지 구성 요소가 있습니다. Davis-Bacon prevailing wage는 기본 시간당 요율에 후생 혜택 요율을 더한 것으로 구성됩니다. 계약자는 bona fide 후생 혜택 플랜에 기여하거나 근로자에게 현금 등가액을 직접 지급하는 방식으로 후생 혜택 의무를 충족합니다. WH-347의 6A열은 기본 요율을, 6B열은 근로자별 총 후생 혜택 크레딧을, 6C열은 현금 대체 지급액을 기록합니다. 추출은 이 세 가지를 모두 보존해야 합니다. 왜냐하면 "각 근로자가 후생 혜택을 포함한 최소 prevailing wage를 받았는가?"라는 컴플라이언스 질문은 이러한 구성 요소가 분리되어 유지될 때만 답할 수 있기 때문입니다.
셋째, CWHSSA(Contract Work Hours and Safety Standards Act)에 따른 초과 근무 규정은 검증 차원을 추가합니다. 적용 대상 계약에서 주 40시간을 초과하는 근무 시간은 기본 요율의 1.5배로 지급되어야 합니다. WH-347은 4열을 각 요일별 정규 근무 시간과 초과 근무 시간으로 나눕니다. "총 근무 시간"만 읽고 ST/OT 구분을 읽지 않는 추출은 DOL 감사관이 수행할 컴플라이언스 검증을 지원할 수 없습니다.
이러한 세 가지 구조적 특징은 인증 급여 추출이 일반적인 "페이지에서 숫자 읽기" 작업으로 취급될 수 없음을 의미합니다. 추출은 필드 값 자체뿐만 아니라 필드 간의 관계도 보존해야 합니다.
규정 준수 검증을 좌우하는 WH-347 데이터 포인트

추출 방식을 선택하기 전에 규정 준수 판단에 영향을 주는 WH-347의 특정 데이터 포인트를 파악하는 것이 좋습니다. 이 양식은 근로자당 분류 행마다 약 18개의 데이터 포인트를 수집하지만, 그중 7개가 감사에서 가장 중요합니다.
| WH-347 필드 | 열 | 규정 준수에 중요한 이유 |
|---|---|---|
| 근로자 ID | 1E | 주간 단위로 일관성을 유지해야 합니다. 다른 ID로 사라졌다가 다시 나타나는 근로자는 위험 신호입니다. |
| 노무 분류 | 3 | 프로젝트의 임금 결정서에 있는 분류와 일치해야 합니다. 잘못된 분류는 가장 흔한 DBRA 위반 사항입니다. |
| ST / OT 시간 | 4 | CWHSSA는 기본 요율의 1.5배로 OT를 지급하도록 요구합니다. 일별 내역을 통해 현장 출입 기록과 교차 확인할 수 있습니다. |
| 총 시간 | 5 | 일별 시간의 합계입니다. ST + OT와 같아야 합니다. 여기서 발생한 산술 오류는 다른 모든 계산에 영향을 미칩니다. |
| 기본 요율 + 프린지 크레딧 | 6A / 6B | 기본 요율 + 프린지 크레딧은 해당 분류의 prevailing wage rate 이상이어야 합니다. 감사 대비를 위해 두 값이 모두 필요합니다. |
| 총 수입액 | 7A | + (OT 시간 × OT 요율) + 프린지 크레딧과 대략 일치해야 합니다. 허용 오차는 ≤1% 반올림입니다. |
| 공제 | 8 | 29 CFR Part 3을 준수해야 합니다. 승인되지 않은 공제는 DOL 승인이 필요합니다. |
가장 중요한 검증 관계는 열 5, 6A, 6B, 7A 간의 교차 확인입니다. 총 시간 × 요율 + 프린지 크레딧은 반올림 허용 오차 내에서 총액과 일치해야 합니다. 추출이 7개 필드를 모두 독립적으로 보존하면 이 검증은 수동 재계산이 아닌 자동화된 확인이 됩니다. 그러나 추출 과정에서 분류가 통합되거나 ST/OT 구분이 누락되면 검증이 깨지고, 해결했다고 생각했던 규정 준수 격차가 그대로 남게 됩니다.
하청업체 서식 문제는 규정 준수 문제가 아닌 데이터 문제입니다
기존 기사 소규모 건설업체에게 공인 급여가 수동 작업의 악몽인 이유는 원청업체의 엄격한 책임, 3년 감사 기간, 1억 2천만 명의 근로자를 담당하는 611명의 조사관 등 구조적 규정 준수 과제를 자세히 설명합니다. 하지만 이 기사는 별도로 다룰 가치가 있는 더 좁고 기계적인 병목 현상, 즉 서식 문제도 지적합니다.
15개의 하청업체가 각기 다른 형식으로 공인 급여 데이터를 보낼 때, 원청업체의 데이터 추출 작업은 규정 준수 지식 문제가 아닙니다. 문서 판독 문제입니다. 각 형식에는 동일한 필수 필드가 포함되어 있지만, 배열 방식이 다르고, 레이블이 다르며, 때로는 필드가 완전히 누락되어 원청업체가 7일 제출 기한이 다가오는 동안 누락된 복리후생 문서를 추적해야 합니다.
템플릿 기반 OCR 도구는 여기서 실패합니다. 고정된 양식 레이아웃의 각 필드 주위에 사각형을 그려야 합니다. A업체 보고서의 "급여율"이 오른쪽 상단에 있고 B업체 보고서의 동일 필드가 페이지 중간쯤의 열 머리글에 있으면 템플릿이 깨집니다. 모든 하청업체 형식에 대해 별도의 템플릿이 필요하며, 소규모 하청업체는 급여 소프트웨어나 회계 법인을 변경할 때마다 보고 형식을 자주 바꿉니다.
Procore, Viewpoint Vista, Sage 300 CRE 또는 hh2와 같은 전용 규정 준수 소프트웨어를 사용하는 건설 회사는 시간 입력 데이터에서 자체 공인 급여 보고서를 생성할 수 있습니다. 그러나 하청업체가 보내는 형식을 제어할 수는 없습니다. 서식 문제는 원청업체와 하청업체 사이의 경계에 있으며, 근본적으로 추출 문제입니다. 즉, 들어오는 모든 문서 형식에서 데이터를 읽고 단일 표준 구조로 매핑하는 방법입니다.
서식 문제는 필요한 데이터를 아는 것이 아니라 기계가 읽도록 설계되지 않은 문서에서 해당 데이터를 읽는 것입니다. 모든 하청업체 보고서에는 동일한 규정 준수 핵심 필드가 포함되어 있습니다. 어려운 점은 각 보고서가 이러한 필드를 서로 다른 시각적 레이아웃에 포함하고 있다는 것입니다.
AI 의미 추출로 공인 급여 보고서 추출하는 방법

이것이 바로 템플릿 불필요 AI 문서 추출에 관한 기사에서 자세히 설명한 맞춤 열 추출 방식이 공인 급여 데이터 조합 워크플로를 변화시키는 지점입니다.
맞춤 열 추출은 출력 결과에서 역방향으로 작동합니다. 문서의 레이아웃을 분석하고 필드별로 추출 규칙을 정의하는 대신, AI에 최종 테이블에 원하는 열을 지정하기만 하면 됩니다 — "근로자 이름", "직종 분류", "기본 요율", "후생 요율", "ST 시간", "OT 시간", "총액" — 그러면 AI가 각 하도급업체의 보고서를 읽고 의미를 파악하여 해당 값을 찾아 올바른 열에 배치합니다. 각 하도급업체 양식의 레이아웃은 중요하지 않습니다. AI가 픽셀 좌표가 아닌 의미론적 매칭을 수행하기 때문입니다.
공인 급여 추출 워크플로는 다음과 같습니다:
Worker Name, Last 4 SSN, Classification, Base Rate, Fringe Rate, ST Hours, OT Hours, Total Hours, Gross Amount, Deductions, Net Pay. AI는 이러한 이름을 의미론적 대상으로 사용합니다.Subcontractor Name 및 Batch Name 열이 포함되어 모든 데이터를 원본 문서까지 추적할 수 있습니다.실제 공인 급여 문서에서 직접 시도해 보세요. 하도급업체 WH-347을 업로드하고 위의 열 이름을 입력하면 별도의 설정 없이 추출이 실행됩니다.
파일은 안전하게 처리되며 저장되지 않습니다.
추출된 데이터에 대한 자동 규정 준수 검사
데이터가 구조화된 스프레드시트로 추출되면, 규정 준수 검증은 수동 확인 작업에서 일련의 자동 검증으로 전환됩니다. 추출된 열은 단일 테이블이 되어 DOL 감사관이 수행할 검사를 15개 모든 하청업체에 대해 수 시간이 아닌 수 분 만에 실행할 수 있습니다.
근무 시간 × 요율 대사. 가장 기본적인 규정 준수 검사: 각 근로자의 총액이 + (초과 시간 × 기본 요율 × 1.5) + 프린지 크레딧과 일치하는지 확인합니다. 15명 근로자 보고서의 경우 수작업으로 15번의 계산이 필요합니다. 추출된 열이 있는 스프레드시트에서는 단일 수식을 행에 걸쳐 드래그하면 됩니다. 차이가 1%를 초과하는 행은 제출 전에 표시하고 조사하십시오.
분류-임금 결정 매칭. 추출된 각 분류를 SAM.gov의 해당 임금 결정에 나열된 분류와 비교하십시오. 하청업체가 근로자를 "일반 노동자"로 보고했지만 임금 결정에 "노동자" 및 "노동자"만 다른 요율로 나열된 경우, 보고서가 인증되기 전에 분류를 명확히 해야 합니다.
주간 근로자 ID 일관성. 1주차에 SSN이 4321로 끝나는 근로자가 3주차에 SSN이 8765로 끝나는 근로자로 나타나는 경우 — 동일한 이름, 동일한 계약자 — 데이터 입력 오류 또는 최악의 경우 유령 직원을 나타낼 수 있는 위험 신호입니다. 주간 추출 데이터를 피벗 테이블로 만들어 신원 이상 징후를 표시할 수 있습니다.
CWHSSA 초과 근무 검증. 주당 총 40시간을 초과한 모든 근로자가 6A열에 입력된 기본 요율의 1.5배 이상에 해당하는 초과 근무 요율을 가지고 있는지 확인하십시오. CWHSSA는 $100,000를 초과하는 모든 기본 계약에 적용되며, 초과 근무 위반에 대한 벌칙에는 차액뿐만 아니라 전체 초과 근무 미지급분에 해당하는 액체 손해가 포함됩니다.
추출의 규정 준수 가치는 데이터를 더 빨리 읽는 것이 아니라 데이터를 계산 가능하게 만드는 데 있습니다. 15개의 하청업체 PDF 더미는 정렬, 필터링 또는 수식 검사가 불가능합니다. 추출된 필드가 있는 스프레드시트는 몇 개의 수식을 작성하는 시간 안에 검증할 수 있습니다.
수기 WH-347 양식, 특별 관리가 필요한 경우
연방 프로젝트 건설 인력의 상당 부분을 소규모 하청업체가 차지하며, 이들 중 상당수는 WH-347을 수기로 작성합니다. 미국 건설업자 협회(AGC)의 2023년 조사에 따르면, 직원 20명 미만 건설 회사의 40% 이상이 여전히 수동 또는 기본 스프레드시트 소프트웨어로 급여 기록을 준비합니다. 전용 급여 시스템이나 최저 임금 모듈 없이 종이와 펜만 사용하는 것입니다.
수기로 작성된 인증 급여 보고서는 진정한 추출 과제를 제시합니다. AI는 필기 OCR 문제 및 해결 방법 가이드에 설명된 대로 대부분의 필기체를 읽을 수 있습니다. 하지만 좁은 칸에 쓰인 작업 분류와 "32.5" 또는 "32.8"로 보이는 요율은 규정 준수 제출이 감당할 수 없는 불확실성을 출력에 수반하는 사례입니다.
실용적인 접근 방식: 추출을 사용하여 데이터의 80-90%를 자동으로 구조화된 테이블에 넣습니다. 그런 다음 수기 입력 항목(특히 요율 필드, 분류 코드, 준수 진술서의 수기 서명(29 CFR 3.3(b)에 따라 원본 서명이어야 하며 복사본이 아님))을 한 줄씩 검토합니다. 스팟 체크 검증 워크플로우는 이 단계를 위한 프레임워크를 제공합니다. 추출을 통해 15개의 전자 보고서를 다시 입력하는 수고를 덜 수 있습니다. 수동 검토는 오류 위험이 가장 높은 2-3개의 수기 제출물에 집중하게 합니다.
기록 보관: 추출된 데이터는 3년간 보존되어야 합니다
29 CFR 3.4는 계약자가 원계약의 모든 작업이 완료된 후 최소 3년 동안 인증된 급여 기록을 보존하도록 요구합니다. 이는 권고 사항이 아닙니다. DOL 감사는 정기적으로 3년 전까지 소급하며, 누락된 기록은 그 자체로 규정 위반으로 간주되며, 누락된 기록이 밝혀냈을 수 있는 임금 위반과는 별개로 처리됩니다.
추출이 구조화된 스프레드시트로 이어질 때, 데이터가 이미 보존 가능한 형식이므로 기록 보관 요구 사항을 충족하기가 더 쉬워집니다. 각 배치 내보내기에는 향후 감사 대비를 지원하기 위해 문서 보존 요구 사항 가이드에서 더 자세히 다루는 다음 메타데이터가 포함되어야 합니다:
- 배치 이름 및 처리 날짜
- 각 행의 하청업체 이름 및 급여 기간
- 추출된 요율이 확인된 임금 결정 번호
- 검토 중 수동 수정 사항에 대한 메모 열
DOL 감사관은 원본 WH-347 양식과 요약 데이터를 모두 보고자 할 것입니다. 추출은 원본을 대체하지 않습니다. 원시 문서와 규정 준수 제출 간의 감사 추적을 생성합니다.
자주 묻는 질문
손으로 작성된 WH-347 스캔본에서 공사 임금 데이터를 추출할 수 있나요?
일반적으로 가능하지만, 손으로 쓴 요율 수치와 분류 코드는 규정 준수 제출에 사용하기 전에 줄별로 확인해야 합니다. AI 비전 모델은 필기체를 포함한 손글씨를 읽지만, WH-347의 좁은 셀에 빽빽하게 적힌 필기는 결과가 모호할 수 있습니다. 실용적인 워크플로는 자동으로 추출한 후, 임금 준수에 가장 직접적인 영향을 미치는 작업자당 2~3개 항목을 수동 검토 우선순위로 지정하는 것입니다.
하청업체가 전에 본 적 없는 형식을 사용하면 어떻게 하나요?
이것이 바로 Custom Column Extraction이 해결하도록 설계된 문제입니다. 템플릿을 인식하는 대신 각 열의 의미를 이해하여 문서를 읽기 때문에 처음 보는 형식도 바로 처리할 수 있습니다. 샘플을 학습시키거나 템플릿을 만들 필요가 없습니다. 하청업체가 Sage 대신 Foundation 내보내기 파일을 처음 보내도 AI는 동일한 열 이름을 사용하여 읽습니다.
같은 주에 여러 분류로 작업한 근로자도 추출이 가능한가요?
네, 하청업체 양식에 근로자가 분류별로 별도 행에 표시되어 있으면 가능합니다. AI는 문서에서 찾은 행 구조를 유지합니다. 단일 WH-347 행에 두 가지 분류와 합산 시간이 함께 기재된 경우, 추출 시 자동으로 나누지 않고 검토 플래그를 지정합니다. 규정 준수 제출에는 정확한 내역이 필요하기 때문입니다.
주(state) 수준의 "리틀 데이비스-베이컨" 양식에도 사용할 수 있나요?
동일한 Custom Column Extraction 방식이 캘리포니아(DIR), 뉴욕(DOL), 뉴저지, 펜실베이니아, 일리노이 등 자체적인 공사 임금법이 있는 25개 주의 주 정부 공사 임금 양식에도 적용됩니다. 열 정의는 동일합니다. AI는 각 주 양식의 특정 레이아웃에 적응합니다. 다만, 주 양식에는 고유한 필드가 있는 경우가 많으므로 추가 열 이름으로 추가해야 할 수 있습니다.
추출된 데이터에 3년 기록 보관 요건이 어떻게 적용되나요?
29 CFR 3.4에 따라, 원본 인증 급여 기록은 프로젝트 완료 후 최소 3년간 보존해야 합니다. 추출된 스프레드시트는 보조 자료일 뿐 대체 자료가 아닙니다. 감사관이 요약 데이터에서 원본 문서까지 추적할 수 있도록, 추출 결과물을 원본 업로드 문서와 함께 프로젝트 폴더에 배치 날짜 및 임금 결정 번호로 태그하여 보관하는 것이 좋습니다.
인증 급여 데이터 추출과 LCPtracker 같은 규정 준수 소프트웨어 사용의 차이점은 무엇인가요?
LCPtracker, eCOMM 및 유사 플랫폼은 제출 포털입니다. 원계약자로부터 인증 급여 데이터를 받아 발주 기관에 전달합니다. 이들은 다양한 형식의 하도급업체 보고서를 읽는 업스트림 데이터 추출 문제를 해결하지 못합니다. 추출 도구는 "하도급업체 보고서 더미"와 "제출 준비가 된 데이터" 사이의 간극을 메웁니다. 많은 원계약자가 추출로 데이터를 취합한 후 포털에 제출하는 두 가지를 모두 사용합니다.
추출에서 제출까지
데이비스-베이컨 법에 따른 인증 급여 규정 준수는 더 간단해지지 않을 것입니다. 2023년 규정 업데이트는 "건물 또는 공사"의 정의를 광대역 설치, 전기차 충전 인프라, 태양광 패널 건설로 확대하여 새로운 계약자 집단을 데이비스-베이컨 시스템에 포함시켰습니다. 2026년 9월부터 시행되는 WH-347 개정안은 견습 추적 필드와 더 엄격한 부가급여 보고 요건을 추가합니다. 더 많은 프로젝트, 더 많은 하도급업체, 매주 추출해야 할 더 많은 데이터가 생깁니다.
원계약자의 급여 관리자가 직면한 질문은 규정 준수 요건이 타당한지 여부가 아닙니다. 매주 15개의 보고서를 15가지 형식으로 열고, 동일한 필드를 제출 템플릿에 다시 입력하고, 매번 동일한 산술을 확인하는 데이터 취합 작업이 연방 공사의 불가피한 비용인지, 아니면 추출로 해결할 수 있는 프로세스 격차인지입니다.
답변은 하도급업체 보고서의 데이터가 PDF와 스캔본 안에 갇혀 있느냐, 아니면 규정 준수 서명 전에 자동 검사를 실행할 수 있는 스프레드시트에서 계산 가능하고 해지느냐에 달려 있습니다.