선하증권
데이터 추출이란?
선하증권 데이터 추출은 스캔 또는 PDF 선하증권에서 B/L 번호, 송하인, 수하인, 운송인, 선적항, 양하항, 컨테이너 번호, 봉인 번호, 화물 명세, 중량, 포장 개수, 운임 조건, HS 코드 등 주요 선적 필드를 자동으로 읽어 TMS, ERP 또는 세관 신고 시스템에 직접 입력되는 구조화된 데이터로 출력하는 프로세스입니다.

핵심 요점
- B/L 1건당 10~15분이 소요되어 중견 포워더는 데이터 입력만으로 정규 직원 3명의 인력을 소모하며, 하루 30건을 초과하면 오류 수정이 초기 입력 작업을 압도합니다.
- 템플릿 기반 OCR로는 이 문제를 해결할 수 없습니다. 운송사가 B/L 레이아웃을 업데이트할 때마다 템플릿이 깨지고, 화물을 이동하는 대신 좌표 사각형을 유지 관리하는 일로 되돌아가게 됩니다.
- 의미 기반 추출은 물류 담당자처럼 B/L을 읽습니다. 필드가 어디에 있는지가 아니라 무엇을 의미하는지를 이해하므로 Maersk, MSC, CMA CGM 등 모든 운송사에서 형식별 설정 없이 하나의 설정으로 작동합니다.
선하증권 데이터 추출의 실제 의미
대부분의 물류 전문가들은 이 용어를 접하면 "BOL용 OCR"을 떠올립니다. 그것도 맞는 말이지만, 현대적 추출이 실제로 하는 일을 과소평가한 것입니다. 선하증권은 하나의 문서 유형이 아니라 구조, 범위, 법적 효력이 크게 다른 문서군입니다.
직선 선하증권은 특정 수하인을 지정하며 양도할 수 없습니다. 해상 선하증권은 해상 운송을 대상으로 하며 영수증이자 선하증권으로 기능합니다. 원본을 소지한 사람이 화물을 청구할 수 있습니다. 복합운송 선하증권은 해상, 철도, 트럭 구간을 하나의 문서로 통합합니다. 또한 마스터 선하증권과 하우스 선하증권이 있어 동일한 선적에 대해 중복되지만 서로 다른 데이터를 포함하는 두 개의 문서가 존재합니다.
각 유형마다 필드 배치가 다릅니다. 머스크 해상 선하증권은 컨테이너 번호를 오른쪽 상단에 배치하고, MSC 선하증권은 선박명 아래 중간 페이지에 배치합니다. 하우스 선하증권은 직선 선하증권에는 없는 상호 참조 필드로 마스터 선하증권 번호를 참조할 수 있습니다.
제대로 이해된 BOL 데이터 추출은 단순히 이미지 픽셀을 텍스트로 변환하는 것이 아닙니다. 운송사별, BOL 유형별, 종종 여러 페이지에 걸쳐 어떤 텍스트 조각이 어떤 선적 데이터 필드에 해당하는지 식별한 다음, 해당 값을 표준화된 코드로 매핑하여 단순한 텍스트 덤프가 아닌 다운스트림 시스템에서 바로 사용할 수 있는 출력을 생성하는 것입니다.
유엔 유럽 경제 위원회(UNECE)가 관리하는 UN/LOCODE 시스템은 249개국 100,000개 이상의 운송 위치에 고유한 5자리 코드를 할당합니다. 예를 들어 "상하이"는 CN SHA, "로테르담"은 NL RTM이 됩니다. 마찬가지로 NMFTA가 관리하는 표준 운송사 알파 코드(SCAC)는 2~4자리 문자 코드로 운송사를 식별합니다. 머스크는 MAEU, 하팍로이드는 HLCU, 코스코는 COSU입니다. 이러한 코드를 출력하는 BOL 추출 도구는 운송사의 인쇄된 이름만 출력하는 도구와 달리 TMS 가져오기 단계에서 수동 조회 단계를 없애줍니다.
선하증권 추출 vs TMS 데이터 입력 vs 수동 키 입력

이 세 가지 활동은 서로 다른 계층에 있으며, 이를 혼동하면 BOL 추출이 실제로 대체하는 것이 무엇인지에 대한 혼란이 생깁니다.
수동 키 입력은 운영 담당자가 운송사 이메일에서 PDF BOL을 열고, 선적 세부 정보를 읽고, 스프레드시트나 TMS에 직접 입력할 때 발생합니다. 익숙한 형식의 경우 문서당 10~15분이 소요되며, 익숙하지 않은 운송사 레이아웃의 경우 더 오래 걸립니다. 이는 하루에 수십 건의 선적을 넘어서면 확장이 어렵습니다. 포워딩 데이터 입력 워크플로우에 대한 한 연구에 따르면, 하루 30건 이상의 선적에서는 오류 수정 루프가 초기 입력보다 더 많은 시간을 소비하기 시작하면서 문서당 수동 처리 비용이 급격히 증가합니다.
TMS 데이터 입력은 CargoWise, Descartes, SAP TM, Oracle TM 또는 GoFreight와 같은 클라우드 네이티브 플랫폼에 선적 기록을 입력하는 더 광범위한 활동입니다. TMS는 마일스톤을 관리하고, 컨테이너를 추적하고, 고객 가시성 보고서를 생성하고, 청구를 처리하는 곳입니다. 그러나 TMS는 BOL PDF를 읽지 않습니다. 구조화된 입력을 기다립니다. "BOL이 받은 편지함에 도착하는 시점"과 "선적 기록이 CargoWise에 존재하는 시점" 사이의 간극이 바로 병목 지점입니다.
BOL 데이터 추출은 이 간극을 메웁니다. TMS의 업스트림에 위치하여 비정형 문서를 TMS가 소비할 수 있는 구조화된 데이터로 변환합니다. TMS를 대체하지 않고 공급합니다. 이미 TMS를 사용하는 팀에게 BOL 추출은 누락된 입력 계층입니다. 아직 스프레드시트를 사용하는 팀에게는 TMS 마이그레이션을 시작하기 전에 구조화된 선적 데이터를 향한 첫 단계인 경우가 많습니다.
선하증권 데이터 추출의 작동 방식

기술 파이프라인은 5단계로 구성되며, 이를 이해하면 현대 AI 추출이 템플릿 기반 OCR보다 다중 운송사 B/L을 더 효과적으로 처리하는 이유가 명확해집니다.
이 파이프라인이 다양한 운송사에서 작동하는 이유는 최신 AI 추출과 기존 OCR을 구분 짓는 동일한 메커니즘, 즉 템플릿 불필요 의미론적 이해 덕분입니다. 기존 OCR 도구는 Maersk BOL의 각 필드에 사각형을 그리고, MSC용으로 다시 그리고, Hapag-Lloyd용으로 또 다시 그려야 합니다. 운송사가 BOL 레이아웃을 업데이트하면 — 실제로 그런 일이 잦습니다 — 템플릿이 깨집니다. 최신 추출은 숙련된 물류 전문가처럼 문서를 읽는 비전 AI를 사용합니다. 좌표를 암기하는 것이 아니라 내용을 이해하는 방식입니다.
선하증권 데이터 추출이 필요한 경우
모든 물류 운영에 자동화된 BOL 추출이 필요한 것은 아닙니다. 하지만 네 가지 시나리오는 그 필요성을 명확히 보여줍니다.

대규모 포워딩. 하루 50건 이상의 화물을 처리하는 포워더는 Maersk, MSC, CMA CGM, Hapag-Lloyd, COSCO, ONE, Evergreen 등 다양한 운송사로부터 각기 다른 문서 레이아웃의 BOL을 받습니다. 모든 BOL 데이터가 TMS에 입력되기 전에 Excel이나 스프레드시트로 추출되어야 한다면, 물량만으로도 선택을 강요받습니다: 입력 사무원을 더 고용하거나 추출 단계를 자동화하는 것입니다. BOL 데이터 입력만 전담하는 전일제 직원 3명은 중급 포워더에서 실제로 볼 수 있는 인력 구성입니다. 추출 자동화는 이 세 역할을 가장자리 사례를 검토하는 예외 처리 담당자 1명으로 줄이고, 나머지 두 명은 사업을 성장시키는 고부가가치 업무인 고객 서비스와 운송사 협상에 집중하게 합니다.
세관 신고. 관세사는 수입 신고를 위해 특정 BOL 필드 — 송하인, 수하인, HS 코드, 화물 명세, 중량, 선적항, 양하항 — 가 필요합니다. 다중 운송사 BOL에서 수동 추출하면 세관 보류와 체선료를 유발하는 오류가 발생합니다. 세관 신고 소프트웨어로 직접 흘러 들어가는 구조화된 BOL 데이터는 대부분의 오류가 발생하는 전사 단계를 제거합니다. BOL이 화물 운송장, 포장 명세서, 상업 송장 등 나머지 선적 문서 패킷과 어떻게 조화를 이루는지 알아보려면 선적 및 화물 문서 추출 가이드를 참조하십시오.
선적 추적 및 가시성. 고객이 "제 컨테이너는 어디에 있나요?"라고 물으면 답은 BOL에 있습니다. 단, B/L 번호와 컨테이너 번호가 이미 추적 시스템에 있어야 합니다. 수동 입력은 문서 수령과 시스템 가시성 사이에 시차를 만듭니다. 자동화된 추출은 그 격차를 몇 분으로 줄여 추적을 수동적인 문의-응답 주기에서 능동적인 고객 대시보드로 전환합니다.
공급망 분석. 집계된 BOL 데이터 — 항구 쌍별 선적량, 항로별 운송사 성과, 경로별 평균 운송 시간 — 는 전략적 인텔리전스를 제공합니다. 하지만 그 데이터가 PDF와 스프레드시트에 갇혀 있다면 어떤 분석 도구도 접근할 수 없습니다. 추출은 BOL 수준 데이터를 쿼리 가능하게 만들어 수동 프로세스로는 불가능했던 추세 분석을 가능하게 합니다.
BOL 추출 도구에서 확인해야 할 사항
실제 운영에서 작동하는 추출 도구와 깨끗한 단일 운송사 PDF 데모에서만 작동하는 도구를 구분하는 다섯 가지 기준이 있습니다. ISO 6346 컨테이너 검증 숫자, UN/LOCODE 항만 코드, SCAC 운송사 코드, HS 코드 등 검증 표준에 대한 전체 필드별 참조는 BOL 추출 완전 가이드를 참조하십시오.
1. 다중 운송사 형식 처리. 도구는 운송사별 구성 없이 최소한 주요 컨테이너 선사의 BOL을 처리해야 합니다. Maersk용 템플릿, MSC용 템플릿, CMA CGM용 템플릿을 각각 만들어야 한다면 데이터 입력의 병목이 템플릿 유지 관리로 옮겨갔을 뿐입니다. 같은 운송사의 화물 3건이 아닌, 서로 다른 세 운송사의 BOL로 테스트를 요청하십시오.
2. 필드 수준 검증. 컨테이너 번호는 ISO 6346 검증 숫자 규칙에 따라 검증되어야 합니다. 항만 코드는 UN/LOCODE에 매핑되거나 최소한 표준화된 형식으로 추출 가능해야 합니다. 한 BOL이 "CNSHA", 다른 BOL이 "SHANGHAI", 또 다른 BOL이 "Port of Shanghai, CN"이라고 표기했을 때 도구가 "Shanghai"로 출력한다면, 다운스트림 TMS 가져오기에서 수동 정리가 필요할 것입니다.
3. 다중 페이지 및 라인 항목 지원. 컨테이너 화물을 실은 해상 BOL은 종종 3~5페이지에 달하며, 화물 명세, 컨테이너 번호, 봉인 번호, 중량, 포장 개수가 계속 페이지에 걸쳐 분산되어 있습니다. 첫 페이지만 읽는 도구는 데이터의 절반을 놓치게 됩니다. 각 화물 행이 별도의 데이터 행이 되는 라인 항목 수준 추출은 세관 분류 및 재고 조정에 필수적입니다.
4. 워크플로우로 직접 내보내기. CSV와 Excel은 기본입니다. 핵심 질문은 도구가 사용자의 스택과 통합되는지 여부입니다 — 맞춤 파이프라인용 직접 API, 또는 운영 팀이 스프레드시트로 작업하는 경우 Google Sheets 통합. Google Sheets 애드온이 있는 도구는 팀이 이미 화물을 추적하는 스프레드시트를 벗어나지 않고 BOL 데이터를 추출할 수 있게 해줍니다.
5. 일괄 처리. 하루 5건의 화물에는 BOL을 하나씩 처리해도 충분합니다. 50건이라면 전체 배치를 업로드하고, 필드를 한 번 정의하고, 병합된 출력 — BOL당 한 행이 있는 단일 스프레드시트 — 을 얻어야 합니다. 다중 운송사 일괄 BOL 추출에서 시간 절약 효과가 누적됩니다: 50건의 BOL을 개별 업로드 및 검토 50회가 아닌 단일 실행으로 처리합니다.
자주 묻는 질문
B/L 데이터 추출 도구와 TMS의 차이점은 무엇인가요?
TMS인 CargoWise, Descartes, SAP TM 등은 운송 작업 흐름을 관리합니다. TMS는 B/L PDF를 읽지 않습니다. B/L 추출 도구는 B/L 문서를 읽어 TMS에 공급되는 구조화된 데이터로 변환합니다. 이 둘은 대체 관계가 아니라 상호 보완적인 계층입니다. 두 시스템이 어떻게 함께 작동하는지 자세히 알아보려면 TMS 워크플로우에 B/L 추출 통합에 관한 문서를 참조하십시오.
B/L 데이터 추출이 손글씨 항목을 처리할 수 있나요?
네, 최신 AI 비전 모델은 템플릿 기반 OCR이 따라올 수 없는 정확도로 손글씨 B/L 필드를 읽을 수 있습니다. 다만, 매우 읽기 어려운 필체나 심하게 손상된 문서는 정확도가 떨어질 수 있습니다. 최상의 결과를 얻으려면 조명이 좋은 환경에서 촬영한 선명한 스캔이나 사진을 사용하십시오.
B/L 추출이 모든 운송사 형식에서 작동하나요?
템플릿 불필요 추출 도구는 운송사별 설정 없이 모든 운송사 형식에서 작동합니다. AI가 위치가 아닌 의미로 필드를 식별하기 때문입니다. 다만, 실제로 거래하는 운송사에 대해 성능을 검증해야 합니다. Maersk, MSC, CMA CGM, Hapag-Lloyd, COSCO, ONE, Evergreen 및 기타 주요 선사는 최신 추출 엔진에서 잘 지원됩니다. 비정형 레이아웃을 사용하는 지역 운송사는 테스트가 필요할 수 있습니다.
B/L 데이터 추출의 정확도는 어느 정도인가요?
최신 AI 기반 추출은 주요 운송사의 깨끗하고 잘 스캔된 B/L에서 필드 수준 정확도 95~99%를 달성합니다. 저해상도 스캔, 심한 손글씨, 손상된 문서에서는 정확도가 떨어집니다. 핵심 지표는 단순 정확도가 아니라 신뢰할 수 있는 처리량입니다. 즉, 수동 검토 없이 하루에 처리할 수 있는 B/L 수입니다. 99% 정확도로 추출하지만 모든 필드를 검증해야 하는 도구는 목적을 무색하게 합니다. 필드별 명확한 신뢰도 표시기가 있는 도구는 신뢰도가 낮은 추출만 검토하고 나머지는 신뢰할 수 있게 해줍니다.
BOL 데이터 추출과 EDI를 비교하면 화물 정보를 얻는 방식이 어떻게 다른가요?
EDI는 운송인으로부터 구조화된 화물 데이터를 직접 전달하므로 추출이 필요 없습니다. 그러나 EDI는 운송인별 설정, 테스트, 지속적인 유지보수가 필요하며, 많은 중소 운송사와 포워더는 이를 지원하지 않습니다. 실제로 대부분의 물류 운영은 주요 운송사로부터는 정규 노선에 대한 EDI를, 나머지 업체로부터는 PDF BOL을 받는 혼합 방식으로 운영됩니다. BOL 추출은 PDF 측면을 처리합니다. 자세한 비교는 포워더를 위한 EDI와 AI BOL 추출 비교를 참조하세요.
하우스 BOL과 마스터 BOL 데이터를 함께 추출할 수 있나요?
네, 가능합니다. 적절한 추출 설정을 통해 하우스 BOL과 마스터 BOL을 동일한 배치에서 처리할 수 있으며, 공통 필드를 매핑하면서 BOL 유형별 필드도 처리할 수 있습니다. 핵심은 두 문서 유형에 걸쳐 필요한 모든 필드를 포괄하도록 열 집합을 정의하는 것입니다.
누군가의 받은 편지함에 남아 TMS에 입력되기를 기다리는 모든 BOL은 추적되지 않는 화물, 업데이트되지 않는 고객, 시작되지 않은 세관 신고를 의미합니다. BOL 데이터 추출은 화물 데이터로 무엇을 하는지를 바꾸지 않습니다. 데이터를 사용 가능한 형태로 얼마나 빨리 확보하는지를 바꿀 뿐입니다. 대부분의 물류 팀에게 이것은 어제의 서류에 대응하는 것과 오늘의 화물을 실시간으로 관리하는 것의 차이입니다.