실제 폴더에서도 살아남는 Batch OCR: 모든 파일이 대기열에 들어가고, 추적되고, 전달됩니다
대부분의 Batch OCR 도구는 폴더를 하나의 균일한 작업으로 취급하기 때문에, 파일 하나만 잘못되어도 전체 실행이 중단됩니다. 여기서는 모든 파일이 페이지당 5~10초로 자체 실행되며 고유한 상태를 유지하므로, 200개 중 3개가 실패하면 재작업 3번으로 끝납니다.
페이지당 5~10초 · PDF/JPG/PNG/WebP 단일 대기열 · 파일별 상태 · 인쇄 텍스트 최대 99% 정확도
Batch OCR 실행 시 모든 파일에 대해 제공되는 결과
Batch OCR은 하나의 문서가 아닌 전체 폴더에 하나의 엔진을 적용하는 것을 의미하며, 실행 중 각 파일에 어떤 일이 발생했는지 아는 것이 핵심입니다. 공유 스캐너에서 PDF를 일괄 OCR하고, 동일한 실행에서 휴대폰에서 직접 이미지를 일괄 OCR할 수 있습니다. 대기열이 모든 형식을 동일하게 처리하기 때문입니다.
상태, 텍스트 및 메타데이터는 파일별로 추적됩니다. 원시 판독 결과만 원하는 경우에도 그대로 제공됩니다. 나중에 전체 텍스트 대신 열이 필요한 경우, 동일한 실행을 구조화된 추출에 사용할 수 있으며 파일을 다시 업로드할 필요가 없습니다.
Batch OCR은 하나의 작업처럼 보이지만, 실제 폴더는 수백 개의 작은 작업입니다.
온라인에서 Batch OCR을 검색하면 두 가지 형태의 도구를 만나게 됩니다. 마법사 안에 배치 모드가 숨어 있는 데스크톱 제품군과, 이미지 스택을 대기열에 넣는 온라인 변환기입니다. 둘 다 실행 시작을 강조하며, 시작 자체는 쉽습니다. 문자를 읽는 것은 폴더 규모 OCR에서 결코 어려운 부분이 아니었습니다. 어려운 부분은 운영입니다. 시작을 클릭한 후 한 시간 동안 200개 파일에 무슨 일이 일어나는지, 어떤 3개가 실패했는지 어떻게 알 수 있는지, 실행이 끝났을 때 텍스트가 어디에 저장되는지입니다. 아래의 모든 비교는 바로 이 차이에 달려 있습니다.
기존 방식의 실행이 사용자에게 맡기는 세 가지 작업
동일한 질문을 200번 합니다. 데스크톱 도구는 문서마다 질문을 하고 멈추는 경우가 많습니다. Adobe 커뮤니티 포럼의 사용자들은 이 절차에 대해 설명했습니다: "이 과정은 여전히 각 문서에 대해 품질 설정을 확인하고, OCR 후 최적화된 상태로 파일을 저장할지 확인하도록 요구하며, 이 모든 것이 여전히 불만스럽습니다." 해결 방법을 찾지 않는 한 200개의 파일 폴더는 200번의 확인 절차가 됩니다.
실패가 보이지 않아 다시 실행할 항목을 알 수 없습니다. Kofax Power PDF 도움말 페이지에 명확히 나와 있습니다: "노란색 또는 빨간색은 OCR 실패를 의미합니다. 파일 이름 옆에 노란색 또는 빨간색 원이 나타나면 다시 시도하거나 문서를 지원 팀에 보내십시오." 이 표시 이후에는 스스로 해결해야 합니다. 실행 결과는 나쁜 하나의 팩스가 전체 출력에 문제를 일으켰는지, 어떤 파일이 영향받았는지, 무엇을 다시 실행해야 하는지 알려주지 않습니다.
한 대의 머신이 전체 폴더 처리 시간을 담당합니다. 기존 데스크톱 일괄 처리 일괄 OCR 소프트웨어는 로컬 하드웨어에서 순차적으로 실행됩니다. 시스템 관리자가 약 5000개의 PDF 파일 OCR에 대한 질문을했을 때, 현실적인 예측은 "약 8-11시간"이었고, 같은 댓글 작성자는 "더 빠른 OCR 판독기는 품질을 저하시킨다는 것을 발견했습니다"라고 인정했습니다. 속도 또는 정확성, 당신의 데스크 타이머가 결정합니다.
관리형 실행이 처리해 주는 작업
하나의 큐, 사전 분류 단계 없음. 공유 스캐너 폴더에서 PDF 일괄 OCR을 처리하는 작업에 동료가 현장 방문 사진을 추가해도 둘 다 같은 배치에 들어갑니다. PDF, JPG, PNG, WebP, Word 또는 텍스트 파일까지 하나의 파이프라인을 공유하며, "PDF 설정"과 "이미지 설정"을 구분하는 단계나 이후에 병합할 별도 실행이 필요 없습니다.
잘못된 파일 하나는 재작업 한 번일 뿐, 전체 실행이 실패하지 않습니다. 비전 모델이 각 문서를 독립적으로 읽고 파일별 상태를 보고합니다. 기울어진 휴대폰 사진이 얇게 나와도 폴더 전체가 실패하지 않습니다. 처리는 완료되고, 플래그가 표시되며, 판단은 사용자의 몫입니다. 200개 중 3개의 잘못된 파일은 재작업 3번일 뿐이며, 비전 모델은 의미를 기준으로 읽기 때문에 깨끗한 스캔본과 지저분한 팩스에 서로 다른 품질 설정이 애초에 필요하지 않습니다.
출력 형식이 명확합니다: 파일당 한 행. 처리 시간은 페이지당 5~10초이며, 결과는 단일 스프레드시트입니다. 파일당 한 행, 셀에 추출된 텍스트, 파일 이름과 상태가 함께 표시됩니다. 흩어진 .txt 파일 200개를 수집하는 스크립트 단계도, 어떤 단어가 어떤 문서에서 나왔는지 알 수 없는 익명의 덩어리도 없습니다. 실행이 끝나면 무엇을 얻었는지, 어떤 행을 다시 확인해야 하는지 정확히 알 수 있습니다.
여섯 개 카드 전체를 관통하는 핵심은 다음과 같습니다. 실행 시작은 결코 문제가 아니었습니다. 폴더 규모 OCR의 성공 여부를 결정하는 것은 각 파일이 대기열에 들어간 후 어떻게 처리되는지, 즉 파일별 조사 없이, 실패가 스스로 이름을 밝히고, 텍스트가 확인 가능한 위치에 저장되는지입니다. 다음 섹션에서는 업로드부터 내보내기까지 실제 실행 과정을 살펴보며 세 가지를 순서대로 확인할 수 있습니다.
200개 파일의 쌓인 업무부터 정렬 가능한 텍스트까지, 터미널 없이
스캔 업무가 밀려 있다면, 시작부터 내보내기까지 실제 배치 실행이 어떤 모습인지 여기에서 확인할 수 있습니다.
정리하지 않고 폴더를 그대로 넣기
밀려 있는 작업은 200개 파일입니다. 사무실 복합기에서 나온 깨끗한 스캔 140개, 종이 서류를 찍은 휴대폰 사진 40개, 디지털로 생성된 PDF 15개, 암호화된 명세서 5개. 이들을 한꺼번에 끌어다 놓으세요. PDF, JPG, PNG, WebP는 모두 같은 대기열에 들어가고, 비밀번호로 보호된 PDF는 입력한 비밀번호로 잠금이 해제되며, 파일별로 설정을 확인하라는 요청은 없습니다.
대기열이 움직이는 모습 보기
페이지당 5~10초가 걸리므로 200페이지 폴더는 약 17~33분이면 완료됩니다. 같은 내용을 손으로 입력하면 페이지당 약 3분, 총 약 10시간이 걸립니다. 파일별로 상태가 업데이트되므로, 팩스가 얇게 수신된 순간 바로 표시되어 나머지 파일은 계속 진행됩니다. 하나의 진행률 표시줄 뒤에 모든 것이 숨겨지는 스피너와는 다릅니다.
한 번 내보내고, 세 개만 다시 실행
배치를 하나의 XLSX로 내보냅니다. 파일당 한 행씩 총 200행, 추출된 텍스트는 셀에, 상태는 옆에 표시됩니다. 상태별로 정렬하여 실패한 3개를 확인하고, 해당 파일만 다시 업로드하여 단독으로 다시 실행하세요. 다음 단계가 전체 텍스트가 아닌 구조화된 필드라면, 같은 폴더를 배치 데이터 추출 또는 배치 문서를 Excel로에 사용하여 명명된 열을 얻을 수 있으며, 두 번 업로드할 필요가 없습니다.
이 실행이 적합한 경우와 명령줄 도구가 더 적합한 경우
여기서 Batch OCR은 폴더를 읽고 텍스트를 제공하는 것을 의미합니다. 무엇을 하지 않는지 알면 작업에 맞지 않는 도구를 선택하는 실수를 피할 수 있습니다.
활용하기 좋은 경우
인쇄물과 손글씨가 섞인 폴더. 스캔본, 사진, 이미 디지털화된 PDF를 하나의 대기열에서 처리하며, 인쇄된 텍스트는 최대 99% 정확도로 인식하고 손글씨와 체크박스도 같은 패스에서 읽어냅니다.
검색, 정렬, 재사용을 위한 텍스트 추출. 결과물은 바로 활용할 수 있는 텍스트입니다. 파일별 전체 텍스트를 스프레드시트로 받거나, 구조화된 데이터가 필요할 때는 이름이 지정된 열로 받을 수 있습니다.
설치 없이 어느 기기에서든 실행. 브라우저 기반으로 작동하며 라이선스 서버나 파일별 설정이 필요 없어, 일회성으로 쌓인 작업도 노트북 하나로 오후 안에 처리할 수 있습니다.
주의가 필요한 경우
검색 가능한 PDF 생성 도구가 아닙니다. 텍스트는 스프레드시트 셀과 문서로 출력되며, 원본 PDF 파일 내부에 보이지 않는 텍스트 레이어로 삽입되지 않습니다. 수천 개 파일의 아카이브 등급 검색 가능 PDF 변환은 다른 작업으로, OCRmyPDF 계열의 명령줄 도구가 더 적합합니다.
폴더 자동 감시 없음, 배치는 수동입니다. 배치 하나는 약 30개 파일을 처리하므로, 수천 개 파일의 아카이브는 직접 시작해야 하는 업로드의 연속입니다. 자동화 우선 파이프라인은 별도의 도구 범주에 속합니다.
품질이 크게 저하된 원본은 여전히 어렵습니다. 흐릿한 팩스, 200 DPI 미만의 스캔, 감열지 영수증은 어떤 엔진에서도 정확도의 병목 지점입니다. 최악의 파일에는 검토 시간이 필요하다고 예상해야 하며, 제거할 수는 없습니다. 또한 파일에 이미 선택 가능한 텍스트가 있다면 OCR을 다시 실행하는 것은 낭비이므로, 해당 파일은 건너뛰고 이미지 기반 파일만 배치 처리하세요.
자주 묻는 질문
Batch OCR 실행 전에 폴더를 분류해야 하나요? 예를 들어 PDF는 한 배치로, 휴대폰 사진은 다른 배치로 나눠야 하나요?
분류할 필요가 없습니다. 단일 배치에 PDF, JPG, PNG, WebP 파일을 함께 넣을 수 있으며, 비밀번호로 보호된 PDF도 포함됩니다. 비전 모델은 모든 파일을 동일한 방식으로 읽습니다. 픽셀을 보고 내용을 읽기 때문에 네이티브 PDF, 300 DPI 스캔, 기울어진 휴대폰 사진 모두 형식별 파이프라인이나 파일별 설정 없이 하나의 큐를 통과합니다. 소스 형식은 출력의 각 행에 기록되므로 나중에 필요하면 해당 항목으로 필터링할 수 있습니다.
Batch OCR 실행 중 200개 중 3개 파일이 실패하면 어떻게 되나요?
나머지 197개는 계속 실행되며 아무것도 중단되지 않습니다. 각 파일은 독립적으로 처리되며, 배치 보기에서 파일별 상태가 추적됩니다: 대기 중, 처리 중, 완료, 실패. 실패한 3개 파일은 표시된 상태로 유지되므로 해당 파일만 열어 어떤 파일이 잘못 인식되었는지 확인하고, 개별적으로 수정하거나 다시 업로드한 후 전체 폴더 대신 해당 파일만 다시 실행할 수 있습니다. 실패 시 배치 전체가 아닌 파일 하나만 다시 처리하면 됩니다.
각 파일마다 별도의 출력이 생성되나요, 아니면 전체 실행 결과가 하나의 파일로 병합되나요?
파일당 한 행씩 구성된 스프레드시트 하나로 출력됩니다. 배치를 내보내면 각 문서가 한 행으로 표시되는 단일 XLSX 또는 CSV 파일을 받게 됩니다. 각 행에는 파일 이름, 페이지 수, 파일별 상태, 추출된 텍스트가 셀에 포함됩니다. 수동으로 병합해야 하는 200개의 분산된 .txt 파일을 받지 않으며, 어떤 단어가 어떤 문서에서 나왔는지 알 수 없는 익명의 텍스트 덩어리도 받지 않습니다. 정렬, 필터링, 보관 결정은 스프레드시트에서 이루어집니다.
Batch OCR로 검색 가능한 PDF를 얻을 수 있나요?
아니요, 이 점은 분명히 말씀드리는 것이 좋겠습니다. 이 도구는 문서를 읽고 텍스트를 데이터로 반환합니다. 스프레드시트 셀, 구조화된 열, 또는 편집 가능한 Word 파일 형태로 제공됩니다. 원본 PDF 파일에 보이지 않는 텍스트 레이어를 다시 쓰지는 않습니다. 수천 개의 파일에 걸쳐 아카이브급 검색 가능한 PDF가 목표라면 OCRmyPDF 계열의 명령줄 도구가 적합합니다. 텍스트를 추출하여 다른 곳에서 검색, 정렬, 편집하는 것이 목표라면 이 도구가 더 가벼운 방법입니다.
한 번의 Batch OCR 실행에 몇 개의 파일을 넣을 수 있나요? 수천 개의 파일이 있는 폴더는 어떻게 하나요?
한 배치에 약 30개 파일을 한 번에 처리할 수 있으며, 각 파일은 최대 10MB입니다. 더 큰 폴더는 여러 차례로 나누어 실행합니다. 30개 업로드, 내보내기, 다음 30개 업로드 방식으로 진행되며, 각 차례마다 자체 스프레드시트가 생성됩니다. 폴더 감시 자동화는 없으므로 5,000개 파일 아카이브는 무인 작업이 아닌 일련의 의도적인 실행으로 처리됩니다. 이는 9시간 후에 문제를 발견하는 대신 각 차례 사이에 방향을 수정할 수 있다는 의미이기도 합니다.