스캔 PDF에 OCR을 적용해 검색 가능한 문서로 만드는 방법
Home  ∣  PDF·파일 변환   ∣   스캔 PDF에 OCR을 적용해 검색 가능한 문서로 만드는 방법

스캔 PDF에 OCR을 적용해 검색 가능한 문서로 만드는 방법

Adobe Acrobat에서 스캔 PDF에 한국어 OCR을 적용하고 검색·복사·숫자 정확도까지 검수하는 실무 절차입니다.

스캔 PDF에 OCR을 적용해 검색 가능한 문서로 만드는 방법

종이 문서를 스캔한 PDF는 화면에 글자가 보여도 실제로는 페이지 전체가 이미지인 경우가 많습니다. 이 상태에서는 문서 안의 계약번호를 검색하거나 문장을 복사할 수 없고, 화면 읽기 프로그램도 내용을 제대로 해석하기 어렵습니다. OCR(광학 문자 인식)은 이미지 속 글자 모양을 분석해 선택·검색할 수 있는 텍스트 층을 PDF에 추가하는 과정입니다.

하지만 OCR 버튼을 한 번 누르는 것으로 업무가 끝나지는 않습니다. 한국어와 영어가 섞인 문서, 작은 표, 흐린 도장, 기울어진 영수증에서는 글자가 그럴듯하게 잘못 인식될 수 있습니다. 특히 금액·계좌번호·날짜처럼 한 글자 오류가 업무 결과를 바꾸는 값은 반드시 원본 이미지와 대조해야 합니다. 아래 절차는 Adobe Acrobat 데스크톱의 공식 도움말을 기준으로 원본 보존, 실행, 검수, 오류 대응까지 연결한 실무 방법입니다.

OCR이 필요한 PDF와 이미 검색 가능한 PDF 구분하기

먼저 문서가 정말 OCR 대상인지 확인합니다. PDF에서 문장 일부를 마우스로 드래그해 보십시오. 페이지 전체가 하나의 그림처럼 선택되거나 아무 글자도 선택되지 않으면 이미지 전용 PDF일 가능성이 큽니다. Ctrl+F로 화면에 분명히 보이는 고유한 단어를 검색했는데 결과가 없다면 두 번째 신호입니다. 반대로 글자가 선택되고 검색도 된다면 이미 텍스트가 있거나 과거에 OCR이 적용된 문서일 수 있습니다.

페이지마다 상태가 다른 혼합 PDF도 있습니다. 전자 문서로 만든 표지는 텍스트이고 뒤에 붙인 증빙만 스캔 이미지일 수 있습니다. 이런 파일은 전체 페이지에 무조건 OCR을 다시 적용하기보다 이미지 페이지 범위를 특정하는 편이 안전합니다. Adobe는 렌더링 가능한 텍스트가 이미 있는 페이지에서 OCR을 수행할 수 없다는 오류가 날 수 있다고 안내합니다.

확인 방법이미지 전용 PDF의 반응텍스트가 있는 PDF의 반응다음 행동
문장 드래그페이지 그림 전체가 선택됨글자 단위로 선택됨이미지 페이지만 OCR 후보로 지정
Ctrl+F 검색보이는 단어도 검색되지 않음일치 결과로 이동함검색 실패가 계속되면 OCR 실행
복사 후 메모장 붙여넣기아무 내용이 없거나 깨짐읽을 수 있는 글자가 붙음붙여넣은 숫자도 원본과 비교
파일 속성·보안 확인편집 제한이 있을 수 있음제한 여부와 무관하게 텍스트 존재 가능권한이 없으면 소유자에게 해제 요청

작업 전 준비사항과 원본 보존 원칙

OCR은 결과 PDF의 내부 구조를 바꿀 수 있으므로 원본을 직접 덮어쓰지 않습니다. 계약서_스캔_원본.pdf는 읽기 전용 보관 폴더에 두고 계약서_OCR_작업_20260805.pdf처럼 사본을 만들어 시작합니다. Adobe 공식 도움말도 편집 전에 원본 스캔 PDF의 백업을 저장하라고 권고합니다. 사본에는 작업일과 상태를 넣되 개인정보가 파일명에 드러나지 않게 합니다.

문서의 보안 등급도 먼저 확인합니다. 인사기록, 신분증, 계좌정보가 있는 파일을 개인 클라우드나 승인되지 않은 웹 변환 서비스에 올려서는 안 됩니다. 이 글은 조직에서 허용한 Acrobat 데스크톱 환경을 전제로 합니다. PDF가 암호로 잠겼거나 편집 제한이 걸려 있으면 임의로 우회하지 말고 문서 소유자에게 권한을 요청합니다. 공식 도움말 역시 스캔 PDF 편집 전에 보안 제한을 해제해야 한다고 설명합니다.

원본 스캔 품질도 결과를 좌우합니다. 글자가 지나치게 작거나, 페이지가 3도 이상 기울었거나, 그림자가 글자 위에 걸리면 OCR 오류가 늘어납니다. 가능한 경우 원본 종이를 다시 스캔해 기울기와 대비를 개선하는 것이 잘못된 결과를 수작업으로 고치는 것보다 빠릅니다.

준비 항목권장 기준확인 이유
원본 보관작업 사본과 별도 폴더에 보존OCR 실패·레이아웃 손상 시 복구
페이지 방향본문이 바로 읽히는 방향으로 회전90도 회전 글자의 오인식 감소
해상도작은 글자가 확대해도 획이 구분되는 수준저해상도에서 ㅁ·ㅇ, 1·l 혼동 방지
언어문서의 주 언어를 정확히 선택한국어 조사와 복합 모음 인식 개선
보안 권한편집·OCR 권한 확인오류 원인과 권한 문제를 구분
검수 표본숫자·표·도장 포함 페이지 선정위험도가 높은 영역을 먼저 확인

Acrobat에서 단일 PDF에 OCR 적용하는 단계

Acrobat 데스크톱에서 작업 사본을 엽니다. 왼쪽이나 상단의 모든 도구에서 스캔 및 OCR을 선택한 뒤 이 파일에서를 선택합니다. 공식 절차에 따르면 대화 상자에서 텍스트를 인식할 페이지 범위와 언어를 지정하고, 필요하면 설정에서 추가 옵션을 조정한 다음 텍스트 인식을 실행합니다.

  1. 원본이 아닌 작업 사본을 열고 첫 페이지부터 마지막 페이지까지 방향을 빠르게 확인합니다.
  2. 모든 도구 > 스캔 및 OCR > 이 파일에서로 이동합니다.
  3. OCR이 필요한 페이지만 범위로 지정합니다. 혼합 PDF라면 텍스트 페이지를 제외합니다.
  4. 문서의 주 언어를 한국어로 선택합니다. 영어 중심 부록은 별도 범위로 나누어 처리하는 것이 낫습니다.
  5. 설정 화면이 제공되면 출력 형태와 이미지 품질이 업무 목적에 맞는지 확인합니다. 메뉴 명칭은 Acrobat 버전에 따라 조금 다를 수 있습니다.
  6. 텍스트 인식을 실행하고 완료 메시지가 나타날 때까지 문서를 닫지 않습니다.
  7. 결과를 새 이름으로 저장한 뒤 Acrobat을 닫았다 다시 열어 검색 가능한 상태가 유지되는지 확인합니다.

완료 직후에는 문서 전체를 선택해 워드에 붙여넣는 식으로 검수하지 않습니다. 서식 재구성 때문에 줄 순서가 달라질 수 있기 때문입니다. 먼저 PDF 안에서 고유 단어를 검색하고, 중요 문장을 한 줄씩 복사해 일반 텍스트 편집기에 붙여넣어 텍스트 층의 품질을 확인합니다.

한국어·영문·숫자가 섞인 문서의 언어 설정

OCR 언어는 단순한 화면 표시 옵션이 아닙니다. 글자 모양을 어떤 문자 체계로 해석할지 결정하는 중요한 조건입니다. 한국어 보고서에 영어 제품명과 숫자가 조금 섞여 있다면 한국어를 주 언어로 두고 결과를 검수합니다. 영어 본문이 수십 페이지 이어지는 부록이라면 한국어 본문과 영어 부록을 페이지 범위로 나눠 각각 처리하는 방식이 정확도를 관리하기 쉽습니다.

숫자는 언어 설정만으로 안전해지지 않습니다. 스캔이 흐리면 0O, 1l, 5S, 쉼표와 소수점이 바뀔 수 있습니다. 전화번호, 사업자등록번호, 계좌번호, 계약금액, 날짜는 검색이 된다는 사실만 확인하지 말고 원본 이미지와 한 자리씩 대조합니다. 개인정보가 포함된 값을 검수표에 그대로 옮길 때는 검수표 자체도 보호 대상이 됩니다.

표의 셀 경계와 세로쓰기, 손글씨, 도장 위의 글자는 일반 본문보다 오류 가능성이 큽니다. OCR이 손글씨를 완벽히 읽는다고 가정하지 말고, 인식 결과를 검색 보조 수단으로 활용하십시오. 법적 효력이 있는 문서는 OCR 텍스트가 아니라 원본 스캔 이미지를 기준 기록으로 유지해야 합니다.

여러 PDF를 일괄 처리할 때 지켜야 할 순서

같은 형식의 회의록이나 신청서가 여러 개라면 Acrobat의 여러 파일에서 기능을 사용할 수 있습니다. 공식 도움말의 흐름은 모든 도구 > 스캔 및 OCR > 여러 파일에서를 선택하고, 파일을 추가한 다음 출력 폴더와 파일명 규칙을 지정하고 일반 설정을 확정하는 방식입니다. 일괄 처리는 시간을 줄이지만 잘못된 언어와 출력 설정도 한꺼번에 적용되므로 먼저 대표 파일 한 건으로 시험해야 합니다.

입력 폴더와 출력 폴더를 분리하고 같은 이름 덮어쓰기를 피하십시오. 예를 들어 01_input_original, 02_ocr_output, 03_reviewed처럼 상태를 나누면 처리 전 파일과 검수 완료 파일이 섞이지 않습니다. 오류가 난 파일 목록과 페이지를 별도 작업 기록에 남기면 전체 배치를 다시 실행할 필요가 없습니다.

단계담당자 행동완료 증거
시험 처리대표 PDF 1건에 언어·범위 적용검색·복사 표본 검수 통과
일괄 입력승인된 입력 폴더의 파일만 추가입력 파일 수 기록
출력 설정별도 폴더와 충돌 없는 이름 규칙 지정원본 수정 시간이 변하지 않음
자동 처리오류 메시지와 실패 파일 기록출력 파일 수와 입력 수 대조
사람 검수고위험 값과 임의 페이지 표본 확인검수자·일시·결과 기록
확정 보관검수 완료본만 배포 폴더로 이동원본·OCR본·기록 연결 가능

구체적인 사례: 80쪽 정산 증빙에서 거래번호 찾기

월말 정산 담당자가 영수증과 거래명세서 80쪽을 하나의 이미지 PDF로 받았다고 가정해 보겠습니다. 목표는 거래번호 A-2407이 적힌 증빙을 빠르게 찾는 것입니다. 먼저 원본을 보존하고 사본에서 페이지 방향을 정리합니다. 한글 설명이 대부분이므로 한국어로 전체 이미지 페이지에 OCR을 적용합니다.

처리가 끝나면 A-2407 전체 문자열만 검색하지 않습니다. 하이픈이 잘못 인식될 수 있으므로 2407, 거래처명, 금액처럼 독립적인 키워드도 교차 검색합니다. 검색 결과 페이지의 거래번호를 확대해 원본 이미지와 비교하고, 금액과 날짜도 함께 대조합니다. 찾은 텍스트를 별도 장부에 옮길 때는 복사값을 그대로 신뢰하지 않고 두 번째 확인자가 원본과 비교하도록 합니다.

이 사례의 성공 기준은 “검색 결과가 나왔다”가 아니라 “요청한 증빙 페이지를 찾았고 핵심 식별값이 원본과 일치한다”입니다. OCR은 탐색 시간을 줄여 주지만 회계 증빙의 사실을 새로 만드는 기능이 아닙니다.

OCR 결과를 정확하게 검수하는 방법

검수는 세 단계로 나누면 누락이 줄어듭니다. 첫째, 기능 검수에서는 검색·선택·복사가 되는지 봅니다. 둘째, 내용 검수에서는 숫자와 고유명사를 원본에 대조합니다. 셋째, 전달 검수에서는 다른 PC에서 열었을 때 페이지 이미지와 검색 기능이 유지되는지 확인합니다.

문서가 길다면 모든 글자를 읽는 대신 위험 기반 표본 검수를 적용합니다. 첫 페이지와 마지막 페이지, 스캔 품질이 가장 나쁜 페이지, 표가 많은 페이지, 도장이나 손글씨가 겹친 페이지, 금액과 식별번호가 있는 페이지는 반드시 포함합니다. 나머지는 일정 간격으로 표본을 뽑습니다. 오류가 한 페이지에서 반복되면 같은 스캔 조건의 전체 구간을 확대 검수합니다.

검색 가능한 텍스트가 이미지 뒤에 숨겨져 보이지 않는 출력 방식에서는 화면만 보고 오류를 발견하기 어렵습니다. 중요한 문장을 복사해 메모장에 붙여넣거나 PDF를 텍스트로 내보내 순서를 확인하십시오. 단, 내보낸 텍스트의 줄바꿈이 원본 레이아웃과 다르다는 이유만으로 OCR 실패라고 단정해서는 안 됩니다. 핵심은 글자의 의미와 값이 보존되었는지입니다.

자주 발생하는 문제와 해결표

증상가능한 원인안전한 해결 순서
OCR 메뉴가 비활성화됨보안 제한 또는 편집 권한 부족문서 속성에서 보안을 확인하고 소유자에게 권한 요청
“렌더링 가능한 텍스트” 오류페이지에 이미 편집 가능한 텍스트가 존재텍스트 페이지를 범위에서 제외하고 이미지 원본 사본 확인
한글이 엉뚱한 문자로 인식됨언어 오선택, 낮은 해상도, 흐린 대비한국어 설정 확인 후 대표 페이지 재처리, 필요하면 재스캔
숫자와 영문이 자주 바뀜글자 크기가 작거나 획이 붙음원본 확대 대조, 핵심 값 수동 검수, 더 나은 원본 확보
표의 읽는 순서가 뒤섞임복잡한 셀 병합과 다단 배치셀 단위로 원본 대조하고 구조화 데이터로 별도 재작성
파일 크기가 예상보다 커짐이미지 품질과 출력 설정 영향원본 보존 후 사본에서 설정 비교, 가독성 우선 평가
일부 페이지만 검색되지 않음혼합 PDF 또는 처리 범위 누락검색 불가 페이지 번호를 적고 해당 범위만 다시 OCR
결과가 저장 후 사라짐저장 위치 혼동 또는 사본 미저장다른 이름으로 저장하고 닫았다 다시 열어 재검증

Adobe는 이미 렌더링 가능한 텍스트가 있는 페이지 때문에 인식 오류가 날 수 있다고 안내합니다. 공식 문서에는 편집 가능한 텍스트가 없는 사본을 확보하는 방법과 TIFF로 변환한 뒤 다시 OCR하는 대안도 제시되어 있습니다. 다만 TIFF 변환은 페이지별 파일 생성과 품질 변화가 따를 수 있으므로 원본을 보존하고, 조직 정책상 허용되는지 확인한 뒤 사본에서만 시험합니다.

실무 정확도를 높이는 팁

첫째, 검색 키워드는 하나만 쓰지 않습니다. 계약번호에 하이픈이 있다면 번호 일부와 거래처명을 함께 검색합니다. 둘째, OCR 전 회전과 기울기 보정을 마친 뒤 인식합니다. 이미 잘못 인식된 결과를 여러 번 덮어쓰기보다 깨끗한 사본에서 다시 처리하는 편이 이력을 관리하기 쉽습니다.

셋째, 검수 결과를 재사용 가능한 표로 남깁니다. 파일명, 페이지 수, OCR 언어, 실행일, 검수한 페이지, 발견 오류, 승인자를 기록하면 나중에 같은 문서를 왜 다시 처리했는지 설명할 수 있습니다. 넷째, 배포본에는 불필요한 주석·첨부·개인정보가 없는지 별도로 검사합니다. OCR은 가려진 개인정보를 삭제하는 기능이 아니며, 검은 사각형을 얹었다고 원문 텍스트가 제거되는 것도 아닙니다.

다섯째, 접근성 개선과 OCR 완료를 같은 의미로 보지 않습니다. 검색 가능한 텍스트 층은 접근성의 한 요소일 뿐이며 제목 구조, 읽기 순서, 대체 텍스트 같은 요구는 별도 점검이 필요합니다. 대외 배포 문서라면 조직의 접근성 검사 절차를 따릅니다.

한계와 주의사항

OCR 결과는 원본의 법적·회계적 내용을 대체하지 않습니다. 스캔 이미지와 인식 텍스트가 다르면 원본 이미지가 우선이며, 중요한 의사결정에 쓰기 전 담당자가 대조해야 합니다. 손글씨, 도장, 세로쓰기, 낡은 팩스, 저대비 복사본은 자동 인식 한계가 큽니다. 내용을 추정해 임의 수정하지 말고 판독 불가 상태를 표시한 뒤 원문 작성자에게 확인합니다.

또한 Acrobat 제품·구독·운영체제에 따라 메뉴 위치와 제공 기능이 달라질 수 있습니다. 이 글의 메뉴는 2026년 8월 5일 확인한 Adobe 공식 데스크톱 도움말을 기준으로 했습니다. 실제 화면이 다르면 비슷한 이름을 억지로 찾기보다 현재 제품의 도움말에서 텍스트 인식 또는 Scan & OCR을 검색하십시오.

최종 체크리스트

  • 원본 PDF를 별도 위치에 보존하고 작업 사본을 만들었다.
  • 문장 선택과 검색으로 OCR이 필요한 페이지를 구분했다.
  • 보안·편집 권한과 조직의 개인정보 처리 규칙을 확인했다.
  • 페이지 방향과 스캔 품질을 확인하고 주 언어를 정확히 선택했다.
  • 혼합 PDF에서는 이미지 페이지만 범위로 지정했다.
  • 고유 단어 검색과 한 줄 복사로 텍스트 층 생성 여부를 확인했다.
  • 금액·날짜·계좌번호·계약번호를 원본 이미지와 대조했다.
  • 표·도장·손글씨·저화질 페이지를 고위험 표본에 포함했다.
  • 결과본을 닫았다 다시 열어 검색 기능과 저장 상태를 확인했다.
  • 원본, OCR 결과본, 검수 기록을 서로 연결해 보관했다.
  • 실제 배포 전 개인정보, 주석, 접근성 요구를 별도로 점검했다.

공식 참고 자료

Adobe 공식 도움말은 단일 파일에서 페이지 범위와 언어를 정해 텍스트를 인식하는 절차, 여러 파일의 출력 폴더와 이름 규칙을 지정하는 절차, 처리 후 정확성과 완전성을 검토하라는 지침을 제공합니다. 실무에서는 여기에 원본 보존과 위험 기반 검수를 더해야 검색 가능한 PDF를 신뢰할 수 있는 업무 자료로 사용할 수 있습니다.