PDF 글자가 선택·검색이 안 될 때 — 스캔본과 OCR 이해하기
PDF를 열어 Ctrl+F로 단어를 찾았는데 "결과 없음"이 뜨고, 글자를 드래그하면 페이지 전체가 파랗게 잡히는 경험을 해 봤을 겁니다. 파일이 고장 난 것이 아니라 그 PDF는 글자가 아니라 그림으로 만들어진 것입니다. 이 글은 텍스트 PDF와 이미지 PDF를 30초 만에 구분하는 법, 이미지 PDF가 생기는 이유(이 사이트의 압축 도구도 그중 하나입니다), 글자를 되살리는 OCR의 원리와 한계, 프로그램·앱별로 텍스트를 인식하는 방법, 그리고 개인정보 서류를 다룰 때 지켜야 할 것을 정리합니다. 스캔본을 처음 만드는 법은 사진·스캔본 PDF 만들기에서 다루고, 이 글은 이미 만들어진 이미지 PDF에서 글자를 되살리는 문제에 집중합니다.
내 PDF는 텍스트일까 이미지일까 — 30초 확인법
PDF는 겉보기엔 같아도 속은 두 종류입니다. 텍스트 PDF는 글자 하나하나가 '문자 코드 + 글꼴 + 위치'로 저장되어 있고, 이미지 PDF는 페이지 전체가 사진 한 장으로 들어 있습니다. 구분은 세 가지만 해 보면 됩니다.
| 확인 방법 | 텍스트 PDF | 이미지 PDF(스캔본) |
|---|---|---|
| 글자를 드래그 | 한 줄·한 단어 단위로 선택됩니다 | 페이지 전체가 통째로 잡히거나 아무것도 안 잡힙니다 |
| Ctrl+F(Cmd+F)로 본문 단어 검색 | 찾아서 강조합니다 | 결과 없음 |
| 400% 이상 확대 | 글자 가장자리가 끝까지 매끈합니다 | 가장자리가 계단처럼 깨지거나 뿌옇습니다 |
| 파일 용량(글 위주 문서 기준) | 페이지당 수십 KB | 페이지당 수백 KB~수 MB |
드물게 섞인 PDF도 있습니다. 앞부분은 워드로 만든 텍스트 페이지, 뒤에 붙인 별첨은 스캔본인 경우입니다. 또 이미 OCR을 거친 스캔본은 보기엔 스캔 이미지인데 드래그와 검색이 되는데, 이것이 바로 아래에서 설명할 '검색 가능한 PDF'입니다.
이미지 PDF는 왜 생기나
- 스캐너·복합기로 스캔 — 스캐너는 종이를 사진으로 찍는 장치입니다. OCR 옵션을 켜지 않으면 결과는 이미지 PDF입니다. 사무실 복합기의 '스캔하여 PDF' 기본값이 대부분 이 상태입니다.
- 스마트폰 사진 → PDF — 카메라로 찍은 서류를 PDF로 묶으면 당연히 이미지입니다. 만드는 방법은 사진·스캔본을 PDF로 만드는 법을 참고하세요.
- 이미지 재압축 방식의 용량 줄이기 도구 — 각 페이지를 그림으로 다시 그려 압축하는 도구를 거치면 텍스트 PDF도 이미지 PDF가 됩니다. 이 사이트의 PDF 용량 줄이기가 정확히 이 방식입니다. 업로드 없이 브라우저에서 처리되고 스캔본에는 효과가 크지만, 텍스트 PDF에 쓰면 글자 선택이 사라진다는 점을 도구 페이지에도 적어 두었습니다. 텍스트를 유지하면서 줄이는 방법은 PDF 용량 줄이는 법 총정리에 따로 정리했습니다.
- 팩스·이미지로 저장한 뒤 다시 PDF로 — 팩스 수신본, 캡처 이미지, JPG로 변환했다가 다시 묶은 PDF도 모두 이미지입니다. PDF를 JPG로 변환하는 법에서 다룬 것처럼, 한번 이미지가 되면 다시 PDF로 묶어도 글자는 돌아오지 않습니다.
- 일부러 이미지로 만든 문서 — 복사·편집을 막으려고 일부러 이미지로 배포하는 계약서·시험지도 있습니다.
OCR이란 무엇이고, 어디까지 믿을 수 있나
OCR(광학 문자 인식)은 그림 속 글자 모양을 분석해 '이건 ㄱ, 이건 A'처럼 문자로 바꾸는 기술입니다. 결과를 두 가지 형태로 받을 수 있습니다. 하나는 검색 가능한 PDF로, 원래 스캔 이미지 위에 눈에 보이지 않는 텍스트 층을 얹어 모양은 그대로 두고 드래그·검색·복사만 가능하게 만듭니다. 다른 하나는 텍스트만 추출해 워드·메모장·엑셀로 가져가는 방식입니다. 서류 원형을 지켜야 하면 전자, 내용을 다시 편집하려면 후자입니다.
정확도는 원본 상태에 크게 좌우됩니다. 실제로 써 보면 대략 이렇습니다.
- 깨끗한 인쇄체 본문(한글·영문) — 대부분 잘 읽습니다. 그래도 문서 한 장에 오타 몇 개는 나온다고 보고 대조해야 합니다.
- 숫자 — 0과 O, 1과 l과 I, 6과 b, 8과 3이 흔히 바뀝니다. 금액·계좌·주민번호는 눈으로 반드시 확인합니다.
- 표 — 글자는 읽어도 셀 구조는 잘 무너집니다. 열이 합쳐지거나 순서가 섞이는 일이 흔해서, 엑셀로 가져갈 때 손이 갑니다.
- 손글씨 — 정확도가 크게 떨어집니다. 또박또박 쓴 숫자 정도만 기대할 수 있습니다.
- 도장·밑줄·형광펜이 겹친 글자, 기울어진 스캔, 흐릿한 팩스 — 오류가 급격히 늘어납니다.
OCR 하는 방법 — 프로그램·앱별
메뉴 이름과 위치는 버전에 따라 조금씩 다를 수 있습니다. 여기서는 어떤 종류의 기능을 찾으면 되는지 위주로 정리합니다.
① 어도비 아크로뱃 — '텍스트 인식(스캔 및 OCR)'
유료 버전인 아크로뱃 프로에는 도구 → 스캔 및 OCR → 텍스트 인식 기능이 있어, 열려 있는 PDF 전체를 검색 가능한 PDF로 바꿔 저장합니다. 언어를 한국어로 지정하고 실행하면 되고, 출력 방식에서 '검색 가능한 이미지'를 고르면 원본 모양이 유지됩니다. 무료 리더에는 이 기능이 없습니다.
② 스캔 앱에 내장된 OCR
스마트폰 스캔 앱(사무용 스캔 앱, 문서 스캐너 계열) 상당수는 스캔 직후 '텍스트 인식' 또는 '검색 가능한 PDF로 저장' 옵션을 제공합니다. 처음부터 이 옵션을 켜고 스캔하면 별도 작업이 필요 없습니다. 무료 버전은 페이지 수 제한이나 워터마크가 있는 경우가 있으니 저장 전에 확인하세요.
③ 구글 드라이브 — 업로드해서 구글 문서로 열기
이미지 PDF나 JPG를 구글 드라이브에 올린 뒤 우클릭 → 연결 앱 → Google 문서로 열면 자동으로 OCR이 되어 텍스트가 문서 아래에 나타납니다. 한글 인식률이 준수하고 무료라는 장점이 있습니다. 구글 도움말은 인식 대상 파일을 2MB 이하로 권장하므로, 큰 스캔본은 필요한 페이지만 잘라 올리는 편이 성공률이 높습니다(정책은 바뀔 수 있음). 다만 파일이 구글 서버로 올라간다는 점과 페이지 크기·레이아웃이 유지되지 않는다는 점은 알아야 합니다. 검색 가능한 PDF가 아니라 텍스트 추출 용도에 맞습니다.
④ 맥 — 미리보기·사진의 라이브 텍스트
최근 macOS의 미리보기는 이미지 PDF를 열어도 글자 위에 마우스를 올리면 커서가 텍스트 선택 모양으로 바뀌고, 드래그해서 복사할 수 있습니다(라이브 텍스트). 파일 자체를 검색 가능한 PDF로 저장해 주지는 않지만, 몇 줄 복사하는 데는 이만큼 빠른 방법이 없습니다. 한국어 라이브 텍스트는 비교적 최근 버전부터 지원되므로, 글자 위에서 커서가 바뀌지 않으면 macOS 버전과 시스템 설정의 언어 항목을 확인하세요.
⑤ 아이폰·아이패드 — 사진·파일 앱의 라이브 텍스트
사진 앱에서 서류 사진을 열고 글자를 길게 누르면 선택·복사·번역이 됩니다. 파일 앱에서 연 PDF도 마찬가지입니다. 카메라 앱에서 실시간으로 글자를 인식해 복사하는 것도 가능해서, 종이 문서의 계좌번호 같은 것을 옮겨 적을 때 유용합니다. 역시 파일을 바꾸지는 않고 복사만 해 줍니다.
⑥ 윈도우 — 캡처 도구의 텍스트 동작
윈도우 11의 캡처 도구(Win+Shift+S로 캡처한 뒤 알림을 눌러 편집 창을 열면)에는 텍스트 동작 버튼이 있어 캡처한 이미지 안의 글자를 인식해 복사할 수 있습니다. PDF를 화면에 띄우고 필요한 부분만 캡처하면 되니, 몇 줄 옮길 때 편합니다. 윈도우 버전과 캡처 도구 버전에 따라 이 기능이 없을 수 있습니다.
⑦ 갤럭시 — 갤러리·키보드의 텍스트 추출
갤러리에서 사진을 열면 글자가 있을 때 텍스트 추출 아이콘이 나타나고, 삼성 키보드에도 사진에서 글자를 가져오는 기능이 있습니다. 동작 방식은 아이폰 라이브 텍스트와 비슷합니다.
검색 가능한 PDF로 저장 vs 텍스트만 추출 — 무엇을 고를까
| 상황 | 권장 방식 | 이유 |
|---|---|---|
| 계약서·증빙을 보관하면서 나중에 찾기 쉽게 | 검색 가능한 PDF | 원형 유지, 검색으로 위치만 찾고 내용은 원본으로 확인 |
| 옛 자료의 내용을 새 문서에 옮겨 편집 | 텍스트 추출(워드·구글 문서) | 편집이 목적이라 레이아웃은 버려도 됨 |
| 표 데이터를 엑셀로 | 텍스트 추출 후 수작업 정리 | OCR 표 인식은 구조가 잘 깨지므로 검수 필수 |
| 몇 줄만 급하게 복사 | 라이브 텍스트·캡처 도구 | 파일을 바꾸지 않고 바로 복사 |
| 수백 페이지 자료 일괄 처리 | 아크로뱃·전용 OCR 프로그램 | 일괄 처리와 언어 설정, 정확도 옵션이 있음 |
개인정보 서류를 온라인 OCR에 올릴 때
"무료 OCR 사이트"에 신분증 사본, 등본, 급여명세서, 진단서를 올리는 것은 사실상 그 서류를 제3자에게 건네는 일입니다. OCR은 원리상 서버가 이미지를 읽어야 하므로 업로드형 서비스는 파일을 반드시 서버로 보냅니다. 편의를 얻는 대가로 무엇을 넘기는지 따져 보세요.
- 민감한 서류는 기기 안에서 끝나는 방법(맥·아이폰 라이브 텍스트, 윈도우 캡처 도구, 설치형 프로그램)을 우선합니다.
- 온라인 서비스를 써야 한다면 삭제 정책, https 여부, 결과 링크 공개 범위를 확인하고, 필요한 페이지만 잘라서 올립니다. 페이지 추출 방법은 PDF 분할·페이지 추출을 참고하세요.
- 주민번호 뒷자리, 계좌번호처럼 OCR이 필요 없는 부분은 올리기 전에 가리는 편이 낫습니다. 가리는 법은 신분증·계약서 사본 안전하게 보내는 법에 있습니다.
- 회사 문서라면 사내 보안 규정상 외부 업로드가 금지된 경우가 많습니다. 확인 없이 올리지 마세요.
원본 품질을 높이면 OCR이 절반은 해결됩니다
OCR 정확도는 소프트웨어보다 입력 이미지가 더 크게 좌우합니다. 다시 찍거나 스캔할 수 있다면 다음을 지키세요.
- 해상도 200~300dpi. 스캐너 설정에서 300dpi를 고르면 충분하고, 그 이상은 용량만 커집니다. 스마트폰 촬영이면 A4 한 장이 긴 변 2500px 안팎으로 찍히게 화면에 꽉 채웁니다.
- 기울기 없이 정면에서. 기울어진 글줄은 인식률을 눈에 띄게 떨어뜨립니다. 스캔 앱의 자동 보정을 쓰거나 스캐너 유리에 종이를 가이드에 딱 붙입니다.
- 그림자와 반사 제거. 창가나 스탠드 아래에서 찍으면 절반이 어두워집니다. 균일한 밝기가 중요합니다. 촬영 요령은 스캔본 PDF 가이드의 '찍을 때 지키면 다시 찍을 일이 없는 것들'에 정리되어 있습니다.
- 흑백(또는 회색조) 모드. 글자만 있는 서류는 흑백 스캔이 대비가 높아 OCR에 유리하고 용량도 작습니다. 도장 색을 남겨야 하는 서류는 컬러로.
- JPG 과압축 금지. 품질을 너무 낮춰 글자 주변에 얼룩(압축 잡음)이 생기면 인식이 나빠집니다. OCR 전 원본은 줄이지 말고, 용량은 OCR 뒤에 줄입니다.
OCR이 필요 없는 경우도 많습니다
모든 스캔본에 OCR을 할 필요는 없습니다. 다음 상황은 그대로 두어도 됩니다.
- 제출만 하고 끝나는 서류 — 받는 쪽이 눈으로 확인하는 증빙·신청서는 이미지 PDF로 충분합니다. 오히려 OCR을 거치며 파일 구조가 바뀌어 일부 접수 시스템에서 문제가 생기는 경우도 있습니다.
- 한 번 보고 지울 자료 — 검색할 일이 없는데 시간을 들일 이유가 없습니다.
- 원본 문서 파일이 있는 경우 — 워드·한글 원본이 있다면 OCR 대신 원본에서 PDF를 다시 만드는 것이 정확도 100%입니다. 방법은 워드·한글·엑셀을 PDF로 저장하는 법에 있습니다.
- 몇 줄만 필요한 경우 — 위에서 소개한 라이브 텍스트·캡처 도구로 그 부분만 복사하면 됩니다.
자주 묻는 질문
OCR을 하면 원본 PDF의 모양이 바뀌나요?
'검색 가능한 PDF'로 저장하는 방식이라면 보이는 모양은 그대로입니다. 스캔 이미지 위에 눈에 보이지 않는 투명한 텍스트 층을 얹는 구조라서, 화면과 인쇄 결과는 원본과 같고 드래그·검색·복사만 추가로 됩니다. 반면 '텍스트만 추출'이나 '워드로 변환'을 고르면 레이아웃을 새로 짜기 때문에 표와 줄 바꿈이 달라질 수 있습니다. 서류의 원형을 유지해야 한다면 검색 가능한 PDF 방식을 고르세요.
한글 문서의 OCR 정확도는 어느 정도인가요?
깨끗하게 스캔한 인쇄체 본문이라면 요즘 OCR은 대부분의 글자를 맞히지만, 100%는 아닙니다. 특히 받침이 복잡한 글자, 작은 글씨의 숫자 0과 O, 1과 l, 표 안의 짧은 항목, 도장이나 밑줄이 겹친 부분에서 오류가 늘어납니다. 손글씨는 정확도가 크게 떨어집니다. 그래서 OCR 결과를 계약 금액·계좌번호·주민번호처럼 숫자가 중요한 곳에 쓸 때는 원본 이미지와 반드시 대조해야 합니다.
PDF 용량 줄이기 도구를 썼더니 글자 선택이 안 됩니다. 되돌릴 수 있나요?
페이지를 이미지로 다시 그려 압축하는 방식의 도구는 결과물이 이미지 PDF가 됩니다. 이 사이트의 PDF 용량 줄이기 도구도 그런 방식입니다. 압축된 파일 자체에서 텍스트를 되살릴 수는 없고, 다시 OCR을 하거나 원본 PDF를 찾아 텍스트를 유지하는 압축 방법(아크로뱃의 파일 크기 줄이기, 워드·한글에서 다시 저장 등)으로 처리해야 합니다. 그래서 텍스트 PDF를 압축할 때는 원본을 반드시 남겨 두어야 합니다.
OCR 없이 스캔본 PDF에서 한 줄만 복사하고 싶어요.
전체를 OCR할 필요 없이 화면에서 바로 뽑는 방법이 있습니다. 맥은 미리보기에서 라이브 텍스트로 글자를 드래그해 복사할 수 있고, 아이폰은 사진 앱이나 파일 앱에서 글자를 길게 눌러 선택하면 됩니다. 윈도우는 캡처 도구(Win+Shift+S)로 그 부분을 찍은 뒤 캡처 도구 편집 화면의 텍스트 동작 기능으로 복사하거나, 갤럭시는 사진의 글자를 길게 눌러 선택합니다. 인식 결과에 오타가 섞일 수 있으니 붙여 넣은 뒤 원본과 한 번 대조하세요.
정리
글자가 선택·검색되지 않는 PDF는 고장이 아니라 이미지 PDF이고, 드래그와 Ctrl+F 두 가지로 바로 구분할 수 있습니다. 스캔·사진·팩스, 그리고 페이지를 이미지로 재압축하는 용량 줄이기 도구가 이미지 PDF를 만드는 대표적인 경로입니다. 글자를 되살리려면 OCR이 필요한데, 서류 원형을 지키려면 '검색 가능한 PDF', 편집이 목적이면 '텍스트 추출'을 고르고, 숫자·표·손글씨는 결과를 반드시 원본과 대조하세요. 몇 줄만 필요하면 맥·아이폰 라이브 텍스트나 윈도우 캡처 도구로 충분하고, 민감한 서류는 기기 안에서 끝나는 방법을 우선합니다. 무엇보다 깨끗한 원본(300dpi, 기울기 없음, 균일한 밝기)이 OCR 정확도의 절반을 결정합니다.
스캔본 PDF의 용량을 줄이거나 OCR 전에 필요한 페이지만 추출할 때는 브라우저에서 바로 처리하세요. 텍스트 PDF를 압축하면 글자 선택이 안 된다는 점만 기억하면 됩니다. 설치·가입 없이 무료입니다.
PDF 용량 줄이기 열기 PDF 페이지 추출 열기