본문으로 건너뛰기
ezyPDF
PDF 최적화준비 중서버 필요

PDF 문자 인식(OCR) — 현재 준비 중

스캔한 PDF는 사람 눈에는 글자로 보이지만 파일 안에서는 그림일 뿐입니다. OCR은 이 그림에서 글자를 읽어내 검색과 복사가 가능한 텍스트 층을 덧붙이는 작업입니다.

한국어는 자모가 결합된 구조와 세로쓰기·표 혼재 때문에 영문보다 인식이 까다롭습니다. 인식률이 낮은 결과를 '검색 가능한 PDF'라고 제공하면 오히려 잘못된 검색 결과를 낳으므로, 품질 검증 후에 도입할 계획입니다.

현재 이 기능은 제공하지 않습니다

작동하지 않는 기능을 작동하는 것처럼 보이게 하지 않기 위해, 파일 선택 영역을 만들지 않았습니다. 아래에 현재 상태와 필요한 기술을 정리했습니다.

PDF OCR 기능의 지원 상태와 기술 요건
현재 지원 상태미지원 (준비 중)
필요한 기술Tesseract(Apache-2.0) + 한국어 학습 데이터, 이미지 전처리(기울기 보정·이진화), 작업 큐
구현 난이도높음
예상 서버 비용페이지당 CPU 시간이 길어 월 5만 원 이상, 대량 처리 시 큐·워커 증설 필요
외부 API 필요 여부선택 (정확도가 중요하면 상용 OCR API 검토)

지금 사용할 수 있는 대안

  • 스캔 앱의 텍스트 인식

    휴대폰 기본 카메라나 문서 스캔 앱 중에는 촬영 즉시 텍스트를 인식해 주는 기능이 있습니다.

  • 원본 문서 확보

    가능하면 스캔본 대신 원본 전자 문서를 받는 것이 정확도와 용량 모두에서 유리합니다.

파일은 어떻게 처리되나요?

이 페이지는 파일을 받지 않습니다.

이 페이지에는 파일 선택 영역이 없으므로 어떤 데이터도 처리되지 않습니다. 자세한 내용은 개인정보처리방침과 파일 보관 정책에서 확인하실 수 있습니다.

PDF OCR 자주 묻는 질문

인식률은 어느 정도인가요?
원본 해상도와 글꼴에 크게 좌우됩니다. 300dpi 이상 선명한 스캔은 실용적인 수준이지만, 휴대폰으로 비스듬히 찍은 사진은 오류가 많습니다.
OCR을 하면 파일이 커지나요?
텍스트 층이 추가되므로 조금 커집니다. 대신 검색과 복사가 가능해집니다.