이 가이드는 짧은 명령어 하나로 끝나지 않습니다. 필요한 자료를 정리하고, AI가 추측하지 않게 경계를 주고, 출력 내용을 원문과 대조해 실제로 사용할 수 있는 결과로 만드는 전체 과정을 설명합니다.
예시 안내 본문의 입력과 기대 결과는 절차를 설명하기 위해 구성한 예시입니다. 실제 수행 결과나 성과를 주장하지 않으며, 중요한 업무에는 원자료와 담당자의 최종 확인이 필요합니다.
- 문서 상태와 사용 목적이 다른 페이지를 작은 시험 세트로 만듭니다.
- 문자 정확도와 함께 읽기 순서, 표 셀, 각주, 페이지 연결을 확인합니다.
- 원본 보존·검수 시간·접근성·데이터 처리 조건까지 비교해 용도별로 선택합니다.
완성 결과물
누구에게 필요하고, 누구에게는 맞지 않을까
이런 분께 맞습니다
- 스캔 PDF를 검색 가능한 문서나 내부 지식 자료로 바꾸려는 실무자
- 영수증·신청서·표 중심 보고서에서 값을 추출하려는 운영팀
- 한글과 영문, 숫자, 작은 각주가 섞인 자료에 맞는 OCR을 고르려는 담당자
이 경우에는 멈추세요
- 원본 이미지 없이 OCR 텍스트만을 법적·회계 증빙으로 사용하려는 경우
- 민감 문서를 외부 서비스에 올릴 권한과 처리 조건을 확인하지 않은 경우
- 검색용 텍스트, 표 데이터 추출, 접근성 문서 생성을 같은 점수로 판단하려는 비교
시작 전에 준비할 것
도구를 열기 전에 입력 자료와 최종 확인자를 정하면, 그럴듯하지만 틀린 결과를 줄일 수 있습니다.
- 처리 권한이 있고 개인정보를 제거한 시험 문서
- 문서 유형·상태·언어가 다른 대표 페이지 15~30장
- 사람이 확인한 페이지·영역별 기준 텍스트
- 사용 목적별 필수 항목과 허용 오류
- 원본 이미지와 OCR 결과를 분리 보관할 위치
단계별 과정
사용 목적과 실패 비용부터 구분합니다
왜 필요한가 — 검색 색인용 OCR과 금액을 표로 옮기는 OCR, 접근 가능한 PDF를 만드는 OCR은 중요한 오류가 다릅니다.
목적을 문서 검색, 본문 재사용, 표·양식 데이터 추출, 접근성 보조 중 하나 이상으로 적습니다. 검색용이라면 핵심 용어 누락, 표 추출이라면 행·열 뒤섞임, 접근성이라면 읽기 순서와 제목 구조가 중요한 실패가 됩니다.
숫자·날짜·계좌·조항 번호처럼 틀리면 곤란한 필드를 표시하고 자동 반영 가능한 범위를 정합니다. 법률·회계·인사 문서는 OCR 결과를 후보로만 사용하고 원본 확인 단계를 필수로 둡니다.
목적=과거 운영 매뉴얼 검색 + 표 안의 부품번호 추출 필수=제목과 본문 읽기 순서, 부품번호 완전 일치 허용=장식용 점선 일부 누락 자동 반영=없음
평가 축=본문 문자 / 핵심 용어 / 읽기 순서 / 표 셀 / 페이지 연결 치명 오류=부품번호 대치, 표의 행 이동 최종 확인=원본 이미지 대조
어려움이 다른 대표 페이지를 고릅니다
왜 필요한가 — 깨끗한 흑백 본문만 시험하면 기울기, 얼룩, 작은 글씨, 표, 다단 구성에서 생기는 오류를 숨기게 됩니다.
깨끗한 인쇄물, 낮은 대비, 기울어진 스캔, 접힌 자국, 도장이나 메모가 겹친 페이지, 2단 편집, 표, 작은 각주, 세로 글씨를 나눠 담습니다. 한글·영문·숫자·기호가 섞인 실제 비율도 반영합니다.
각 페이지에 page_id, 원본 형식, 해상도, 색상 모드, 회전, 문서 유형, 손상 조건을 기록합니다. 도구에 맞추려고 한쪽 파일만 과도하게 보정하지 말고 원본 비교와 공통 전처리 비교를 별도 실험으로 나눕니다.
P01 300dpi 흑백 본문 P02 200dpi, 3도 기울기 P03 한글·영문 부품표 8열 P04 도장과 본문 겹침 P05 2단 본문과 작은 각주
페이지 목록: page_id | dpi | 회전 | 대비 | 레이아웃 | 언어 | 중요 영역 | 사용 권한 목적별로 최소 3개 대표 페이지 확보
페이지와 영역별 기준 정답을 만듭니다
왜 필요한가 — 전체 텍스트 한 덩어리만 있으면 표 셀이나 각주, 읽기 순서가 어디에서 잘못됐는지 찾기 어렵습니다.
사람이 원본 이미지를 보며 제목, 본문, 표 셀, 각주, 머리글을 영역별로 전사합니다. 글자가 실제로 읽히지 않는 곳은 추측하지 않고 판독 불가로 표시하며 두 번째 검토자가 숫자와 고유명사를 다시 확인합니다.
정답 파일에는 page_id, region_id, region_type, reading_order, text를 넣습니다. 표는 행·열 좌표와 병합 셀을 기록하고, 검색 목적과 무관한 장식 요소는 평가 제외라고 명시합니다.
P03-R12 | table_cell | row=4 | col=2 | text=AX-104B P05-R07 | footnote | order=18 | text=개정일 2025-12-01 P04-R03 | paragraph | text=[판독 불가 2자]
ground_truth v1.0 영역별 텍스트와 읽기 순서 확정 숫자·부품번호 이중 검토 완료 판독 불가 구간은 오류 계산에서 별도 처리
문자 오류와 구조 오류를 따로 평가합니다
왜 필요한가 — 문자가 대부분 맞아도 두 단의 읽기 순서가 섞이거나 표 값이 옆 셀로 이동하면 재사용할 수 없습니다.
기준 텍스트와 OCR 출력을 같은 정규화 규칙으로 맞춘 뒤 문자 누락, 삽입, 대치를 셉니다. 공백과 줄바꿈을 평가에 포함할지 미리 정하고 한글 자모가 분리되는 인코딩 문제도 별도 오류로 남깁니다.
제목·본문·각주 순서, 표의 행·열 보존, 페이지 번호, 중요 필드 완전 일치를 별도 게이트로 봅니다. 평균 문자 오류와 함께 페이지별 최악 결과를 표시해 어려운 문서의 실패가 숨지 않게 합니다.
기준 셀=P03 R4C2 AX-104B 도구 A=P03 R4C3 AX-1048 도구 B=P03 R4C2 AX-104B
A 문자 대치=B→8, 구조 오류=값이 C2에서 C3으로 이동, 치명 B 문자·셀 위치=통과 집계=문자 오류율과 표 구조 통과율 별도 표시
검수 흐름과 원본 보존, 접근성을 확인합니다
왜 필요한가 — 정확도가 비슷하면 사람이 오류를 찾고 고치는 과정과 원본 추적성, 데이터 처리 조건이 실제 선택을 좌우합니다.
검토자가 같은 페이지 묶음을 수정하며 페이지당 시간, 오류 위치 강조, 원본과 텍스트 나란히 보기, 일괄 찾기, 재처리, 내보내기 형식을 기록합니다. 수정 후 텍스트가 어느 원본 페이지와 영역에서 왔는지 유지되는지도 봅니다.
검색 가능한 PDF라고 해서 자동으로 접근 가능한 문서가 되는 것은 아닙니다. 태그 구조, 제목, 읽기 순서, 이미지 대체 텍스트, 언어 설정은 별도로 확인하고, 서비스 공식 문서에서 업로드·보관·삭제·학습 사용 조건을 검토합니다.
필수=원본 이미지 보존, page_id 추적, 표 셀 수정, 검색 가능한 PDF와 UTF-8 텍스트 내보내기 접근성=제목·읽기 순서·언어 태그 별도 점검 보안=삭제 절차 확인
선택표: 문자 | 핵심 필드 | 구조 | 최악 페이지 | 검수 시간 | 원본 추적 | 내보내기 | 접근성 후처리 | 데이터 조건 | 판정 용도별 선택=검색용 / 표 추출용 / 사용 보류
수정해 쓰는 재사용 입력
중괄호 부분을 자신의 상황으로 바꾸고, 실제 자료를 넣기 전에 개인정보와 공개하면 안 되는 내용을 제거하세요. 결과는 반드시 원문과 대조합니다.
아래는 한 OCR 페이지의 기준 정답과 도구 출력입니다. 원본 이미지 없이 글자를 추정하지 말고 비교 후보만 구조화하세요.
[평가 목적]
{{검색 / 본문 재사용 / 표 추출 / 접근성}}
[정규화 규칙]
{{공백·줄바꿈·숫자·한글 자모 처리}}
[기준 영역]
{{page_id / region_id / type / row·col / reading_order / text}}
[OCR 출력]
{{도구의 원본 텍스트와 위치 정보}}
[중요 필드]
{{숫자·날짜·고유명사·부품번호}}
[출력]
영역 ID | 누락·삽입·대치 후보 | 읽기 순서 오류 | 표 위치 오류 | 중요 필드 여부 | 원본 이미지 재확인 필요 | 사람 판정 칸결과 확인 체크리스트
- OCR 결과의 실제 사용 목적을 정했다.
- 목적별 치명 오류와 허용 오류를 구분했다.
- 상태·레이아웃·언어가 다른 페이지를 포함했다.
- 페이지별 해상도·회전·손상 조건을 기록했다.
- 시험 문서의 처리 권한과 개인정보를 확인했다.
- 사람이 영역별 기준 텍스트를 만들었다.
- 숫자와 고유명사를 두 번째 검토자가 확인했다.
- 문자 오류와 구조 오류를 따로 계산했다.
- 표의 행·열과 다단 읽기 순서를 검사했다.
- 평균과 함께 최악 페이지를 확인했다.
- 원본과 OCR·수정본을 분리 보관했다.
- 검수 시간·접근성·데이터 조건을 함께 비교했다.
자주 막히는 지점과 해결법
기울기·낮은 대비·표·다단·각주·혼합 언어가 있는 대표 페이지를 목적별로 넣습니다.
표 셀의 행·열 좌표와 읽기 순서를 별도 구조 게이트로 평가합니다.
판독 불가를 명시하고 오류 계산과 수동 확인에서 별도 상태로 처리합니다.
태그 구조, 제목, 읽기 순서, 문서 언어와 대체 텍스트를 별도 점검합니다.
개인정보·저작권·정확성 주의
AI가 자연스럽게 작성했다는 사실은 정확성과 이용 권한을 보장하지 않습니다. 공개하거나 전달하기 전에 아래 항목을 확인하세요.
- OCR 텍스트는 원본 이미지나 승인된 증빙을 대체하지 않습니다.
- 계약·회계·의료·인사 문서의 숫자와 핵심 문구는 사람이 원본을 대조하세요.
- 민감 문서를 외부 OCR에 업로드하기 전에 보관·삭제·학습 사용 조건과 조직 승인을 확인하세요.
- 전처리로 대비와 기울기를 바꾸면 원본 충실성과 OCR 결과가 함께 달라지므로 처리 이력을 남기세요.
- 문자 오류율은 정규화 규칙과 기준 정답에 따라 달라지므로 숫자만 단독 비교하지 마세요.
- 손글씨·도장·수식·세로 글씨는 일반 인쇄 본문과 다른 평가 세트가 필요할 수 있습니다.
자주 묻는 질문
300dpi로 스캔하면 OCR 정확도가 보장되나요?
보장되지 않습니다. 해상도 외에도 초점, 대비, 압축, 기울기, 원본의 얼룩과 글자 크기가 영향을 줍니다. 실제 문서 조건을 기록하고 대표 페이지에서 결과를 확인해야 합니다.
검색 가능한 PDF면 접근 가능한 PDF인가요?
아닙니다. OCR 텍스트 층이 있어도 제목 구조, 읽기 순서, 문서 언어, 이미지 대체 텍스트와 태그가 빠질 수 있습니다. 접근성 검사는 별도 단계로 진행해야 합니다.
문자 오류율만으로 표 추출 성능을 비교해도 되나요?
부족합니다. 글자가 맞아도 값이 옆 셀이나 다른 행으로 이동할 수 있습니다. 표의 행·열 좌표, 병합 셀, 머리글 연결과 중요 필드 완전 일치를 별도 항목으로 확인하세요.
OCR이 끝나면 원본 스캔을 삭제해도 되나요?
일반적으로 원본 대조가 끝나기 전에는 삭제하면 안 됩니다. 조직의 보존 정책에 따라 원본, OCR 원본 출력, 사람 수정본을 구분해 보관하고 각 텍스트가 어느 페이지에서 왔는지 추적할 수 있게 하세요.
공식 출처와 확인 기준
출처는 각 원자료가 다루는 범위 안에서 참고했습니다. 서비스 화면과 기능은 바뀔 수 있으므로 실제 사용 전 최신 문서를 다시 확인하세요.
수정 이력
2026-08-15 — 작성 및 편집 검수.