실습 개요
이미지 난이도 설계
합성 문서에 흐림, 기울어짐, 그림자, 해상도 저하, 도장 겹침, 표 경계선 누락, 영수증 구김을 넣어 OCR 난이도별 세트를 작성합니다.
난이도 A/B/C 데이터셋, 이미지 변환 로그, OCR 실패 예상 케이스, 재처리 기준을 작성합니다.
깨끗한 합성 문서를 실제 스캔 문서처럼 흐림·기울어짐·그림자·부분 잘림을 넣어 테스트합니다.
이미지 난이도 설계
합성 문서에 흐림, 기울어짐, 그림자, 해상도 저하, 도장 겹침, 표 경계선 누락, 영수증 구김을 넣어 OCR 난이도별 세트를 작성합니다.
난이도 A/B/C 데이터셋, 이미지 변환 로그, OCR 실패 예상 케이스, 재처리 기준을 작성합니다.
| 방식 | 적합한 상황 | 주요 위험 | 검증 기준 |
|---|---|---|---|
| 완전 합성 | 교육 공개용, 교육 산출물 활용 목적, 반복 테스트용 | 데이터가 과도하게 정제되어 실무 난이도가 낮아질 수 있음 | 가상값이지만 회계 논리와 문서 분포가 실무 현실성을 확보하였는지 검토 |
| 템플릿 참조 | 실제 문서 레이아웃과 유사한 OCR 테스트가 필요한 경우 | 원본 값이나 로고, QR, 메타데이터가 혼입될 수 있음 | 레이아웃만 참고하고 값은 모두 새로 생성했는지 검토 |
| 마스킹·가명처리 | 내부 폐쇄망에서 허가받은 검증을 수행할 때 | 마스킹 잔존정보, 재식별, 원본 반출 위험 | 접근권한·보관기간·재식별 점검표가 있는지 검토 |
| 태깅 최소화 | 원본 이미지를 보관하지 않고 회계 판단 로직을 검증할 때 | OCR 이미지 학습에는 부족할 수 있음 | 필요 필드만 남기고 금액대·거래처 유형 등으로 일반화했는지 검토 |
| 항목 | 예시 | 검증 포인트 |
|---|---|---|
| 문서유형 | 세금계산서, 법인카드 영수증, 거래명세서 | 문서별 필수 필드가 다르게 설계되었는지 검토 |
| 거래처 | 가상 거래처 또는 업종 코드 | 실제 거래처명이 섞이지 않았는지 검토 |
| 금액 | 공급가액, 부가세, 합계금액 | 계산 관계와 소수점·원단위 처리가 맞는지 검토 |
| 라벨 | document_type, vendor, amount, vat, account | Gemma 출력 JSON과 자동 비교 가능한지 검토 |
| 예외 | 중복 증빙, 금액 불일치, 승인 누락 | 정상 데이터만 있는지, 감사 실습용 오류가 포함되었는지 검토 |
이 과정에서 작성한 데이터셋은 다음 단계인 AI OCR 회계 자동화 과정의 입력값이 됩니다. 문서 이미지는 OCR 엔진에 들어가고, OCR 텍스트는 Gemma 프롬프트에 들어가며, 정답 라벨 JSON은 Gemma 결과를 평가하는 기준이 됩니다.
input_image: 합성 또는 안전 처리된 증빙 이미지ocr_text: OCR 엔진이 읽어야 할 예상 텍스트answer_label: 학습자가 비교할 정답 JSONexpected_journal: 전표 자동 생성 결과의 기대값risk_flag: 중복, 금액오류, 기간귀속, 승인누락 같은 감사위험 태그이 산출물은 AI OCR 회계 자동화 개발 실습의 입력 자료이자, 전산감사 관점에서는 데이터 준비 통제가 제대로 설계되었는지 보여주는 감사증거가 됩니다.