실습 개요
실무 유사성 평가
문서유형 비율, 금액 구간, 계정과목 분포, 월말 집중도, 예외거래 비율이 실제 회계업무와 비슷한지 검증합니다. 과도하게 완벽한 데이터는 실습 효과가 낮습니다.
분포 비교표, 회계 논리 검증표, 예외 패턴 목록, 데이터셋 보완 권고안을 작성합니다.
실무 유사성 평가
문서유형 비율, 금액 구간, 계정과목 분포, 월말 집중도, 예외거래 비율이 실제 회계업무와 비슷한지 검증합니다. 과도하게 완벽한 데이터는 실습 효과가 낮습니다.
분포 비교표, 회계 논리 검증표, 예외 패턴 목록, 데이터셋 보완 권고안을 작성합니다.
| 방식 | 적합한 상황 | 주요 위험 | 검증 기준 |
|---|---|---|---|
| 완전 합성 | 교육 공개용, 교육 산출물 활용 목적, 반복 테스트용 | 데이터가 과도하게 정제되어 실무 난이도가 낮아질 수 있음 | 가상값이지만 회계 논리와 문서 분포가 실무 현실성을 확보하였는지 검토 |
| 템플릿 참조 | 실제 문서 레이아웃과 유사한 OCR 테스트가 필요한 경우 | 원본 값이나 로고, QR, 메타데이터가 혼입될 수 있음 | 레이아웃만 참고하고 값은 모두 새로 생성했는지 검토 |
| 마스킹·가명처리 | 내부 폐쇄망에서 허가받은 검증을 수행할 때 | 마스킹 잔존정보, 재식별, 원본 반출 위험 | 접근권한·보관기간·재식별 점검표가 있는지 검토 |
| 태깅 최소화 | 원본 이미지를 보관하지 않고 회계 판단 로직을 검증할 때 | OCR 이미지 학습에는 부족할 수 있음 | 필요 필드만 남기고 금액대·거래처 유형 등으로 일반화했는지 검토 |
| 항목 | 예시 | 검증 포인트 |
|---|---|---|
| 문서유형 | 세금계산서, 법인카드 영수증, 거래명세서 | 문서별 필수 필드가 다르게 설계되었는지 검토 |
| 거래처 | 가상 거래처 또는 업종 코드 | 실제 거래처명이 섞이지 않았는지 검토 |
| 금액 | 공급가액, 부가세, 합계금액 | 계산 관계와 소수점·원단위 처리가 맞는지 검토 |
| 라벨 | document_type, vendor, amount, vat, account | Gemma 출력 JSON과 자동 비교 가능한지 검토 |
| 예외 | 중복 증빙, 금액 불일치, 승인 누락 | 정상 데이터만 있는지, 감사 실습용 오류가 포함되었는지 검토 |
이 과정에서 작성한 데이터셋은 다음 단계인 AI OCR 회계 자동화 과정의 입력값이 됩니다. 문서 이미지는 OCR 엔진에 들어가고, OCR 텍스트는 Gemma 프롬프트에 들어가며, 정답 라벨 JSON은 Gemma 결과를 평가하는 기준이 됩니다.
input_image: 합성 또는 안전 처리된 증빙 이미지ocr_text: OCR 엔진이 읽어야 할 예상 텍스트answer_label: 학습자가 비교할 정답 JSONexpected_journal: 전표 자동 생성 결과의 기대값risk_flag: 중복, 금액오류, 기간귀속, 승인누락 같은 감사위험 태그이 산출물은 AI OCR 회계 자동화 개발 실습의 입력 자료이자, 전산감사 관점에서는 데이터 준비 통제가 제대로 설계되었는지 보여주는 감사증거가 됩니다.