콘텐츠로 이동
Image 문서0.3

OCR 연동

최신 안정판 Image 0.3.0 릴리스 기준

bluetape4k-images-ocr는 핵심 ImmutableImage 모델에 Tesseract 문자 추출을 더한다. OCR에는 일반 이미지 처리에 필요 없는 네이티브 패키지, 언어 데이터, 지연 시간과 운영 실패 유형이 따라오므로 별도 모듈로 분리되어 있다.

웹 업로드 검증에서 이미지 전처리, 문자 인식과 응답으로 이어지는 OCR 요청 흐름

OcrOptions에서 언어와 엔진 동작을 고른다. OcrResult는 인식한 텍스트와 결과 데이터를 담는다. TesseractOcrEngine이 엔진을 구현하며 기존 이미지 값에서는 ImmutableImage.extractText로 바로 호출할 수 있다.

통제된 배포 환경에서는 언어와 데이터 경로를 명시한다. 입력 정규화나 리사이즈는 처리할 문서 종류에서 실제로 인식률을 높일 때만 적용한다. 강한 필터는 잡음뿐 아니라 글자 획도 지울 수 있다.

업로드 바이트, 디코딩 크기, OCR 동시 실행 수와 요청 시간을 제한한다. 큰 문서나 처리 시간이 일정하지 않은 경우 작업 대기열이 더 잘 맞는다. 원본 이미지와 추출한 텍스트에는 같은 개인정보와 보존 정책을 적용한다. 텍스트는 이미지보다 검색하기 쉬워 노출 범위가 더 커질 수 있다.

설정 실패, 엔진 실패, 빈 인식 결과와 요청 검증 실패를 구분한다. 잘못된 포맷이나 지원하지 않는 입력을 무한 재시도하지 않는다.

OCR 설정을 먼저 끝낸다. 이후 Ktor OCR이나 Spring Boot OCR 워크숍을 실행하고 애플리케이션 코드와 테스트를 함께 읽는다.