Patsnap이 특허 문서 OCR 오류 해결을 위해 MOSS-OCR 기반 0.3B 모델을 개발했어요. 일반 모델의 한계를 극복하기 위해 특허 데이터 중심 5천만 건 이상의 샘플로 학습했어요. OmniDocBench v1.6에서 MinerU 2.5와 동등한 성능을 보이며, 자체 벤치마크에서 1위를 기록했어요.
개발팀은 블록 단위 처리만으로 모델 크기와 속도를 유지했으며, 페이지 레이아웃 및 판독 순서 처리를 위한 별도 파이프라인 'Hiro-Smart-Doc'도 구축했어요. 두 모델 모두 Apache 2.0 라이선스로 공개되었으며, 사용 중 발견되는 문제점은 환영해요.