Pulse · AI 뉴스

Persian Pixel: 페르시아어 OCR을 위한 대규모 합성 데이터셋 출시

Persian Pixel · 2026-07-23

페르시아어 광학 문자 인식(OCR)은 1억 1천만 명 이상이 사용하는 언어임에도 불구하고 라틴 문자 언어에 비해 기술 성숙도가 현저히 낮습니다.

연구진은 복잡한 페르시아어 문자 체계와 부족한 고품질 데이터셋으로 인한 어려움을 해결하기 위해 34만 3천 개 이상의 이미지-텍스트 쌍으로 구성된 합성 OCR 데이터셋 'Persian Pixel'을 공개했어요.

Persian Pixel은 SynthOCR-Gen 렌더링 프레임워크를 활용해 다양한 글꼴과 문서 레이아웃을 생성하고, 실제 문서 결함과 유사한 노이즈를 추가하여 현실감을 높였습니다.

연구팀은 이 데이터셋을 통해 TrOCR, Donut과 같은 최신 OCR 아키텍처를 훈련하고, 페르시아어 문서 분석 및 디지털화 연구를 가속화할 수 있을 것으로 기대합니다.

##OCR##페르시아어##데이터셋##합성데이터##PersianPixel
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기