금융 보고서 부정행위 탐지(FSFD)는 시장 안정성에 중요하지만, 점점 더 정교해지는 부정행위 방식과 금융 보고서의 비정형 텍스트 데이터 활용 부족이라는 과제를 안고 있습니다. 기존 방법은 무작위 데이터 분할에 의존하여 낙관적인 성능 추정치를 내놓지만, 새로운 회사나 미래 기간에 대한 실제 일반화 능력은 부족합니다.
연구진은 LLM을 활용하여 구조화된 금융 데이터와 금융 보고서의 비정형 텍스트 정보를 통합하는 견고한 FSFD 프레임워크를 제안하고, 회사 분리 FSFD(CI-FSFD)라는 새로운 벤치마크를 통해 현실적인 평가를 수행했습니다.
연구진은 금융 제표, 요약된 MD&A 텍스트, 부정행위 레이블을 결합한 포괄적인 미국 회사 데이터 세트를 구축하여 공개했으며, CI-FSFD 과제에서 가장 뛰어난 성능을 기록하며 텍스트 데이터와 견고한 평가의 중요성을 입증했습니다.