OmniReasoner는 긴 오디오·비디오 추론에 어려움을 겪는 LLM을 위해 툴 사용 후 학습 프레임워크입니다. 모델은 답변 전에 줌인 툴을 사용할지 여부와 시점을 결정하도록 학습합니다. TimeAnchor는 다양한 샘플링 해상도에서 툴의 시간 인수를 유효하고 일관성 있게 유지합니다.
Temporal Augmented Data Engine은 수동 구간 주석 없이 툴 사용 행동을 학습할 수 있도록 비디오 편집 및 조합으로 툴 사용 후 학습 경로를 합성합니다. 오디오·비디오 벤치마크 실험 결과, 정확도와 시간적 위치 정보 향상 확인했습니다.