연구진은 시각 정보와 언어 지시를 기반으로 자가 중심 3D 손 자세를 예측하는 VL-EHPF 과제를 제안했어요.
Exo2EgoPose 프레임워크는 제한적인 시야와 역동적인 움직임을 보완하기 위해 외 중심 시범을 활용해 자가 중심 시야의 부족한 정보를 보완해요.
DERM 모듈은 외 중심 영상을 활용해 영상 수준과 프레임 수준의 표현을 재구성하고 GLMM 모듈은 계층적 외 중심 표현을 활용해 특징을 개선해요.
AssemblyHands, Ego-Exo4D, EgoMe-pose 벤치마크에서 기존 방법보다 큰 폭으로 성능을 개선했으며, CALVIN 데이터셋에서도 성능 향상을 보였어요.