LingBot-VLA 2.0 연구는 로봇 학습에 1인칭 비디오 데이터를 활용하는 방법을 제시했어요. 시각적 예측과 로봇 제어 능력을 분리하여 평가함으로써, 1인칭 데이터가 로봇의 다음 상태 예측에 미치는 영향을 분석할 수 있어요. 1인칭 데이터의 효과를 정확히 평가하기 위해서는 시점과 비디오 볼륨의 영향을 배제한 비교 연구가 중요해요.
1인칭 비디오 데이터는 로봇의 인간 모방이 아닌, 시각적 주의의 흐름을 학습하는 데 도움이 될 수 있어요. 예를 들어, 어떤 물체가 시야에 들어오는지, 접촉 전에는 무엇이 변하는지, 다음에 어디를 보게 되는지 등을 파악하는 데 활용될 수 있어요.
1인칭 비디오 데이터에서 손으로 물체를 가리는 현상은 큰 과제이지만, 이를 유용한 정보와 누락된 시각 정보로 구분하여 평가하는 연구가 필요해요.