AgentHOI: 인간-객체 상호작용 영상 생성 시 다중 에이전트 추론을 통한 암묵적 표현 정렬
AgentHOI · 2026-07-24
AgentHOI는 텍스트 기반 인간-객체 상호작용(HOI) 영상 생성 모델로, 다중 에이전트 추론을 통해 고수준 텍스트 의도를 물리적 실행으로 연결합니다. 암묵적 텍스트-모션 정렬 전략을 통해 명시적 모션 입력 없이도 자연스러운 HOI 합성이 가능합니다. 실험 결과, 복잡한 텍스트 지시사항 준수, 객체 외형 보존, 상호작용 자연스러움이 향상됐습니다.