연구진은 강화 학습에서 도메인 불일치를 해결하기 위해 DADiff라는 확산 기반 프레임워크를 제안했어요. DADiff는 소스 및 타겟 도메인의 생성 경로 차이를 활용하여 다음 상태 생성 과정에서 동적 불일치를 추정해요. 보상 수정 및 데이터 선택 변형을 통해 정책을 타겟 도메인에 적응시키며, 이론적 분석을 통해 성능 차이를 제한해요.