Pulse · AI 뉴스

DADiff: 강화 학습을 위한 확산 기반 교차 도메인 정책 적응

DADiff · 2026-07-18

연구진은 강화 학습에서 도메인 불일치를 해결하기 위해 DADiff라는 확산 기반 프레임워크를 제안했어요.

DADiff는 소스 및 타겟 도메인의 생성 경로 차이를 활용하여 다음 상태 생성 과정에서 동적 불일치를 추정해요.

보상 수정 및 데이터 선택 변형을 통해 정책을 타겟 도메인에 적응시키며, 이론적 분석을 통해 성능 차이를 제한해요.

##강화학습##도메인적응##DADiff##확산모델
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기