Pulse · AI 뉴스

장기 다중 회전 계획의 물리학: 단일 및 다중 교사 온-정책 에이전트 공정 증류를 통한 사전 훈련에서 사후 훈련까지

HuggingFace Papers · 2026-07-27

연구진이 다중 회전 장기 계획 능력 습득 및 통합 과정을 체계적으로 연구하기 위해 통제된 환경을 구축했어요.

사전 훈련 단계에서 CoT 기반 상태 전이 모델링이 장기적인 일반화 성능을 향상시키고, 짧은 장기 데이터가 중요하며, 최적 이하 경로가 성능을 저해한다는 사실을 발견했어요.

사후 훈련 단계에서 GRPO와 OPD를 통해 일반적인 계획 패턴과 작업별 계획 지식을 구분하고, OPD가 GRPO보다 더 넓은 효과 영역을 가진다는 것을 확인했어요.

다중 교사 온-정책 공정 증류(MOPD)는 환경 간 공유 계획 패턴을 통해 다양한 능력을 통합하고 지속적인 학습을 지원한다는 것을 보여줬어요.

##계획##온정책##공정증류##MOPD##장기계획
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기