Pulse · AI 뉴스

보상 채널의 어두운 방: GRPO 학습 LLM 에이전트의 밀집 예측 보상이 붕괴시키는 현상 — 그리고 실제로 효과적인 방법

Qwen · 2026-07-23

연구진이 Qwen3-1.7B/4B/8B 모델을 ALFWorld 환경에서 테스트한 결과, 밀집 예측 보상은 오히려 정책을 파괴하는 '어두운 방' 병리 현상을 유발했어요.

GRPO의 std 정규화 제거 시, 밀집 예측 보상은 파국적인 결과(0%)에서 기준 수준의 성능으로 회복돼 원인이 GRPO의 std 정규화에 있음을 확인했어요.

연구진은 z-점수가 그룹 내 분산을 증폭시키고, 실패 그룹이 지배할 때 밀집 신호의 분산이 감소하는 신호가 안전하다는 기준을 제시했어요.

제어된 신호 전달 행렬 실험 결과, 보조 손실 채널이 ~20 포인트 성능 향상을 보였고, 섞인 데이터(placebo)도 실제 데이터와 유사한 성능을 보여 정확한 레이블 없이도 효과가 있음을 시사했어요.

연구 결과는 기존 연구의 성공 사례와 일관되며, 더 많은 실험을 통해 재현 가능성과 그룹 크기 제어를 진행할 예정이에요.

##LLM##GRPO##보상채널##Qwen##연구
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기