Pulse · AI 뉴스

GEPO: 그룹별 엔트로피 제어 정책 최적화

GEPO · 2026-07-18

연구진은 대규모 언어 모델(LLM) 강화 학습 시 그룹별 엔트로피를 제어하는 GEPO(Group Entropy-Controlled Policy Optimization)를 제안했어요. GEPO는 그룹별 엔트로피를 활용해 비대칭적 이점 형성을 수행하여 과도한 탐험을 줄이고, 필요한 탐색을 유지해요.

기존 GRPO 방식의 단점을 개선하여 수학, 물리학, 과학, 코드 생성, 지시 따르기 등 13개 벤치마크에서 GRPO 및 기존 엔트로피 제어 방법보다 성능이 우수했어요.

GEPO는 각 그룹의 엔트로피 통계를 기반으로 적응적 임계값을 사용하여 그룹별 이점을 조정하며, 작업별 탐색 수준을 유지하면서 균형 잡힌 작업 간 개선을 제공해요.

##강화학습##LLM##GEPO##엔트로피제어
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기