Pulse · AI 뉴스

LLM-as-a-Coach: 경험 기반 학습으로 비검증 가능 작업 수행

arXiv cs.LG · 2026-07-21

연구진은 LLM의 평가 기준을 스칼라 보상으로 압축하는 기존 강화 학습의 한계를 지적하며, LLM-as-a-Judge의 피드백 모델을 활용한 LLM-as-a-Coach를 제안했어요.

LLM-as-a-Coach는 정책 응답에 대한 평가를 경험 기반 지식으로 변환하여 교사 모델을 조건부로 설정하고, 정책은 온-정책 컨텍스트 증류를 통해 이 지식을 내면화해요.

두 가지 정책 패밀리에서 자체 피드백 또는 독점 모델 피드백을 사용했을 때, 경험 기반 학습은 기존의 루브릭 기반 강화 학습보다 더 뛰어난 성능을 보였고, 일반화 능력 향상 및 보상 해킹 완화 효과도 확인됐어요.

##강화학습##LLM##경험학습##비검증
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기