Pulse · AI 뉴스

ISO: RLVR 기반 최적화 스택

Qwen · 2026-07-22

연구진은 강화 학습 기반 검증 가능한 보상(RLVR)의 최적화 레이어를 분석하여 스펙트럼 상속(spectral inheritance) 현상을 발견했어요.

스펙트럼 상속은 모델 가중치 스펙트럼을 재사용하면서 입력 및 출력 싱귤러 프레임을 조정하여 새로운 행동을 학습하는 방식이에요.

ISO(Isospectral Optimization)는 오프라인 병합(ISO-Merger)과 온라인 최적화(ISO-Optimizer)를 통해 RLVR의 최적화 레이어 문제를 해결하며, Qwen3-8B-Base 모델에서 AdamW 대비 학습 단계를 줄이고 정확도를 향상시켰어요.

##RLVR##최적화##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기