Pulse · AI 뉴스

ISO: RLVR 기반 최적화 스택

Qwen · 2026-07-21

연구진은 강화 학습 기반 검증 가능한 보상(RLVR)의 최적화 레이어를 분석하여 '스펙트럼 상속' 현상을 발견했어요. 스펙트럼 상속은 모델 가중치 스펙트럼을 재사용하며 입력과 출력 싱귤러 프레임을 조정하여 새로운 행동을 습득하는 방식입니다.

연구진은 스펙트럼 상속을 활용한 Isospectral Optimization (ISO) 프레임워크를 개발했는데, 오프라인에서는 ISO-Merger를 통해 데이터 병합 없이 전문가의 프레임 변경 사항을 결합하고, 온라인에서는 ISO-Optimizer를 통해 기존 최적화 알고리즘을 적용합니다.

ISO-Optimizer는 Qwen3-8B-Base 모델에서 AdamW를 사용할 때 270단계 훈련로 0.495의 정확도를 달성하는 데 비해, ISO-AdamW는 100단계로 동일한 정확도를 달성하고 210단계로 0.509까지 향상되는 등 훈련 단계를 줄이고 정확도를 높였습니다.

##RLVR##최적화##스펙트럼상속##ISO##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기