연구진은 강화 학습 기반 검증 가능한 보상(RLVR)의 최적화 레이어를 분석하여 스펙트럼 상속(spectral inheritance) 현상을 발견했어요.
스펙트럼 상속은 모델 가중치 스펙트럼을 재사용하면서 입력 및 출력 싱귤러 프레임을 조정하여 새로운 행동을 학습하는 방식이에요.
ISO(Isospectral Optimization)는 오프라인 병합(ISO-Merger)과 온라인 최적화(ISO-Optimizer)를 통해 RLVR의 최적화 레이어 문제를 해결하며, Qwen3-8B-Base 모델에서 AdamW 대비 학습 단계를 줄이고 정확도를 향상시켰어요.