Pulse · AI 뉴스

체스 추론 과정에서 가중치가 스크래치패드보다 중요한 이유: 인과적 사례

Latent · 2026-07-23

연구진이 체스 모델을 훈련하며 강화 학습(RL)을 적용한 결과, 합법성(legality)은 48%에서 61%로 상승하고, 체크메이트에 대한 오답(confabulation)은 완전히 사라졌습니다.

실험 결과, 잠재적 사고 벡터에 노이즈를 추가하거나 제거해도 성능에 큰 영향이 없었으며, 정확히 0인 벡터만 성능 저하를 유발했습니다.

강화 학습은 모델의 매개변수를 훈련하는 과정에서 중요한 역할을 하며, 잠재적 사고가 적극적으로 참조되는 추론 시간 스크래치패드 역할을 한다는 기존 가설에 반하는 결과입니다.

연구는 체스 분야에서 강화 학습과 잠재적 추론을 결합한 방식이 성공할 수 있음을 보여주며, 수학 및 논리 분야에서 보고되는 실패 사례와는 다른 결과를 나타냅니다.

##체스##강화학습##잠재적추론##인공지능
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기