Pulse · AI 뉴스

가치 충돌 해결 안정화에 관한 기하학적 관점

arXiv cs.LG · 2026-07-20

연구진은 LLM이 RLHF의 압축된 스칼라 보상으로 인해 가치 충돌을 해결하는 데 어려움을 겪는다는 점을 지적했어요. 체인 오브 씽킹(CoT) 추론이 이 문제를 해결하는 데 도움이 될 수 있음을 보여줬어요. CoT는 모델의 손실 경관을 더욱 부드럽게 만들어 최적화 불안정성을 해결하는 데 기여해요.

연구 결과, 가치 충돌에 집중한 CoT는 다양한 도덕적 추론에 일반화될 수 있으며, 이는 더 나은 도덕적 추론을 위한 효과적인 메커니즘이 될 잠재력이 있음을 시사해요. 새로운 CoT 설계를 통해 손실 경관의 가장 날카로운 방향을 더욱 부드럽게 만들고 도덕적 추론 성능을 향상시켰어요.

연구진은 CoT 설계 및 개선을 통해 복잡한 가치 충돌이 있는 사용자 요청에 대한 모델 성능을 향상시키고 LLM의 다원주의적 정렬을 발전시킬 수 있다고 강조했어요.

##LLM##CoT##RLHF##도덕적추론
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기