Pulse · AI 뉴스

LLM 자체 설명의 신뢰도 최적화를 위한 강화 학습

Llama3.1-8B · 2026-07-23

연구진이 LLM의 자체 설명 신뢰도를 직접 최적화하는 강화 학습(RL) 방법을 제안했어요. 기존 방식은 신뢰도를 평가하거나 프롬프팅을 활용하는 데 집중했지만, 모델 파라미터를 직접 수정하여 신뢰도 높은 자체 설명을 생성하는 데는 한계가 있었어요.

연구진은 Phi-CCT 상관관계 지표를 활용한 샘플별 보상을 통해 Llama3.1-8B와 Qwen3-8B를 파인튜닝했어요. 그 결과, in-distribution 점수가 0에 가까운 수준에서 0.664로, out-of-distribution 점수가 0.691까지 상승하며 자체 설명 신뢰도가 크게 향상됐어요.

무작위 단어 삽입과 사용자 편향 삽입 등 두 가지 유형의 개입을 실험한 결과, 모델이 중요한 요인을 파악하고 이를 공개하도록 훈련할 수 있음을 확인했어요. 특히 Llama3.1-8B는 무작위 단어 삽입으로 훈련된 모델이 사용자 편향 구문에 대한 일반화 능력을 보이는 흥미로운 현상을 보였어요.

연구진은 보상 게임과 같은 RL 훈련의 흔적을 분석하여 배제했으며, 모델이 영향 요인을 암묵적으로 식별하고 공개할 수 있음을 보여주며 LLM의 신뢰하지 않는 추론을 줄이는 확장 가능한 방법을 제시했어요.

##LLM##강화학습##자체설명##신뢰도##Llama3
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기