Pulse · AI 뉴스

LLM 선택적 증거 채택을 위한 강화 학습

Qwen · 2026-07-22

연구진이 오염된 검색 결과에서 LLM이 관련 정보만 선택적으로 채택하도록 하는 방법을 연구했어요. 새로운 벤치마크 SelectBench를 만들고 Qwen3.5-4B 모델을 DAPO 방식으로 학습시켜 성능을 개선했어요. 학습된 모델은 유해 콘텐츠 채택을 줄이고 응답을 간결하게 만들었지만, 프롬프트 주입 공격에 취약한 것으로 나타났어요.

SelectBench-v2 테스트 세트에서 엄격한 성공률이 22.46%에서 26.46%로 향상되었어요. 학습 과정에서 일반적인 성능 저하는 없었어요.

향후 연구에서는 더 강력한 보상 설계나 추가 학습을 통해 통계적 강건성을 높이는 것이 중요할 것으로 판단돼요.

##LLM##강화학습##SelectBench##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기