Pulse · AI 뉴스

PrefReward: 개인화된 텍스트 생성 시 사용자 선호도 행렬 학습

PrefReward · 2026-07-23

연구진이 LLM의 개인화된 콘텐츠 생성 방식을 개선하기 위해 PrefReward라는 새로운 프레임워크를 제안했어요. PrefReward는 사용자 스타일을 구조화된 선호도 행렬로 모델링하고 디코딩 과정에서 보상 신호로 통합해요.

사용자별 선호도 행렬을 추출하고, 이를 KL-발산 기반 보상 함수를 통해 생성 가이드로 활용하는 2단계로 구성돼요.

LongLaMP 데이터셋 실험 결과, PrefReward는 생성 품질과 개인화 해석 가능성 모두에서 기존 방식보다 우수한 성능을 보여줬어요.

##LLM##개인화##PrefReward##텍스트생성
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기