Pulse · AI 뉴스

토큰 수준 오프 정책 학습: 분포 변화 환경에서 신뢰성 있는 생성

arXiv cs.CL · 2026-07-20

연구진이 토큰 수준 오프 정책 학습(TOPL)이라는 새로운 훈련 패러다임을 제안했어요. 이 방법은 모델이 응답 내에서 좋은 토큰과 나쁜 토큰을 구별하도록 훈련하여 신뢰성 있는 토큰 생성을 유도하는 방식이에요.

문서 요약 작업에서 실험 결과, 11개 데이터 세트에서 다양한 시퀀스 수준 및 토큰 수준 기준에 비해 뛰어난 성능을 보였어요.

기계 번역에도 효과적으로 적용 가능하며, 토큰 수준 학습 신호가 성능에 중요한 역할을 한다는 것을 확인했어요.

##오프정책학습##토큰수준##신뢰성##생성모델
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기