Pulse · AI 뉴스

LLM 유해 콘텐츠 생성 확률에 대한 안전성 경계 제시

arXiv cs.AI · 2026-07-23

연구진이 LLM이 특정 프롬프트에 대해 유해한 콘텐츠를 생성할 확률에 대한 엄격한 경계를 계산하는 새로운 프레임워크를 제안했어요.

Clopper-Pearson 신뢰 구간을 활용해 유해 콘텐츠 생성 확률에 대한 PAC(Probably Approximately Correct) 경계를 얻는 방법을 연구했어요.

잠재 공간의 특징을 활용해 유해 콘텐츠 생성 가능성이 높은 생성 트리 분기를 우선적으로 탐색하는 알고리즘을 제안해 유용한 하한 경계를 효율적으로 계산했어요.

##LLM##안전성##경계##PAC##Clopper-Pearson
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기