Pulse · AI 뉴스

액티브 인퍼런스를 볼록 마르코프 의사결정 문제로 재구성

arXiv cs.AI · 2026-07-22

액티브 인퍼런스(AIF)는 예상 자유 에너지 최소화를 통해 적응적 행동을 설명하며, 인식적 및 실용적 목표를 통합합니다. 연구진은 AIF를 정책 최적화로 재구성하고, 폐쇄 루프 제어 정책의 경우 자유 에너지 최소화가 볼록 마르코프 의사결정 문제(MDP)로 표현될 수 있음을 밝혔습니다. 이 공식에서 실용적 요소는 예측 상태 주변 분포에 선형적이며, 잠재 MDP에서 보상 극대화와 동등합니다.

인식적 가치는 비선형 구성 요소를 도입하여 자유 에너지 최소화를 표준 강화 학습과 차별화합니다. 연구진은 액티브 인퍼런스의 인식적 동기를 정책 의존적(성능적) 보상으로 분석했습니다.

유한 지평, 할인, 평균 보상 자유 에너지 공식이 분석되었고, 현재 상태 주변 분포를 지역적으로 선형화하는 미러 디센트(MD) 알고리즘이 파생되었습니다. 이 알고리즘은 액터-크리틱 방법 및 동적 프로그래밍과 호환되는 정책 의존적 보상을 제공합니다.

##액티브인퍼런스##마르코프의사결정##강화학습##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기