Pulse · AI 뉴스

물리 기반 정책 증류를 통한 설명 가능한 강화 학습

TD3 · 2026-07-28

본 연구는 로봇 공학 및 자동차 엔지니어링과 같은 안전 관련 분야에서 딥 강화 학습(DRL) 시스템의 투명성을 높이기 위한 실험적 연구입니다. 고성능 DRL 시스템을 해석 가능하게 만들기 위해 정책 증류 프레임워크를 사용했어요. Inverted Pendulum 벤치마크를 활용하여 Twin Delayed DDPG(TD3) 에이전트의 정책을 Decision Tree 기반의 해석 가능한 학생 모델로 증류했어요.

물리 기반 특징과 'Noisy Oracle Rollouts'를 활용하여 증류 과정에서 전문가 수준의 성능을 달성했어요. 비교 제어 이론 분석 결과, 연속 제어에서 이산 규칙 기반 제어로 전환하면 고주파 Bang-Bang 작동과 안정적인 이분법 한계 주기가 발생해요.

시뮬레이션 결과, BIBO 안정성을 유지하면서 안전한 자율 시스템을 위한 전역적 및 지역적 해석 가능성을 제공하는 것으로 나타났어요.

##강화학습##DRL##해석가능성##제어##물리
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기