CLaC@FinMMEval 2026 Task 3에서 비트코인(BTC)과 테슬라(TSLA)의 트레이딩 결정을 위해 뉴스 및 시장 데이터를 활용하는 시스템을 소개했어요.
PG, PPO, DQL, DDPG 등 4가지 심층 강화 학습 알고리즘을 비교했으며, LLaMA 3.2 1B로 생성된 일일 뉴스 감정 점수를 활용했어요.
알파 보상은 초과 시장 수익을 기반으로 설계되었고, 에피소드 시작 날짜를 무작위화하여 과적합을 줄이고 목표와 일치하도록 했어요.
DDPG가 테스트 세트에서 가장 강력한 성능을 보였으며, DQL은 검증 Sharpe 비율이 가장 높아 라이브 엔드포인트에 사전 선택됐어요.