연구진은 정치 연립 정부 협상 시뮬레이션을 위해 LLM 에이전트 프레임워크를 개발했어요. RLHF의 편향성을 극복하기 위해 Supervised Fine-Tuning, Direct Preference Optimization, Retrieval-Augmented Generation 기술을 결합했어요.
각 에이전트는 정당별 공식 강령에 기반하여 행동하며, DPO를 통해 공격적인 정당별 페르소나를 부여하고, MILT를 통해 협상 과정과 결과를 추적할 수 있어요.
2019년 플랑드르 선거를 예시로 세 번의 시뮬레이션을 진행한 결과, 실제 선거 결과와 유사한 결과를 얻었으며, 강령 기반의 추적 기능은 실제 연립 정부 합의 내용 예측에 효과적이었어요.