연구진은 모델과 에이전트 루프의 공동 진화를 위해 에이전트 루프를 데이터 생성 요소로 활용하는 'Recursive Harness Self-Improvement (RHI)' 기법을 제안했어요.
RHI는 에이전트 루프를 프롬프트 수준의 사양으로 표현하고, 자체 수정 이력에 대한 쌍대 비교 피드백을 통해 반복적으로 개선하는 방식이에요.
30개의 연구 과제에서 RHI는 적은 노력으로 에이전트 성능을 향상시키고, 최대 60%까지 추론 비용을 절감하며, 더 효과적인 정보 흐름을 통해 과제별 맥락 관리를 개선했어요.