연구진은 대규모 언어 모델이 과학적 문제 해결에 기여하지만, 한 문제에서 얻은 실행 가능한 피드백이 다음 문제 해결 능력으로 이어지지 않는다는 점을 지적했어요.
SciConsolidate는 성공 및 실패 사례를 비교 분석하여 문제 해결 절차를 유도하고, 추론 오류를 줄이는 데이터 증강 기법을 사용해요.
Qwen3.6-27B 모델은 절차 주입을 통해 부분 단계 및 주요 문제 해결 성능이 각각 3.85점, 6.26점 향상되었지만, Qwen3.5-9B 모델에서는 큰 효과를 보이지 않았어요.
SciConsolidate를 활용하여 Qwen3.5-9B 모델은 기존 방식 대비 주요 문제 해결 성능이 3.89점, 원 모델 대비 5.62점 향상되는 결과를 얻었어요.