연구진이 LLM 기반 진동 에너지 하베스터 설계 과정을 진단하는 VEHBench 벤치마크를 공개했어요. 763개의 작업으로 구성되며, 설계 역할에 따른 LLM 성능을 평가합니다. VEHBench는 사양 분류, 검증 기반 탐색, 오류 상태 복구, 정책 기반 선택 등 4가지 설계 역할을 평가하며, LLM의 단계별 성능 차이를 보여줍니다.
VEHBench 실험 결과, 단일 모델이 모든 설계 단계에서 일관되게 우위를 점하지 않으며, 응답 제어 프로필을 통해 설계 역할별로 뚜렷한 행동 패턴이 드러났어요. 이 벤치마크는 LLM 평가, 선택, 라우팅, 개선에 활용될 수 있습니다.
VEHBench는 Hugging Face에서 공개되었으며, 링크는 https://huggingface.co/datasets/AnonymousVehbench/vehbench 입니다.