연구진은 LLM이 생성한 웹 인터페이스의 품질을 평가하는 새로운 방법을 제시했어요. 기존 방식은 비용, 커버리지, 확장성 측면에서 한계가 있었어요. 19가지 인터페이스 품질 원칙을 통합한 4B vision-language 모델을 활용해 UI 원칙 위반을 감지했어요.
강화 학습을 통해 모델의 micro-F1 점수가 36%에서 84%로 향상되었으며, 19가지 원칙 중 13가지가 80% 이상의 F1 점수를 달성했어요. 이 모델은 생성된 인터페이스를 감사하고, 품질이 낮은 인터페이스 학습 데이터를 필터링하며, 디자인을 고려한 코드 생성을 위한 보상 신호를 제공할 수 있어요.
연구진은 데이터 생성 레시피와 주입/검증 프롬프트를 공개하여 재현 가능한 평가와 확장 가능한 인터페이스 품질 평가 연구를 지원할 예정이에요. 이 연구는 LLM 기반 인터페이스 개발의 품질을 높이는 데 기여할 것으로 기대돼요.