연구자가 GPT-5.4, Claude Opus 4.7, Gemini 등 6개 LLM의 정치·성별·인종 편향을 8개 벤치마크로 평가했어요. 정치적 성향은 Grok만 우편향으로 나타났지만, 다른 정치 편향 벤치마크에서는 6개 모델 모두 좌편향 경향을 보였어요. 인종 관련 질문에서 GPT-5.4는 20.3%의 거부율을 보였는데, Claude Opus 4.7은 13.8%, Grok은 9.5%로 비교적 낮았어요.
단독 연구로 진행되었으며, 여러 번 반복 측정이나 다양한 프롬프트 사용은 제한적이었어요.
본 연구는 LLM의 편향성 문제를 파악하고 개선하는 데 기여할 수 있으며, AI 윤리 및 책임감 있는 AI 개발에 대한 중요성을 강조해요.