Pulse · AI 뉴스

오픈 소스 4B 모델, 스웨덴 의료 시험에서 o3 수준 성능 달성

Qwen · 2026-07-26

연구자가 스웨덴 의료 면허 시험 문제에 대한 오픈 소스 LLM 실험을 진행했어요. GPT-4는 84% 정확도를 기록했지만, Qwen3.5-4B는 훈련 없이도 77%의 정확도를 보여줬어요. 특히 Reasoning 기능 활성화 시 87%까지 정확도를 끌어올렸어요. 연구자는 S-GRPO 논문에서 제안한 '조기 종료' 기법을 활용해 Reasoning 과정을 개선했어요.

MedGemma-1.5-4B는 추가 훈련을 통해 60%의 합격 점수를 기록했지만, Gemma4-E4B와 Qwen3.5-4B는 훈련 없이도 더 높은 정확도를 나타냈어요. Qwen3.5-4B는 스웨덴어 프롬프트에도 불구하고 영어로 추론하는 모습을 보였어요.

연구자는 스웨덴어 의료 시험 문제에 대한 실험 결과와 자세한 내용은 Tensorlabbet 웹사이트에 게시했어요.

##LLM##의료##스웨덴##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기