알리바바 계열 큐원(Qwen)의 27B급 오픈웨이트 인공지능(AI) 모델이 메타(Meta·$META)의 뮤즈 글리머(Muse Glimmer)와 비교한 8개 벤치마크에서 모두 앞섰다는 평가가 나왔다. 로컬 구동 AI 모델 경쟁이 코딩과 에이전트 수행 능력 비교로 옮겨가는 흐름이다.
블록비츠(BlockBeats)는 동찰 비팅(动察 Beating) 모니터링을 인용해 Qwen3.8-27B가 공식 벤치마크 8개 비교 항목에서 메타의 30B 모델 뮤즈 글리머를 모두 웃돌았다고 전했다. 다만 큐원 공식 블로그와 허깅페이스(Hugging Face) 모델 카드에서 확인되는 공개 27B 모델명은 Qwen3.6-27B다. 이 모델은 27B 파라미터 규모의 비전 인코더 포함 언어모델로, 허깅페이스에는 아파치 2.0 라이선스 모델로 등록돼 있다.
블록비츠가 제시한 비교에서 큐원 27B급 모델은 터미널벤치(Terminal-Bench) 2.1에서 73.0점을 기록했다. 뮤즈 글리머는 51.7점이었다. SWE-벤치 프로(SWE-bench Pro)는 61.7점 대 51.2점, OS월드 검증(OSWorld-Verified)은 84.3점 대 65.9점으로 제시됐다. 세 지표는 각각 터미널 기반 작업, 소프트웨어 엔지니어링 문제 해결, 컴퓨터 사용형 에이전트 수행 능력을 평가하는 벤치마크다.
앤트로픽(Anthropic)의 클로드 오퍼스 4.6(Claude Opus 4.6)과의 비교도 함께 제시됐다. 블록비츠는 양쪽 모두 점수가 있는 19개 테스트 중 큐원 27B급 모델이 15개에서 앞섰다고 전했다. SWE-벤치 프로, 라이브코드벤치(LiveCodeBench), OS월드, 안드로이드월드(AndroidWorld), 일부 시각 작업에서는 큐원 모델이 우위로 제시됐고, 터미널벤치와 GPQA, HLE, NL2Repo에서는 뒤처진 것으로 정리됐다.
공식 Qwen3.6-27B 모델 카드는 다른 기준의 수치도 제시한다. 큐원은 모델 카드에서 Qwen3.6-27B의 SWE-벤치 검증 점수를 77.2, SWE-벤치 프로 점수를 53.5, 터미널벤치 2.0 점수를 59.3으로 적었다. 평가 하네스와 버전이 다르면 점수가 달라질 수 있어 서로 다른 벤치마크 표를 같은 기준의 수치처럼 비교하기는 어렵다.
메타의 뮤즈 글리머는 앞서 맥과 PC에서 구동할 수 있는 오픈소스 에이전트 모델로 공개됐다. 본지는 당시 에이전트 모델이 사용자의 지시에 따라 작업 계획을 세우고 여러 단계를 수행하는 AI 모델이라고 설명했다. 이후 오픈웨이트와 오픈소스의 차이도 다뤘다.
이번 비교의 핵심은 단순한 순위보다 로컬 AI의 성능 기준이 바뀌고 있다는 점이다. 과거 경량 모델은 비용과 배포 편의성이 먼저 거론됐지만, 최근 비교는 코딩 저장소 수정, 터미널 작업, 화면 조작처럼 실제 개발자 환경에서의 수행 능력에 초점이 맞춰져 있다.
가상자산 시장과의 직접 연결은 아직 제한적이다. 로컬 AI 모델과 오픈웨이트 경쟁은 탈중앙화 컴퓨팅, AI 검증, 개발자 도구 영역과 맞물릴 수 있다. 이번 벤치마크가 관련 토큰 가격이나 거래량에 미친 직접적인 영향은 확인되지 않았다.
검증 출처: Qwen 공식 블로그, Qwen3.6-27B 허깅페이스 모델 카드, Meta AI 개발자 페이지
<저작권자 ⓒ TokenPost, 무단전재 및 재배포 금지>
많이 본 기사