알리바바(Alibaba) 계열 큐원(Qwen)의 27B급 오픈 인공지능(AI) 모델이 일부 코딩 벤치마크에서 앤트로픽(Anthropic)의 클로드 오푸스 4.6 맥스(Claude Opus 4.6 Max)를 앞섰다. 다만 터미널 기반 작업과 저장소 수준 코드 생성 평가에서는 클로드가 더 높은 점수를 냈다.
허깅페이스(Hugging Face)는 큐원3.8-27B 모델 카드에서 이 모델을 27B 파라미터 규모의 비전·언어 모델로 소개했다. 라이선스는 아파치 2.0이며, 기본 컨텍스트 길이는 26만2144토큰, 확장 가능 길이는 최대 100만토큰으로 제시됐다.
이 모델은 이미지와 영상 이해를 지원하고 추론 강도를 조절하는 기능을 포함했다. 공개 모델 카드에는 트랜스포머스(Transformers), vLLM, SGLang, TokenSpeed 등과의 호환성도 적혀 있다.
성능 비교는 작업별로 갈렸다. 큐원 모델 카드의 공개 표에서 큐원3.8-27B는 SWE-벤치 프로(SWE-bench Pro) 61.7점을 기록해 클로드 오푸스 4.6 맥스의 53.4점을 앞섰다.
자체 소프트웨어 엔지니어링 평가인 QwenSWEBench에서도 큐원3.8-27B는 79.0점을 받았다. 같은 표에서 클로드 오푸스 4.6 맥스는 63.8점이었다.
반면 터미널벤치(Terminal-Bench) 2.1에서는 클로드가 우위였다. 큐원3.8-27B는 73.0점, 클로드 오푸스 4.6 맥스는 78.2점을 기록했다. 저장소 수준 코드 생성 평가인 NL2Repo-Bench도 각각 42.3점과 47.6점으로 클로드 쪽이 높았다.
이 때문에 큐원3.8-27B를 ‘오푸스급 모델’로 부르는 표현은 일부 코딩 지표에 한정해 읽어야 한다. 공개 표 안에서도 큐원3.8-27B는 라이브코드벤치(LiveCodeBench) v6에서 90.3점으로 클로드 오푸스 4.6 맥스의 88.8점을 웃돌았지만, GPQA 다이아몬드와 HLE 같은 일반 추론 평가는 클로드가 앞섰다.
벤치마크는 모델의 특정 작업 수행 능력을 수치화한 시험이다. SWE-벤치 프로는 실제 소프트웨어 수정 과제를, 터미널벤치는 명령줄 환경에서의 에이전트형 작업 수행 능력을 본다. 같은 코딩 모델이라도 평가 하네스와 과제 유형이 달라지면 결과가 달라질 수 있다.
국내 개발자에게 더 직접적인 쟁점은 배포 방식이다. 허깅페이스 모델 카드에는 양자화 모델 경로도 붙어 있어 llama.cpp, Ollama, LM Studio 같은 로컬 실행 도구와 연결할 수 있다.
이는 기업용 클라우드 API뿐 아니라 개인 워크스테이션과 사내 서버에서 모델을 직접 운용하려는 개발자에게 의미가 있다. 로컬 모델은 데이터 반출 통제와 비용 예측 측면에서 장점이 있지만, 운영자가 직접 모델 파일과 추론 환경을 관리해야 한다.
다만 소비자용 GPU 구동 가능성은 설정에 따라 달라진다. Unsloth AI는 자체 문서에서 27B급 모델의 일부 양자화 구성이 17GB 수준 메모리에서 실행될 수 있다고 제시했다. 이는 원본 가중치 그대로의 실행 조건이 아니라 양자화와 메모리 운용 방식을 전제로 한 수치다.
실제 속도와 안정성은 컨텍스트 길이, GPU 메모리, CPU·디스크 오프로딩 여부에 영향을 받는다. 장문 컨텍스트를 쓰거나 여러 요청을 동시에 처리하면 필요한 메모리와 지연 시간이 달라질 수 있다.
큐원클라우드(QwenCloud)는 상위 모델인 큐원3.8-맥스를 2.4조 파라미터 MoE 모델로 소개하고 코딩과 전문 작업에 초점을 맞춘 모델이라고 설명했다. 큐원3.8-27B는 이보다 작은 배포형 모델이며, 허깅페이스 모델 카드는 관리형 호스티드 버전이 향후 제공될 예정이라고 적었다.
이번 공개는 중국계 오픈 모델이 코딩·에이전트 작업에서 미국계 프런티어 모델과 직접 비교되는 흐름을 보여준다. 본지는 앞서 큐원 27B급 모델이 뮤즈 글리머와 비교한 여러 벤치마크에서 앞섰다고 보도했다.
이번 자료에서 확인되는 결론은 더 좁다. 큐원3.8-27B는 로컬 배포가 가능한 27B 오픈 모델이며, 일부 코딩 벤치마크에서는 클로드 오푸스 4.6 맥스를 앞섰다. 그러나 터미널 작업과 저장소 수준 코드 생성, 일반 추론 평가까지 포함하면 모델 하나가 모든 작업에서 우위에 섰다고 보기는 어렵다.
검증 출처: Hugging Face Qwen3.8-27B, QwenCloud Qwen3.8-Max, Unsloth 문서, Hacker News 토론
<저작권자 ⓒ TokenPost, 무단전재 및 재배포 금지>
많이 본 기사