맨위로 가기
  • 공유 공유
  • 댓글 댓글
  • 추천 추천
  • 스크랩 스크랩
  • 인쇄 인쇄
  • 글자크기 글자크기
링크 복사 완료 링크가 복사되었습니다.

큐원 27B, 코딩 일부 지표서 오푸스 앞섰다

프로필
정민석 기자
댓글 0
좋아요 비화설화 0

알리바바 계열 큐원3.8-27B가 SWE-벤치 프로 등 일부 코딩 평가에서 클로드 오푸스 4.6 맥스를 앞섰다. 터미널 작업과 저장소 수준 코드 생성에서는 클로드가 높은 점수를 냈다.

 코딩 벤치마크 결과가 놓인 데스크톱 / TokenPost.ai

코딩 벤치마크 결과가 놓인 데스크톱 / TokenPost.ai

알리바바(Alibaba) 계열 큐원(Qwen)의 27B급 오픈 인공지능(AI) 모델이 일부 코딩 벤치마크에서 앤트로픽(Anthropic)의 클로드 오푸스 4.6 맥스(Claude Opus 4.6 Max)를 앞섰다. 다만 터미널 기반 작업과 저장소 수준 코드 생성 평가에서는 클로드가 더 높은 점수를 냈다.

허깅페이스(Hugging Face)는 큐원3.8-27B 모델 카드에서 이 모델을 27B 파라미터 규모의 비전·언어 모델로 소개했다. 라이선스는 아파치 2.0이며, 기본 컨텍스트 길이는 26만2144토큰, 확장 가능 길이는 최대 100만토큰으로 제시됐다.

이 모델은 이미지와 영상 이해를 지원하고 추론 강도를 조절하는 기능을 포함했다. 공개 모델 카드에는 트랜스포머스(Transformers), vLLM, SGLang, TokenSpeed 등과의 호환성도 적혀 있다.

성능 비교는 작업별로 갈렸다. 큐원 모델 카드의 공개 표에서 큐원3.8-27B는 SWE-벤치 프로(SWE-bench Pro) 61.7점을 기록해 클로드 오푸스 4.6 맥스의 53.4점을 앞섰다.

자체 소프트웨어 엔지니어링 평가인 QwenSWEBench에서도 큐원3.8-27B는 79.0점을 받았다. 같은 표에서 클로드 오푸스 4.6 맥스는 63.8점이었다.

반면 터미널벤치(Terminal-Bench) 2.1에서는 클로드가 우위였다. 큐원3.8-27B는 73.0점, 클로드 오푸스 4.6 맥스는 78.2점을 기록했다. 저장소 수준 코드 생성 평가인 NL2Repo-Bench도 각각 42.3점과 47.6점으로 클로드 쪽이 높았다.

이 때문에 큐원3.8-27B를 ‘오푸스급 모델’로 부르는 표현은 일부 코딩 지표에 한정해 읽어야 한다. 공개 표 안에서도 큐원3.8-27B는 라이브코드벤치(LiveCodeBench) v6에서 90.3점으로 클로드 오푸스 4.6 맥스의 88.8점을 웃돌았지만, GPQA 다이아몬드와 HLE 같은 일반 추론 평가는 클로드가 앞섰다.

벤치마크는 모델의 특정 작업 수행 능력을 수치화한 시험이다. SWE-벤치 프로는 실제 소프트웨어 수정 과제를, 터미널벤치는 명령줄 환경에서의 에이전트형 작업 수행 능력을 본다. 같은 코딩 모델이라도 평가 하네스와 과제 유형이 달라지면 결과가 달라질 수 있다.

국내 개발자에게 더 직접적인 쟁점은 배포 방식이다. 허깅페이스 모델 카드에는 양자화 모델 경로도 붙어 있어 llama.cpp, Ollama, LM Studio 같은 로컬 실행 도구와 연결할 수 있다.

이는 기업용 클라우드 API뿐 아니라 개인 워크스테이션과 사내 서버에서 모델을 직접 운용하려는 개발자에게 의미가 있다. 로컬 모델은 데이터 반출 통제와 비용 예측 측면에서 장점이 있지만, 운영자가 직접 모델 파일과 추론 환경을 관리해야 한다.

다만 소비자용 GPU 구동 가능성은 설정에 따라 달라진다. Unsloth AI는 자체 문서에서 27B급 모델의 일부 양자화 구성이 17GB 수준 메모리에서 실행될 수 있다고 제시했다. 이는 원본 가중치 그대로의 실행 조건이 아니라 양자화와 메모리 운용 방식을 전제로 한 수치다.

실제 속도와 안정성은 컨텍스트 길이, GPU 메모리, CPU·디스크 오프로딩 여부에 영향을 받는다. 장문 컨텍스트를 쓰거나 여러 요청을 동시에 처리하면 필요한 메모리와 지연 시간이 달라질 수 있다.

큐원클라우드(QwenCloud)는 상위 모델인 큐원3.8-맥스를 2.4조 파라미터 MoE 모델로 소개하고 코딩과 전문 작업에 초점을 맞춘 모델이라고 설명했다. 큐원3.8-27B는 이보다 작은 배포형 모델이며, 허깅페이스 모델 카드는 관리형 호스티드 버전이 향후 제공될 예정이라고 적었다.

이번 공개는 중국계 오픈 모델이 코딩·에이전트 작업에서 미국계 프런티어 모델과 직접 비교되는 흐름을 보여준다. 본지는 앞서 큐원 27B급 모델이 뮤즈 글리머와 비교한 여러 벤치마크에서 앞섰다고 보도했다.

이번 자료에서 확인되는 결론은 더 좁다. 큐원3.8-27B는 로컬 배포가 가능한 27B 오픈 모델이며, 일부 코딩 벤치마크에서는 클로드 오푸스 4.6 맥스를 앞섰다. 그러나 터미널 작업과 저장소 수준 코드 생성, 일반 추론 평가까지 포함하면 모델 하나가 모든 작업에서 우위에 섰다고 보기는 어렵다.

검증 출처: Hugging Face Qwen3.8-27B, QwenCloud Qwen3.8-Max, Unsloth 문서, Hacker News 토론

본 기사는 시장 데이터 및 차트 분석을 바탕으로 작성되었으며, 특정 종목에 대한 투자 권유가 아닙니다.
광고문의 기사제보 보도자료
앱 아이콘

토큰포스트가 새로워졌어요!

앱 출시 기념 이벤트에 참여하고 선물도 함께 받아가세요!

디센트 S 지급

디센트 S 지갑 카드형 하드웨어 월렛

추첨 20명
커피

커피 쿠폰 모바일 쿠폰 1매

선착순 1,000명

많이 본 기사

alpha icon

지금 꼭 알아야 할 리포트

관련된 다른 기사

댓글

댓글

0

추천

0

스크랩

스크랩

데일리 스탬프

0

말풍선 꼬리

매일 스탬프를 찍을 수 있어요!

데일리 스탬프를 찍은 회원이 없습니다.
첫 스탬프를 찍어 보세요!

댓글 0

댓글 문구 추천

좋은기사 감사해요 후속기사 원해요 탁월한 분석이에요

0/1000

댓글 문구 추천

좋은기사 감사해요 후속기사 원해요 탁월한 분석이에요
1