미니CPM5-2B '4B미만 1위' 주장…공식 저장소엔 없다

| 김미래 기자

중국 AI 기업 오픈BMB(OpenBMB)의 소형 언어모델 미니CPM5-2B(MiniCPM5-2B)가 인공지능 평가지표 아티피셜 애널리시스 인텔리전스 인덱스(Artificial Analysis Intelligence Index) v4.2에서 15점을 받아 40억(4B) 파라미터 미만 오픈모델 가운데 1위에 올랐다는 주장이 나왔다. 그러나 이 모델의 공개 체크포인트는 오픈BMB 공식 저장소와 허깅페이스(Hugging Face) 어디에서도 확인되지 않는다.

미니CPM5-2B가 이 같은 성적을 냈다고 크립토브리핑(Cryptobriefing)은 보도했다. 아티피셜 애널리시스는 지난 4일 v4.2를 공개하면서 평가 항목에 AA-브리프케이스(AA-Briefcase)와 서지(Surge)의 GDP.pdf를 새로 추가하고, 외부에 공개되지 않는 비공개(private·held-out) 테스트 비중을 40%로 높였다고 밝혔다.

◇ 저장소에서도, 순위표에서도 안 보인다

정작 아티피셜 애널리시스가 운영하는 타이니(Tiny) 오픈소스 순위표에는 미니CPM5-2B가 이름을 올리지 못했다. 현재 이 페이지 상위권은 그래니트(Granite) 4.2 3B, G9v3-3B, 큐원(Qwen)3 4B 2507, 미니CPM5-1B가 차지하고 있다.

오픈BMB의 공식 깃허브(GitHub) 저장소도 현재 배포 중인 모델을 미니CPM5-1B로 표기하고, 다운로드 목록 역시 1B 계열만 올려놨다. 허깅페이스의 미니CPM5 컬렉션 페이지에서도 1B, 1B-SFT, 1B-베이스, 1B-GGUF, 1B-MLX만 확인되며 2B 체크포인트는 보이지 않는다.

오픈BMB의 상업 파트너사인 모델베스트(ModelBest) 공식 페이지 역시 미니CPM5-1B의 아티피셜 애널리시스 지수 점수 17.9를 앞세우고 있을 뿐, 2B 모델 카드는 확인되지 않는다.

◇ 평가 기준이 바뀐 v4.2

아티피셜 애널리시스 인텔리전스 인덱스는 여러 벤치마크 점수를 하나의 지수로 종합해 오픈·비공개 언어모델의 성능을 상대 비교하는 지표다. held-out test는 모델 학습 과정에 쓰이지 않고 평가 시점에만 공개되는 문제 세트로, 비중이 높을수록 모델이 문제를 미리 학습해 점수를 얻는 경우를 걸러내는 효과가 있다.

이번 v4.2는 에이전트형 작업과 장문 문서 추론, 지식 과제 비중을 늘리는 방향으로 개편됐고 비공개 테스트 비중도 40%로 올라갔다. 평가 구성 자체가 이전 버전과 달라진 만큼, 미니CPM5-2B가 받았다는 15점과 미니CPM5-1B의 17.9점을 포함해 이전 버전 점수와 이번 v4.2 점수를 직접 비교하기는 어렵다.

◇ 소형 모델 경쟁의 배경

소형 오픈모델을 둘러싼 벤치마크 경쟁은 최근 두드러진 흐름이다. 중국 AI 기업들이 대형 오픈웨이트 모델을 잇달아 내놓으며 벤치마크 순위 경쟁을 벌여온 것도 같은 맥락이다. 파라미터 수만으로 우열을 가리기 어려워진 평가 체계에서, 오픈BMB 쪽 공개 자료는 온디바이스 실행과 로컬 배포, 툴 호출, 하이브리드 추론(reasoning) 같은 키워드를 앞세우고 있다.

중국 AI 모델들이 허깅페이스 다운로드에서 상당한 비중을 차지해온 흐름도 이런 경쟁의 배경 가운데 하나다. 오픈BMB 역시 미니CPM5 시리즈를 허깅페이스에 직접 올려 배포하는 방식을 택하고 있다.

◇ 커뮤니티는 기다리는 중

허깅페이스 토론 게시판에는 '미니CPM5-2B는 언제 나오나(MiniCPM5-2B When?)'라는 제목의 글이 올라와 있다. 다른 토론 스레드에도 정식 공개를 촉구하는 글이 확인된다.

공개 미러에서 확인되는 오픈BMB의 1B 발표 글에는 오프라인 실행과 데스크톱 탑재, 개발 스택 호환성을 높게 평가하는 반응이 붙어 있다. 시장의 관심이 '2B가 몇 점이냐'보다 '작은 모델을 실제로 얼마나 잘 깔고 돌릴 수 있느냐'에 쏠려 있다는 점을 보여준다.

독립 분석 매체 레미오(Remio)는 미니CPM5-2B의 서브-4B 선두 주장을 소개하면서도, 이에 대응하는 공개 체크포인트가 보이지 않고 독립적인 재현 검증이 제한적이라고 지적했다.

벤치마크 순위 1위가 곧바로 실제 배포 우위를 뜻하지는 않는다. 장문 컨텍스트 처리와 툴 사용, 온디바이스 실행, 칩 적응 같은 항목은 별도 검증이 필요한 영역이다.

현재까지 공개된 자료에서 확인되는 것은 미니CPM5-1B의 존재와 아티피셜 애널리시스 지수 상위권 성적이다. 미니CPM5-2B의 공개 배포 여부는 오픈BMB, 허깅페이스, 모델베스트 등 어느 공식 채널에서도 확인되지 않는다.

기사요약 by TokenPost.ai

🔎 시장 해석
오픈BMB가 내세운 '미니CPM5-2B'의 벤치마크 1위 주장과, 공식 저장소·허깅페이스·모델베스트에서 확인되는 배포 현황(미니CPM5-1B만 존재) 사이에 간극이 있다. 소형 오픈모델 경쟁이 단순 점수 경쟁을 넘어 '실제 공개·재현 가능성'까지 검증받는 단계로 넘어가고 있다는 뜻이다.

💡 전략 포인트
벤치마크 순위와 실제 공개 배포 여부는 별개로 확인해야 한다. 아티피셜 애널리시스 v4.2는 평가 항목과 비공개 테스트 비중이 바뀌어 이전 버전 점수와 단순 비교가 어렵다는 점도 함께 감안할 부분이다.

📘 용어정리
'held-out test'는 모델 학습 과정에 사용되지 않고 평가 시에만 공개하는 비공개 문제 세트를 뜻한다. 비중이 높을수록 모델이 문제를 미리 학습해 점수를 얻는 것을 막는 효과가 있다.

💡 자주 묻는 질문 (FAQ)

Q. 미니CPM5-2B는 실제로 존재하는 모델인가요? 2026년 9월 7일 기준 오픈BMB 공식 깃허브, 허깅페이스, 모델베스트 어느 채널에서도 미니CPM5-2B의 공개 체크포인트는 확인되지 않는다. 현재 공개된 모델은 미니CPM5-1B다. Q. 아티피셜 애널리시스 지수 v4.2는 이전 버전과 점수를 비교할 수 있나요? 비교하기 어렵다. v4.2는 평가 항목에 AA-브리프케이스, GDP.pdf를 추가하고 비공개 테스트 비중을 40%로 높여 평가 기준 자체가 달라졌다. Q. 4B 미만 소형 오픈모델 순위에서 현재 상위권은 어떤 모델인가요? 아티피셜 애널리시스의 타이니 오픈소스 순위표에는 그래니트 4.2 3B, G9v3-3B, 큐원3 4B 2507, 미니CPM5-1B가 상위권에 올라 있다.
본 기사는 시장 데이터 및 차트 분석을 바탕으로 작성되었으며, 특정 종목에 대한 투자 권유가 아닙니다.

많이 본 기사

지금 꼭 알아야 할 리포트

게임하고 주식토큰 받기