중국 신통원 MCP专项 테스트에서 상하이 원점성휘가 개발한 스타트럭스(StartLux)-V1.0-27B-프리뷰가 종합 2위에 올랐다. 270억개 파라미터 모델이 2840억개 파라미터의 딥시크(DeepSeek) V4 플래시 0731보다 높은 점수를 낸 결과다.
화성재경(MarsBit)은 중국정보통신연구원 인공지능연구소가 공개한 신뢰 AI 대모델 기준 테스트 MCP专项 평가에서 스타트럭스가 39.25%를 기록했다고 전했다. 3위 딥시크 V4 플래시 0731의 점수는 38.24%였고, 1위 딥시크 V4 프로와의 격차는 1%포인트로 제시됐다.
이번 평가는 8월 3일 시작됐다. 세 차례 전체 테스트의 평균값을 냈고, 위치 내비게이션, 웹 검색, 브라우저 자동화, 금융 분석, 코드 저장소 관리, 3D 설계 등 6개 분야 7개 항목을 다뤘다. MCP는 외부 도구와 데이터를 모델에 연결하는 모델 컨텍스트 프로토콜을 뜻한다. 단순 문답보다 실제 작업 수행 능력을 보는 평가에 가깝다.
스타트럭스는 같은 270억개 파라미터 규모의 큐원(Qwen)-3.6-27B보다 5.34%포인트 높은 점수를 냈다. 세부 항목에서는 위치 내비게이션에서 1위를 기록했고, 브라우저 자동화와 금융 분석에서는 딥시크 V4 프로와 공동 1위로 제시됐다.
딥시크 V4 프로와 V4 플래시의 모델 구조는 앞선 딥시크 계열 보도와도 이어진다. 본지는 앞서 딥시크 V4 프로와 V4 플래시가 공식 문서상 4월 24일부터 제공된 모델이라고 전했다. 당시 딥시크 공식 문서에는 V4 프로가 총 1조6000억개 파라미터, V4 플래시가 총 2840억개 파라미터를 갖춘 모델로 기재됐다.
이번 결과의 초점은 모델 크기다. 스타트럭스는 큐원3.6-27B를 기반으로 하고, 'AI가 AI를 훈련하는' 방식의 후훈련을 적용한 로컬 에이전트 모델로 소개됐다. 소비자용 개인용컴퓨터에서 실행할 수 있다는 점도 함께 제시됐다.
다만 이번 테스트 점수만으로 실제 서비스 성능 전반을 판단하기는 어렵다. 평가 항목은 MCP 기반 작업 수행에 맞춰져 있고, 일반 대화, 장문 추론, 코딩, 비용, 응답 지연 등 운영 지표와는 구분된다. 암호화폐와 금융 서비스 영역에서는 금융 분석 항목의 성능이 참고 지표가 될 수 있지만, 실제 적용 여부와 시장 영향은 별도 검증이 필요하다.
상하이 원점성휘 팀은 연내 1세대 로컬 지능형 솔루션을 내놓을 계획이라고 소개됐다.

