그록 4.7이 코딩 평가에서 추론 수준별로 1~3위를 기록했지만, 심사위원 구성이 달라 점수만으로 다른 모델보다 코딩을 잘한다고 결론 내리기는 어렵다.
VulcanBench는 10월 4일 Frontier v4 평가 결과를 공개했다. 그록 4.7은 Cursor의 코딩 에이전트 CLI에서 23개 과제를 수행해 최고 수준 설정에서 93.15점으로 1위, 높은 수준에서 92.71점으로 2위, 중간 수준에서 92.30점으로 3위를 기록했다. 낮은 수준은 89.42점으로 12위였다.
추론 수준이 높을수록 통과한 과제 수가 많았지만 실행 시간도 길었다. 낮은 수준은 23개 중 18개를 통과했고 과제당 평균 20.2분이 걸렸다. 최고 수준은 23개를 모두 통과했으며 평균 28.5분이 소요됐다. 중간 수준은 21개를 통과했고, 한 과제는 제한 시간 안에 완성하지 못했다.
이번 평가는 모델만 따로 떼어 측정한 결과가 아니라 그록 4.7과 Cursor 실행 환경의 조합을 평가했다. 점수에는 기능 정확성뿐 아니라 코드 품질, 복잡도, 보안 검사도 반영됐다. 코드 품질은 전체 점수의 33%를 차지하며, 가독성과 유지보수성 등을 모델 심사위원이 평가했다.
심사 방식도 모델별 점수 비교에 영향을 줄 수 있다. VulcanBench는 다른 모델의 코드 품질을 평가할 때 그록 4.6을 심사위원으로 포함했지만, 그록 4.7 평가에는 GPT-6.1 Sol을 대신 사용했다. 같은 제출물을 채점했을 때 GPT-6.1 Sol 점수는 Muse Spark 1.3보다 5.4~6.3점 높았다. VulcanBench는 이 차이 때문에 그록 4.7의 종합 점수를 다른 모델과 직접 비교하는 데 한계가 있다고 밝혔다.
공통 심사위원인 Muse Spark 1.3의 점수만 비교한 결과에서도 그록 4.7은 중간·높음·최고 수준에서 상위권을 유지했다. 낮은 수준에서는 클로드 Fable 5.1보다 낮았다. 심사위원 구성을 맞추면 공개 종합 순위와 일부 결과가 달라질 수 있다.
평가 과제당 비용은 산출되지 않았다. VulcanBench는 그록 4.7의 가격표가 없고 테스트가 Cursor 구독 환경에서 실행돼 과제별 비용을 확인할 수 없다고 밝혔다. 따라서 점수와 실행 시간만으로 개발팀의 비용 절감 여부를 판단하기는 어렵다.
xAI는 9월 21일 그록 4.7을 공개하며 그록 4.6보다 더 큰 기반 모델을 사용했다고 밝혔다. 회사가 제시한 API 가격은 입력 토큰 100만 개당 2달러(약 2686원), 출력 토큰 100만 개당 6달러(약 8058원)다. 이 가격은 VulcanBench 평가의 과제당 비용을 뜻하지 않는다.
xAI는 출시 자료에서 CursorBench 4.0 등 다른 평가 결과도 공개했다. 평가 지표와 실행 조건이 달라 Frontier v4 점수와 직접 묶어 비교하기는 어렵다. 그록 4.7이 다른 벤치마크에서 클로드에 뒤졌다는 본지 보도 역시 평가별 조건을 구분해 읽을 필요가 있다.
이번 결과는 특정 코딩 과제와 Cursor 환경에서 그록 4.7이 높은 점수를 기록했다는 점을 보여준다. 실제 개발 업무의 성능과 비용 효율을 판단하려면 과제 종류와 실행 환경을 맞춘 비교가 필요하다.

이도현 기자
댓글0
첫 댓글을 남겨 보세요.