TOKENPOST

그록 4.7·샤오미 모델, 사이버 방어 평가 56점 공동 1위

토포AI로 이 기사 더 깊이 읽기

취약점 수정 표시가 된 코드 검토 자료 / TokenPost.ai

그록 4.7과 샤오미 MiMo-V2.6-Pro가 사이버 인덱스에서 각각 56점을 받아 공동 1위에 올랐다. 평가 작업당 비용은 그록 4.7이 11.67달러(약 1만5738원), MiMo-V2.6-Pro가 0.18달러(약 243원)였다.

아티피셜 애널리시스(Artificial Analysis)는 평가 페이지에 그록 4.7의 설정을 ‘xhigh’로 표시했다. GPT-6 Luna는 53점으로 뒤를 이었다. 원문 제목의 ‘1위’는 단독 1위가 아닌 공동 1위를 뜻한다.

사이버 인덱스는 실제 소프트웨어 저장소에서 취약점을 찾고 재현·검증한 뒤 기존 기능을 해치지 않도록 수정하는 방어 작업을 평가한다. 아티피셜 애널리시스는 CWE-Bench-AA, DeepsecBench-AA, CyberGym-E2E-AA 세 평가 점수를 같은 비중으로 합산한다고 설명했다. 공격용 익스플로잇 개발 능력은 평가 범위에 포함하지 않는다.

아티피셜 애널리시스는 세 평가에 취약점 감사와 수정, 취약점 탐지, 메모리 안전성 문제의 발견·재현·수정 등 서로 다른 과제가 포함된다고 설명했다. 따라서 56점은 여러 방어 과제를 종합한 결과이며, 특정 기업의 코드베이스나 보안 절차에서도 같은 성능을 낸다는 의미는 아니다.

두 모델은 종합 점수에서 공동 선두였지만 작업당 비용에는 차이가 났다. 아티피셜 애널리시스가 공개한 평가 작업당 비용은 해당 벤치마크 과제의 평균치이며, 실제 기업 환경의 비용은 과제 구성과 사용량에 따라 달라질 수 있다.

기업이 보안 업무에 AI 모델을 적용할 때는 종합 순위뿐 아니라 필요한 과제별 결과와 비용을 함께 살펴야 한다. 이번 평가는 기업 시스템과의 통합 편의성이나 운영 안정성, 실제 도입 효과까지 다루지 않았다.

그록 4.7이 다른 벤치마크에서는 클로드에 뒤졌다는 앞선 보도와 이번 방어 작업 평가는 서로 다른 지표에 관한 결과다. 샤오미가 MiMo-V2.6 시리즈를 공개하며 오픈소스 모델 성능을 주장한 내용도 보도된 바 있다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.