TOKENPOST

ECI 166점 GPT-6 아스트라, 249개 모델 1위

중립
이도현 기자
인공지능 성능 평가를 진행하는 노트북 / TokenPost.ai (mono)
인공지능 성능 평가를 진행하는 노트북 / TokenPost.ai (mono)

GPT-6 아스트라가 종합 인공지능 성능 지표에서 166점을 기록하며 249개 추적 모델 가운데 1위에 올랐다. 다만 소프트웨어 엔지니어링 평가에서는 47%에 그쳐 전문 영역별 성능이 종합 순위와 다를 수 있다는 점도 나타났다.

에포크 AI는 GPT-6 아스트라가 2026년 9월 3일 출시된 폐쇄형 모델이며, 에포크 역량 지수(ECI)에서 166점을 기록했다고 밝혔다. GPT-5.5 Pro는 162점, 클로드 페이블 5.1은 164점으로 집계됐다.

ECI는 단일 시험 결과가 아니라 여러 인공지능 벤치마크를 하나의 일반 능력 척도로 결합한 지표다. 에포크 AI는 50개가 넘는 벤치마크 결과를 모델별로 종합해 모델 간 성능을 비교한다고 설명했다.

ECI 산정에서는 난도가 높은 평가에서 더 나은 성과를 낸 모델에 높은 점수가 부여된다. 따라서 ECI는 특정 업무 하나의 성능보다 여러 평가 결과를 종합한 비교 지표에 가깝다.

영역별 성적은 고르게 높지 않았다. GPT-6 아스트라는 수학 평가인 FrontierMath Tier 4에서 98%, 과학·추론 평가인 GPQA Diamond에서 96%를 기록했다.

반면 소프트웨어 엔지니어링 평가인 MirrorCode에서는 47%를 기록했다. 같은 평가에서 클로드 페이블 5.1은 73%를 받아 GPT-6 아스트라보다 26%포인트 높았다.

이는 종합 지표에서 앞선 모델도 특정 전문 영역에서는 경쟁 모델에 뒤질 수 있음을 보여준다. ECI 순위만으로 코딩·수학·과학 등 모든 업무에서의 우위를 판단하기는 어렵다.

GPT-6 아스트라는 오픈AI가 9월 3일 공개한 모델이다. 오픈AI는 이 모델을 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 사이버보안, 과학 및 전문 업무를 겨냥한 모델로 소개했다.

오픈AI는 GPT-6 아스트라가 FrontierMath Tier 4에서 98%를 기록했다고 밝혔다. 이 수치는 에포크 AI가 제시한 해당 평가 결과와 일치한다.

ECI 점수는 시점에 따라 달라질 수 있다. 에포크 AI 뉴스레터는 출시 직후 GPT-6 아스트라의 ECI를 169점으로 소개했지만, 현재 모델 페이지에는 166점으로 표시돼 있다.

에포크 AI는 새 모델이나 벤치마크 결과가 추가되면 기존 모델의 점수도 바뀔 수 있다고 설명한다. 두 수치의 차이를 만든 구체적인 산정 변경 내역은 제시되지 않았다.

ECI는 절대적인 능력 점수라기보다 동일한 산정 체계 안에서 모델을 비교하는 지표로 활용해야 한다. 평가 항목과 산정 방식이 달라지면 같은 모델의 순위와 점수도 달라질 수 있기 때문이다.

API 가격은 입력 토큰 100만 개당 10달러(약 1만3500원), 출력 토큰 100만 개당 50달러(약 6만7500원)다. 오픈AI는 GPT-6 아스트라를 API와 유료 이용자에게 순차 공개했다.

오픈AI는 GPT-6 아스트라를 복잡한 추론과 코딩, 컴퓨터 사용, 연구 및 문서 작성에 활용할 수 있다고 밝혔다. 실제 활용 여부를 판단할 때는 종합 지수뿐 아니라 업무별 벤치마크와 API 비용을 함께 확인할 필요가 있다.

현재 공개된 수치에서는 GPT-6 아스트라가 종합 ECI에서 선두를 기록했지만, MirrorCode에서는 클로드 페이블 5.1에 뒤졌다. 종합 순위와 전문 영역별 성능을 함께 비교해야 모델의 활용 범위를 판단할 수 있다.

댓글0

첫 댓글을 남겨 보세요.