TOKENPOST

GPT-6 아스트라, 프론티어매스 Tier 4서 97.6%

수학 증명 자료를 검토하는 연구자의 손 / TokenPost.ai (mono)

GPT-6 아스트라가 수학 추론 벤치마크 프론티어매스(FrontierMath) Tier 4(v2)에서 97.6%를 기록했다. 다만 ‘Major Advance’ 판정은 이 점수에 붙은 등급이 아니라 별도 문제 풀이 프로그램의 성과 분류다.

오픈AI(OpenAI)는 공식 발표에서 자체 연구 환경 또는 API를 통해 GPT-6 아스트라를 평가한 결과 이 점수를 기록했다고 밝혔다. 같은 표에서 GPT-5.6 솔은 83.0%, 클로드 페이블 5.1은 87.8%를 기록했다.

오픈AI는 평가 환경과 실제 서비스 사이에 시스템 프롬프트와 도구 차이가 있을 수 있다고 설명했다. 따라서 해당 수치는 특정 평가 조건에서 측정된 결과로 해석해야 한다.

프론티어매스 Tier 4(v2)는 연구 수준의 수학 문제를 다루는 평가다. Epoch AI는 전체 세트가 338개 문제로 구성됐으며, 이 가운데 295개는 Tiers 1~3, 43개는 Tier 4라고 밝혔다.

Epoch AI는 2026년 6월 12일 문제 오류를 수정하는 과정에서 전체 문제의 42%를 손봤다고 설명했다. 문제 세트가 수정된 만큼 평가 결과를 비교할 때는 버전과 문제 구성을 함께 봐야 한다.

‘Major Advance’는 Tier 4의 점수 구간이 아니다. Epoch AI의 별도 프로그램인 ‘FrontierMath: Open Problems’가 수학적 성과의 중요도를 평가하는 분류로, ‘Breakthrough’보다 한 단계 낮다.

Epoch AI는 광범위한 수학 분야의 연구자들이 성과에 주목하고 해법의 개요를 이해하려 할 만한 결과를 ‘Major Advance’로 정의한다. 점수 자체보다 문제 해결의 학술적 의미를 평가하는 별도 기준인 셈이다.

해당 판정을 받은 문제는 ‘The Core in Approval-Based Committee Elections’다. Epoch AI는 이 문제의 최초 해결 모델로 GPT-6 아스트라를 기재했지만, 해결 방식은 ‘human + AI’로 표시했다.

Becker, Greger, Peters 연구진은 핵심 아이디어와 증명을 GPT-6 아스트라에 주로 귀속했지만 장시간 상호작용이 필요했다고 설명했다. Epoch AI는 문제 페이지에서 “GPT-6 아스트라가 간단한 프롬프트만으로 문제를 바로 해결할 수 있었던 것은 아니다”라고 밝혔다.

이 기록은 모델이 독립적으로 문제를 풀었다기보다 인간 연구자와의 협업 과정에서 주요 아이디어를 제시했다는 의미에 가깝다. ‘Major Advance’라는 분류만으로 AI 단독 연구 성과로 확대 해석하기 어려운 이유다.

문제 자체에도 조건이 있었다. 연구진의 해법은 승인투표위원회에서 ‘core가 비어 있는 사례가 존재하지 않는다’는 점을 증명했다.

Epoch AI는 이에 따라 벤치마크 문제가 처음부터 풀 수 없는 형태로 작성됐다고 설명하면서도, 정책상 해당 문제를 해결된 것으로 표시했다. 문제의 해결 기록과 문제 설계의 적절성은 별도로 봐야 한다.

따라서 ‘GPT-6 아스트라가 프론티어매스에서 첫 번째 Major Advance를 달성했다’는 표현은 서로 다른 사실을 합친 요약에 가깝다. 확인된 사실은 Tier 4(v2)에서 97.6%를 기록했다는 점과 별도 Open Problems 프로그램의 Major Advance 문제에 인간 연구자와 협업해 기여했다는 점이다.

평가의 독립성도 쟁점이다. Epoch AI는 관계 공개문에서 프론티어매스가 오픈AI의 지원으로 개발됐으며, 오픈AI가 일부 문제에 독점적으로 접근한다고 공개했다.

오픈AI가 300개 수학 문제 제작을 의뢰했고 문제와 해법에 접근할 수 있다는 설명도 나왔다. Epoch AI는 오픈AI가 해법을 볼 수 없는 별도 50개 문제 세트를 마련하고 있다고 밝혔다.

별도 평가에서는 성과의 범위가 더 제한적으로 나타났다. 프론티어매스 얼되시에서 GPT-6 아스트라의 공식 점수는 3%였고, Epoch AI는 고정된 조건에서 68개 문제 중 2개를 해결했다고 밝혔다.

반복 시도와 더 큰 예산을 포함한 비공식 실험에서는 5개 문제를 해결했지만, 이 결과는 공식 점수에 포함되지 않았다. 프론티어매스의 세부 문제군과 평가 조건에 따라 성과가 크게 달라질 수 있다는 점을 보여준다.

이번 결과는 AI의 수학 추론 능력을 보여주는 벤치마크 수치와 실제 연구 성과를 같은 의미로 읽기 어렵다는 점을 드러냈다. 가상자산·블록체인 시장과의 직접적인 연결이나 관련 토큰의 수혜 가능성은 이번 자료에서 제시되지 않았다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.