앤트로픽(Anthropic)의 클로드 오퍼스 5.5(Claude Opus 5.5) 출시 후 성능 변화를 추적하는 오픈소스 프로젝트가 가동됐다. 리브너프(Livenerf)는 매일 같은 조건으로 모델을 평가하지만 10월 1일 기준 성능 저하 여부를 판단할 결과는 아직 나오지 않았다.
개인 개발자 ninjahawk가 만든 리브너프는 9월 22일 출시된 오퍼스 5.5를 대상으로 한다. 프로젝트 저장소에는 앤트로픽과 무관한 독립 프로젝트이며 공개된 규칙과 고정된 채점 방식을 사용한다고 적혀 있다. 원시 평가 기록도 계속 공개하는 방식이다.
오퍼스 5.5 출시에 관한 앤트로픽의 기존 설명은 앞선 보도에서 다뤄졌다. 리브너프는 출시 당시의 성능을 기준선으로 삼아 이후 같은 조건에서 분포가 달라지는지를 따로 측정한다.
평가 대상은 GPQA Diamond, MMLU-Pro, 경쟁 수학, AIME 2025~2026에서 추린 2,336개 문항이다. 오퍼스 5.5에 각 문항을 네 차례씩 풀게 한 결과 약 93%를 첫 시도에 맞혔다. 97%의 문항은 네 번 모두 맞히거나 모두 틀렸고, 정답 여부가 갈린 문항은 78개였다.
리브너프는 이 78개 문항을 실제 추적 패널로 사용한다. 항상 정답이 나오는 문항은 모델이 약해져도 변화가 드러나지 않고, 항상 오답인 문항도 개선 여부를 구분하기 어렵기 때문이다. 매일 각 문항을 한 차례 평가하며 채점은 언어모델이 아니라 정답과의 정확한 대조로 이뤄진다.
평가 기간은 30일이다. 첫 10일은 출시 직후 기준선으로 삼고, 이후 10일씩 두 구간을 비교한다. 사전 등록 문서에는 첫 기준선 구간이 2026년 9월 24일부터 시작한다고 적혀 있다.
10월 1일 기준으로는 기준선 수집이 진행 중이다. 9월 30일 시점에는 첫 구간에서 7일을 모은 상태였으며, 두 비교 구간까지 모두 끝나야 가장 이른 판정이 가능하다.
판정 기준도 사전에 정해졌다. 연속된 두 개의 10일 구간에서 기준선과의 차이가 99% 신뢰구간상 0을 포함하지 않고, 변화 폭이 각각 3%포인트 이상이어야 한다.
대조군으로는 클로드 오퍼스 5가 사용된다. 같은 평가 환경에서 두 모델이 함께 움직이면 특정 모델의 변화가 아니라 도구나 플랫폼 변화로 분류한다.
다만 리브너프의 민감도에는 한계가 있다. 리브너프의 사전등록 문서는 10일 구간에서 약 7.5%포인트의 정확도 변화가 감지 가능한 수준으로 예측된다고 제시했다. 이보다 작은 변동은 통계적 잡음에 묻힐 수 있다.
검증 과정에서 오퍼스 5.5를 오퍼스 5로 바꾼 실험에서는 정확도가 3.8±6.3%포인트 낮아졌지만 99% 수준에서 차이를 구별하지 못했다. 토큰 사용량도 23% 줄었지만, 이 정도 변화는 해당 평가 방식으로 확인하기 어려웠다.
측정 경로도 제한적이다. 리브너프는 API 원본 모델이 아니라 클로드 맥스 구독에서 헤드리스 클로드 코드를 통해 제공되는 오퍼스 5.5를 평가하며, CLI 버전은 2.1.280으로 고정돼 있다.
추론 강도와 프롬프트, 채점기, 실행 조건은 고정되지만 실제 이용자가 경험하는 기본 설정이나 도구·기억 기능의 변화까지 모두 반영하지는 않는다. 따라서 리브너프가 측정하는 대상은 API 모델 자체라기보다 클로드 코드를 통해 제공되는 오퍼스 5.5다.
앤트로픽은 과거 클로드 코드 품질 논란을 모델 자체의 변화뿐 아니라 서비스 구성 요소의 문제로 설명한 바 있다. 2025년 9월 사후 분석에서는 인프라 버그와 컨텍스트 창 라우팅 오류를 다뤘고, 2026년 4월 업데이트에서는 기본 추론 강도와 사고 캐시, 시스템 프롬프트 변경을 설명했다. 앤트로픽의 사후 분석은 서비스 계층의 변화가 이용자가 체감하는 품질에 영향을 줄 수 있음을 보여준다.
리브너프는 모델이 '몰래 약해졌는가'라는 질문에 즉시 답하는 도구라기보다 출시 이후 동일한 조건에서 성능 분포가 이동하는지를 장기간 기록하는 측정 장치에 가깝다. 첫 판정은 30일 평가와 두 차례의 10일 비교 구간이 끝난 뒤 이뤄질 예정이다.

김민준 기자
댓글0
첫 댓글을 남겨 보세요.