TOKENPOST

CLM-8B, 16.5밀리초 판단…제브보다 최대 9배 빨라

토포AI로 이 기사 더 깊이 읽기

노트북 화면 속 공룡 게임과 키보드 / TokenPost.ai

스탠퍼드와 엔비디아 리서치가 개발한 CLM-8B가 T-Rex 게임 벤치마크에서 16.5밀리초 만에 판단해 제브(Jev)의 149.8밀리초보다 최대 9배 짧은 지연 시간을 기록했다. CLM-8B는 문장을 생성하는 대신 후보 행동 가운데 하나를 선택하는 AI 에이전트용 모델이다.

CLM-8B는 23일 공개된 ‘Contrastive Language Model’ 계열의 첫 공개 모델이다. 공식 저장소는 컴퓨터 사용·게임·도구 호출 작업에서 CLM-8B가 제브와 비슷한 성능을 내면서 최대 9배 낮은 지연 시간을 기록했다고 밝혔다.

T-Rex 벤치마크에서 CLM-8B의 판단 시간은 16.5밀리초였고 제브는 149.8밀리초가 걸렸다. 다만 해당 수치는 특정 하드웨어와 벤치마크 조건에서 측정된 결과로, 모든 작업에서 같은 속도 차이가 난다는 뜻은 아니다.

CLM-8B는 기존 대규모 언어 모델과 처리 방식이 다르다. 현재 상태와 후보 행동을 각각 벡터로 바꾼 뒤 가장 가까운 행동을 고르며, 상태와 행동의 임베딩을 분리해 계산한다.

반복적으로 사용되는 행동 임베딩은 캐시해 처리 시간을 줄인다. 문장을 처음부터 생성하는 과정이 필요하지 않아 후보 행동을 빠르게 평가해야 하는 에이전트 작업에 맞춘 구조다.

모델은 Qwen3-8B를 고정된 기반 모델로 사용하고 약 2000만개 파라미터 규모의 학습 가능한 프로젝션 헤드를 추가했다. 학습에는 약 6000만개의 Nemotron 질의·응답 쌍, 약 3000만개의 합성 하드 네거티브, 약 100만개의 에이전트 궤적이 활용됐다.

공식 저장소는 CLM-8B가 제로샷 평가에서 제브와 비슷한 수준의 결과를 냈다고 설명했다. 별도 미세조정 후에는 DeepSWE에서 81.6%, Terminal-Bench 2.1에서 87.6%를 기록했다.

두 수치는 공개된 기본 모델 자체가 아니라 미세조정된 검증기 헤드의 결과다. 따라서 기본 모델의 제로샷 성능과 미세조정 모델의 벤치마크 결과를 같은 기준으로 비교하기는 어렵다.

제브는 장문을 생성하기보다 입력된 상태를 바탕으로 선택지와 점수, 불리언 값, 확률을 반환하는 모델로 소개됐다. 제브가 장문 생성보다 다음 행동 선택에 활용된 사례가 앞서 공유된 것처럼, CLM-8B도 생성보다 판단과 선택에 초점을 맞춘다.

CLM-8B는 범용 챗봇이 아니다. 주어진 후보 행동의 점수를 계산하고 그중 하나를 선택하는 모델이어서 후보에 없는 답을 새로 만들거나 독립적인 문장을 생성하는 용도로 설계되지 않았다.

두 모델의 성능 비교는 평가 방식에 따라 달라질 수 있다. JevEmbed 저장소의 일부 평가에서는 CLM-v0.1-8B가 JevBench 231개 과제에서 41.99%의 정확도를 기록했지만, 개발팀이 제시한 ‘제브와 비슷한 성능’과는 과제 구성과 측정 방식이 다르다.

모델 가중치와 코드는 Apache 2.0 라이선스로 공개됐다. Hugging Face 모델 카드에는 Qwen3-8B 임베딩 서버와 실행 환경을 구성하면 단일 NVIDIA GPU에서 자체 운영할 수 있다고 안내돼 있다.

오픈 가중치와 단일 GPU 운영 지원은 자체 AI 에이전트를 구축하려는 개발자가 모델을 직접 시험할 수 있게 하는 요소다. 다만 실제 서비스 비용 절감이나 에이전트 성능 향상으로 이어지는지는 별도 검증이 필요하다.

공식 자료를 둘러싼 커뮤니티 반응은 엇갈렸다. Reddit의 LocalLLaMA 커뮤니티에서는 오픈 가중치와 낮은 지연 시간을 긍정적으로 평가하는 의견이 나온 반면, 일부 이용자는 범용 지식과 긴 문맥 처리에서는 제브보다 제한적일 수 있다고 지적했다.

개발팀은 멀티모달 후속 모델 CLM-35B를 10월 초 공개할 예정이라고 모델 카드에서 밝혔다. 실제 출시일과 성능은 아직 제시되지 않았다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.