TOKENPOST

하루 1조 토큰 가까이 처리한 프라임 인텔렉트, 추론 서비스 공개

토포AI로 이 기사 더 깊이 읽기

추론 연산을 맡은 GPU 가속기와 연결 케이블 / TokenPost.ai

프라임 인텔렉트는 내부 추론 시스템이 하루 1조 토큰 가까이를 처리해 왔다고 밝혔다. 회사는 이 시스템을 외부에 공개하고 첫 모델로 GLM-5.3을 배포했다.

BlockBeats는 Prime Inference가 강화학습, 합성 데이터 생성, 모델 평가와 코딩 에이전트 작업에 쓰였다고 보도했다. 이용자는 필요할 때 모델 추론을 호출하거나 장기간 안정적으로 쓸 용량을 미리 확보할 수 있다. API는 OpenAI API와 호환된다.

프라임 인텔렉트는 기존 강화학습·평가·샌드박스 훈련 인프라에 추론 서비스를 더했다. 이에 따라 모델 훈련과 실제 배포를 같은 플랫폼에서 다루고, 서비스 운영 중 생성된 데이터를 후속 훈련에 활용할 수 있다. BlockBeats는 회사가 올해 1월부터 고객 대상 대규모 배포도 운영해 왔다고 보도했다.

회사는 장문 입력과 에이전트 작업을 겨냥해 입력 처리와 답변 생성을 서로 다른 GPU 그룹에 나눠 맡기는 구조를 적용했다. 자체 시험에서 토큰 간 지연 시간의 p90 값은 기존보다 약 40% 낮아졌다. p90은 측정값의 90%가 그 값 이하인 지표다.

KV 캐시를 압축해 같은 메모리에서 디코더 하나가 보관할 수 있는 토큰 수는 109만개에서 163만개로 약 50% 늘었다고 회사는 밝혔다. 지연 시간과 캐시 용량 수치는 회사의 자체 시험 결과다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.