TOKENPOST

Modal, 키미 K3 초당 460토큰 제시…미국 AI 인프라 기업 API에 잇따라

AI 추론용 GPU 컴퓨팅 장비 이동 장면 / TokenPost.ai

중국 문샷AI가 개발한 대형 오픈웨이트 모델 키미 K3가 미국 AI 인프라 기업들의 API 서비스에 잇따라 올라왔다. Modal은 전용 추론 가속기를 적용해 초당 460토큰 처리 성능을 제시했다.

키미 K3는 2.8조개 파라미터를 갖춘 Mixture-of-Experts(MoE) 모델이다. 896개 전문가 모듈 가운데 토큰당 16개가 작동하며 활성 파라미터는 약 1040억개다. 컨텍스트 창은 104만8576토큰으로 긴 문서와 대규모 코드베이스 처리를 겨냥한다.

문샷AI는 기술 보고서와 함께 키미 K3의 모델 가중치를 공개했다. 이는 모델 개발과 실제 서비스 운영 사이의 차이를 보여주는 배경으로 꼽힌다.

Modal은 2026년 7월 27일 키미 K3 지원을 시작하며 자체 환경에서 초당 460토큰을 처리했다고 밝혔다. 키미 K3에 맞춰 학습한 DFlash 추론 가속기를 적용한 결과로, DFlash는 모델이 생성할 토큰을 미리 제안한 뒤 실제 모델이 이를 검증하는 방식으로 처리량을 높인다.

초당 460토큰이라는 수치는 Modal의 특정 하드웨어와 소프트웨어 설정에서 나온 결과다. 다른 GPU 구성이나 업무 환경에서도 같은 속도가 재현된다고 단정할 수 없으며, 실제 성능은 요청 길이와 동시 처리량에 따라 달라질 수 있다.

Fireworks와 Baseten도 키미 K3를 API 모델로 제공하고 있다. 세 업체가 공개한 가격은 입력 토큰 100만개당 3달러(약 4158원), 캐시된 입력 토큰 100만개당 0.30달러(약 416원), 출력 토큰 100만개당 15달러(약 2만79원)다.

API 서비스의 가격 경쟁은 모델 가중치를 공개하는 것만으로는 충분하지 않다는 점을 보여준다. 기업 고객은 토큰 단가뿐 아니라 전용 GPU 사용료, 대기 시간, 캐시 적중률, 데이터 전송비, 동시 요청 수와 배치 방식을 함께 비교해야 한다.

키미 K3의 운영 난도는 모델 규모에서 드러난다. 모델을 직접 운영하려면 GPU 메모리와 GPU 사이의 연결 대역폭이 중요하다.

반면 키미 K3를 구동하는 데 8개의 GB300이 필요하다는 구체적인 배치 구성은 공개 자료로 확인되지 않았다. 따라서 특정 GPU 수량을 모델 운영의 필수 조건으로 받아들이기보다 실제 배포 환경에 따른 사례로 구분해야 한다.

엔비디아($NVDA)는 GB300 NVL72를 72개의 Blackwell Ultra GPU와 36개의 Grace CPU를 결합한 랙 규모 시스템으로 설명한다. AMD의 MI355X는 288GB HBM3E와 8TB/s 메모리 대역폭을 지원한다.

두 제품의 사양은 대형 모델을 서비스할 때 GPU의 연산 성능뿐 아니라 메모리 용량과 데이터 이동 속도도 중요한 요소라는 점을 보여준다. 모델이 클수록 가중치를 메모리에 올리고 여러 GPU 사이에서 데이터를 교환하는 과정이 서비스 비용과 지연시간에 영향을 준다.

미국 상무부 산업안보국(BIS)은 중국을 포함한 D:5 국가로 향하는 첨단 컴퓨팅 집적회로와 관련 장비에 수출통제가 적용될 수 있다고 안내하고 있다. 다만 문샷AI가 특정 미국산 GPU에 직접 접근할 수 없다는 사실이나 미국 서비스 업체들이 해당 GPU를 모두 사용한다는 내용은 공개 자료로 확인되지 않았다.

커뮤니티에서는 다른 성능 사례도 나왔다. Reddit의 한 사용자는 8개의 B300 GPU로 키미 K3를 실행해 초당 92토큰과 토큰 100만개당 약 190달러(약 26만3340원)의 비용을 기록했다고 주장했다.

이 실험은 개인 게시물에 담긴 결과로, Modal이 제시한 초당 460토큰과 같은 조건에서 비교할 수 없다. 서비스 업체의 자체 벤치마크와 커뮤니티 실험은 하드웨어, 소프트웨어, 요청 구성, 비용 산정 방식이 다르기 때문이다.

이번 사례는 대형 AI 모델의 경쟁력이 모델 구조에만 좌우되지 않는다는 점을 보여준다. 모델 가중치를 공개해도 실제 서비스 단계에서는 GPU 메모리, 네트워크 연결, 추론 소프트웨어, 데이터 처리 정책이 함께 필요하며, 비용·속도 우위는 동일한 모델과 하드웨어, 업무 부하를 적용한 독립 검증이 이뤄져야 판단할 수 있다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.