1240억개 링 3.0 플래시, 토큰당 51억개만 쓴다

| 서도윤 기자

앤트그룹(Ant Group)의 AI 조직 인클루전AI(inclusionAI)가 전체 파라미터 1240억개 가운데 토큰당 51억개만 활성화하는 대규모 언어모델 링 3.0 플래시(Ling-3.0-flash)를 선보였다. FP8 양자화판의 용량은 BF16판의 절반 수준인 약 128GB로 전해졌다.

중국 블록비츠(BlockBeats)는 5일 링 3.0 플래시의 BF16 원본판과 FP8 양자화판이 MIT 라이선스로 허깅페이스(Hugging Face)와 모델스코프(ModelScope)에 올라왔으며, SGLang이나 vLLM으로 자체 배포할 수 있다고 전했다. 블록비츠가 제시한 용량은 BF16판 약 255GB, FP8판 약 128GB다.

앤트링 공식 문서는 링 3.0 플래시를 전문가 혼합형(Mixture-of-Experts·MoE) 모델로 설명한다. 전문가 혼합형은 입력에 따라 일부 전문가 네트워크만 호출하는 구조로, 전체 모델 규모를 유지하면서 실제 연산량을 줄인다.

공식 문서는 이 모델이 256K 컨텍스트 창을 기본 지원하고 1M 토큰까지 확장할 수 있다고 밝혔다. 고빈도 작업에서는 최대 초당 1000토큰의 피크 추론 속도와 100ms 미만의 첫 토큰 응답시간(TTFT)을 목표로 한다고 설명했다.

앤트그룹은 7월 27일 공식 보도자료에서 링 3.0 플래시에 KDA(Kimi Delta Attention)와 MLA(Multi-head Latent Attention) 레이어를 5대 1 비율로 교차 배치한 네이티브 하이브리드 선형 어텐션 구조를 적용했다고 밝혔다. 이전 세대의 전문가 활성화 비율도 32분의 1에서 64분의 1로 낮췄다.

FP8은 BF16보다 낮은 정밀도로 파라미터를 저장해 가중치 용량과 메모리 사용량을 줄이는 형식이다. 블록비츠가 전한 수치대로라면 FP8판의 용량은 BF16판보다 절반가량 작다. 다만 5일 기준 앤트링 공식 모델 문서에서는 전체·활성 파라미터와 컨텍스트 창을 확인할 수 있지만, 동일한 허깅페이스 모델 카드는 확인이 제한적이었다.

앤트링 공식 가격 문서는 링 3.0 플래시를 한국시간으로 7월 23일 오전 1시부터 8월 7일 오전 0시59분59초까지 무료로 제공한다고 밝혔다. 8월에는 75% 할인이 적용되며, 정상 가격은 100만 입력 토큰당 0.40위안, 100만 출력 토큰당 1.20위안이다.

이번 발표에서 크립토·블록체인과의 직접적인 연결점은 제시되지 않았다. 자체 서버나 프라이빗 클라우드에서 에이전트형 AI를 운용하려는 개발팀은 실제 배포에 앞서 모델 카드와 라이선스 파일, 체크섬을 확인해야 한다.

본 기사는 시장 데이터 및 차트 분석을 바탕으로 작성되었으며, 특정 종목에 대한 투자 권유가 아닙니다.

많이 본 기사

지금 꼭 알아야 할 리포트