B.AI가 알리바바(Alibaba) 산하 큐원(Qwen)의 큐원3.8 플래시(Qwen3.8-Flash)를 플랫폼에 추가하고 개발자용 API 공식 그룹에서 무료 호출을 열었다. 개발자는 B.AI 플랫폼에서 큐원 최신 모델을 별도 과금 없이 시험 호출할 수 있게 됐다.
중국 매체 테크플로(TechFlow)는 B.AI가 27일 큐원3.8 플래시를 플랫폼에 올리고 API 공식 그룹에서 전량 무료 호출로 제공한다고 전했다.
큐원3.8 플래시는 큐원3.8 플래시 넥스트(Qwen3.8-Flash-Next)를 기반으로 한 호스팅 생산 버전이다. 큐원은 공식 블로그에서 큐원3.8 플래시 넥스트를 큐원4(Qwen4) 아키텍처의 초기 미리보기 성격으로 공개했다고 밝혔다.
이 모델은 다중모달 혼합전문가(MoE) 구조를 채택한 것으로 소개됐다. 혼합전문가 모델은 전체 파라미터를 매번 모두 쓰지 않고 작업에 필요한 일부만 활성화해 처리 비용과 응답 속도를 조정하는 방식이다.
모델 규모는 1250억개 주 모델 파라미터와 510억개 N-그램 임베딩 파라미터로 제시됐다. 토큰마다 활성화되는 파라미터는 60억개다.
기본 문맥 길이는 26만2144토큰이다. YaRN을 적용하면 최대 100만토큰까지 확장할 수 있다고 큐원은 설명했다.
기술적으로는 GDN(Gated DeltaNet)과 QSA(Qwen Sparse Attention)를 섞은 주의력 구조가 적용됐다. 큐원은 GDN이 긴 이력을 압축하고 QSA가 중요한 문맥을 미세 블록 단위로 고르는 방식이라고 설명했다.
B.AI는 활용 사례로 코딩 보조, 에이전트 워크플로, 문서 분석 등 다중모달 작업을 제시했다.
이번 배포는 큐원이 생산판 API 가격을 100만 입력 토큰당 0.16달러로 제시한 뒤 나온 추가 유통 사례다. 당시 제시된 출력 단가는 100만 출력 토큰당 0.47달러였다.
큐원3.8 플래시의 무료 호출은 B.AI API 공식 그룹을 통해 제공된다. 무료 호출 범위와 종료 조건은 실제 사용 전 플랫폼 공지와 청구 화면에서 별도로 확인할 필요가 있다.
B.AI의 모델 무료 개방은 처음이 아니다. 본지는 앞서 B.AI가 딥시크 V4 플래시 무료 접근을 열었던 사례를 보도한 바 있다.
AI 인프라 플랫폼이 외부 모델을 묶어 제공하면 개발자는 모델별 API와 과금 체계를 직접 따로 붙이는 부담을 줄일 수 있다. 반대로 실제 서비스에 적용할 때는 플랫폼의 속도 제한, 청구 기준, 데이터 처리 조건을 함께 따져야 한다.
한국 개발자에게는 무료 여부보다 제공 범위 확인이 먼저다. B.AI의 무료 호출은 API 공식 그룹을 대상으로 제공된다.

