맨위로 가기
  • 공유 공유
  • 댓글 댓글
  • 추천 추천
  • 스크랩 스크랩
  • 인쇄 인쇄
  • 글자크기 글자크기
링크 복사 완료 링크가 복사되었습니다.

커서, 전문가 혼합형 학습 처리량 41% 향상 보도

프로필
이도현 기자
댓글 0
좋아요 비화설화 0

커서의 전문가 혼합형 모델 학습 기술이 엔비디아 GB300 GPU 512개 환경에서 전체 처리량을 41% 높였다는 보도가 나왔다. 세부 코드와 재현 가능한 벤치마크는 커서 공식 채널에서 확인되지 않았다.

 엔비디아 관련 이미지 / TokenPost.ai

엔비디아 관련 이미지 / TokenPost.ai

AI 코딩 도구 커서(Cursor)의 전문가 혼합형(Mixture-of-Experts·MoE) 모델 학습 기술이 엔비디아($NVDA) GB300 GPU 512개 환경에서 전체 처리량을 41% 높였다는 보도가 나왔다. GPU 사이의 데이터 전송과 계산을 겹쳐 실행해 학습 병목을 줄이는 방식이다.

중국 모니터링 채널 동찰 비팅(Beating)은 5일 커서가 전문가 혼합형 모델 학습용 오픈소스 커널 ‘Mixture-of-Kittens(MoK)’를 공개했다고 전했다. 단일 전문가 혼합형 레이어 시험에서는 공개 대안보다 최대 2.37배 빠른 성능을 기록했다는 주장도 제시했다.

전문가 혼합형은 하나의 모델 안에 여러 전문가 네트워크를 두고 입력에 따라 일부만 호출하는 구조다. 계산량을 줄이면서 모델 규모를 키울 수 있지만 전문가가 여러 GPU에 분산되면 데이터 이동과 계산 대기 시간이 늘어난다. 이번에 보도된 기술은 분리돼 있던 데이터 전송과 계산을 하나의 커널 안에서 동시에 처리해 대기 시간을 줄이는 데 초점을 맞췄다.

다만 커서 공식 블로그와 공개 깃허브(GitHub) 저장소에서는 작성 시점까지 같은 명칭의 발표가 확인되지 않았다. 41%와 2.37배라는 수치는 동찰 비팅의 보도에 근거하며 실제 코드와 세부 구현, 재현 가능한 시험 결과는 공개되지 않았다.

커서는 앞서 2025년 8월 공개한 MXFP8 커널 글에서 블랙웰 GPU용 전문가 혼합형 레이어를 커널 수준에서 다시 작성해 해당 레이어 성능을 3.5배, 전체 학습 속도를 1.5배 높였다고 밝혔다. 당시 전문가 혼합형 레이어는 순전파 시간의 53%, 역전파 시간의 27%를 차지했다.

커서는 Composer 2 기술 보고서에서도 블랙웰 GPU 기반 저정밀 커널과 비동기 강화학습 파이프라인, 대규모 샌드박스 실행 환경을 훈련 인프라의 핵심 요소로 제시했다. warp decode 기술 글에서는 전문가 혼합형 추론 경로를 재구성해 블랙웰에서 처리량을 1.84배 높였다고 설명했다.

이번 기술은 특정 토큰이나 블록체인 사건과 직접 관련되지 않는다. 다만 AI 에이전트와 코드 자동화 도구를 활용하는 블록체인 기업에는 학습 인프라의 비용과 성능을 좌우하는 기술적 요소가 될 수 있다.

반도체 측면에서는 대규모 고성능 GPU 클러스터가 핵심 기반이다. 엔비디아는 GB300 NVL72가 블랙웰 울트라 GPU 72개와 Grace CPU 36개를 하나의 랙스케일 플랫폼으로 통합한다고 설명했다.

본 기사는 시장 데이터 및 차트 분석을 바탕으로 작성되었으며, 특정 종목에 대한 투자 권유가 아닙니다.
광고문의 기사제보 보도자료

많이 본 기사

alpha icon

지금 꼭 알아야 할 리포트

관련된 다른 기사

댓글

댓글

0

추천

0

스크랩

스크랩

데일리 스탬프

1

말풍선 꼬리

매일 스탬프를 찍을 수 있어요!

등급

StarB

14:16

댓글 0

댓글 문구 추천

좋은기사 감사해요 후속기사 원해요 탁월한 분석이에요

0/1000

댓글 문구 추천

좋은기사 감사해요 후속기사 원해요 탁월한 분석이에요
1