TOKENPOST

LLM 요청 61억건 공개…캐시·라우팅 연구 활용

토포AI로 이 기사 더 깊이 읽기

LLM 요청 데이터를 살피는 노트북과 저장장치 / TokenPost.ai

Chutes와 하버드 연구진이 대규모 언어 모델(LLM) 요청 61억2241만3756건을 담은 공개 데이터셋을 내놨다. 실제 대화 내용이 아닌 서빙 메타데이터를 공개해 생성형 AI 인프라의 캐시와 라우팅 구조를 분석할 수 있도록 한 자료다.

연구 논문 ‘A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing’은 2025년 4월 11일부터 2026년 4월 12일까지 Chutes에서 발생한 요청을 분석했다. 데이터에는 9174개 모델과 익명화된 사용자 31만4970명의 요청 기록이 포함됐다.

공개 저장소에는 요청 시각, 모델·사용자·서빙 인스턴스 식별자, 입력·출력 토큰 수, 첫 토큰 생성 시간(TTFT), 캐시된 토큰 수가 담겼다. 데이터셋은 공개 저장소에서 Parquet 형식으로 제공된다.

전체 파일 규모는 약 91GB이며 각 행은 API 호출 1건을 나타낸다. 사용자 식별자는 3개월마다 재익명화됐고, 프롬프트와 모델의 실제 응답은 공개 대상에서 제외됐다.

연구진이 주목한 대목은 반복 요청의 시간적 집중도다. 동일 사용자가 같은 모델에 다시 보낸 요청의 99%가 이전 요청 후 15분 안에 발생했다.

짧은 시간에 같은 사용자의 요청이 이어지면 앞선 입력의 일부를 다시 활용하는 접두사 캐시(prefix cache)의 효과를 높일 수 있다. 접두사 캐시는 이미 처리한 입력을 저장해 프리필 연산을 줄이고 첫 토큰 생성 시간을 낮추는 기술이다.

캐시 효율과 부하 분산은 같은 방향으로 움직이지 않는다. 관련 요청을 같은 GPU 인스턴스로 보내면 캐시 재사용률을 높일 수 있지만 특정 인스턴스에 요청이 몰릴 수 있고, 여러 인스턴스로 분산하면 부하는 고르게 나뉘지만 같은 캐시 상태가 여러 곳에 복제될 수 있다.

연구진은 캐시 인식형 라우팅이 토큰 적중률을 높이는 대신 일정 수준의 부하 불균형을 감수해야 하는 구조를 제시했다. 라우팅은 요청을 어떤 모델과 서빙 인스턴스에 보낼지 결정하는 과정으로, 캐시 재사용과 GPU 자원 배분을 함께 고려해야 한다.

LLM 사용 형태가 바뀌고 있다는 단서도 나왔다. 데이터 기간 동안 입력 길이는 대체로 안정적이었지만 출력 길이의 중앙값은 수백 토큰에서 100토큰 미만으로 낮아졌다.

연구진은 긴 답변을 주고받는 대화형 사용보다 짧고 반복적인 자동 요청이 늘었을 가능성을 제시했다. 다만 기록만으로 각 요청의 주체를 사람과 소프트웨어로 완전히 구분할 수는 없다고 설명했다.

모델별 이용 비중도 고정되지 않았다. 초기에는 DeepSeek 계열 모델이 트래픽을 주도했지만 이후 Qwen3-32B와 DeepSeek-V3.2 등으로 사용 비중이 이동했고, 비주류 모델의 트래픽 비중도 커졌다.

연구진은 특정 시점의 관측만으로 장기적인 GPU 용량이나 모델 수요를 추정하기 어렵다고 지적했다. 한 플랫폼에서 관측된 사용량 변화가 전체 LLM 서비스 시장의 수요 변화와 같다고 보기는 어렵다는 의미다.

이번 데이터셋은 Chutes가 Bittensor 서브넷 64에서 운영되는 분산형 AI 추론 인프라라는 점에서도 의미가 있다. 분산형 추론 플랫폼은 여러 인스턴스에 요청을 나눠 처리하며, 이번 자료는 실제 운영 환경에서 축적한 요청 흐름을 연구 대상으로 삼았다.

다만 데이터는 단일 분산형 추론 플랫폼에서 수집됐다. 따라서 전체 LLM 시장이나 국내 AI 서비스 이용 행태를 그대로 대표하지 않으며, 이번 공개가 Bittensor의 TAO 가격이나 토큰 수요에 미친 직접적인 영향도 제시되지 않았다.

이번 자료의 활용 범위는 AI 모델 운용 효율과 인프라 설계 연구에 맞춰져 있다. 캐시 재사용률과 GPU 부하 분산 사이의 관계를 실제 요청 기록으로 분석할 수 있다는 점이 핵심이다.

연구진은 요청 패턴과 모델 이용 변화, 서빙 지연시간을 함께 분석할 수 있는 자료를 공개했다. 프롬프트와 응답을 제외한 구조인 만큼 이용자 대화 자체보다 LLM 서비스 운영 방식과 인프라 자원 배분을 살피는 데 초점이 맞춰졌다.

자주 묻는 질문

Q. 이 데이터셋에 실제 이용자 대화 내용이 포함됐나요?

아닙니다. 프롬프트와 모델 응답은 포함되지 않았고 요청 시간, 토큰 수, 지연시간, 캐시 관련 정보 등 서빙 메타데이터만 공개됐습니다.

Q. 99%는 무엇을 의미하나요?

동일 사용자가 같은 모델에 반복 요청한 경우, 그 요청의 99%가 이전 요청 후 15분 안에 발생했다는 연구 결과입니다.

Q. Bittensor와 직접 관련이 있나요?

Chutes는 Bittensor 서브넷 64에서 운영되는 추론 플랫폼입니다. 다만 이번 데이터셋 공개가 TAO 가격이나 토큰 수요에 미친 직접적인 영향은 확인되지 않았습니다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.