대규모 언어 모델(LLM)이 텍스트 대신 내부 상태인 KV-캐시를 직접 주고받는 통신 기술이 공개됐다. 칭화대 연구진은 이 방식으로 모델 간 평균 통신 지연시간을 기존 텍스트 기반 방식보다 2.5배 단축했다고 밝혔다.
연구진이 제안한 ‘Cache-to-Cache(C2C)’는 한 모델의 KV-캐시를 다른 모델의 표현 공간으로 변환한 뒤 결합하는 구조다. 관련 논문은 2025년 10월 3일 처음 공개됐고 2026년 3월 2일 수정됐으며, 국제학습표현학회(ICLR) 2026 논문으로 등재됐다.
기존 다중 LLM 시스템에서는 한 모델이 분석 결과를 텍스트로 생성한 뒤 다른 모델이 이를 다시 읽는다. 이 과정에서 모델 내부의 고차원 정보가 문장으로 압축되고, 토큰을 순차적으로 생성하면서 추가 지연이 발생한다.
C2C는 정보를 제공하는 ‘Sharer’ 모델의 KV-캐시를 신경망 기반 ‘Cache Fuser’로 투영해 ‘Receiver’ 모델의 캐시에 결합한다. 학습 가능한 게이트는 Receiver의 어느 계층에 정보를 전달할지 선택한다.
KV-캐시는 모델이 이전 입력을 처리하며 축적한 키와 값 형태의 내부 상태다. 문맥이 길어질수록 캐시가 커져 추론 속도와 메모리 사용량에 영향을 줄 수 있으며, 장문 추론 인프라의 주요 요소로 다뤄지고 있다.
연구진은 Qwen2.5·Qwen3·Llama3.2·Gemma3 등 여러 모델 계열을 대상으로 실험했다. 모델 규모는 0.6B부터 14B까지였고 OpenBookQA, MMLU-Redux, ARC-Challenge, C-Eval 등 벤치마크가 사용됐다.
실험에서 C2C의 평균 정확도는 단일 모델보다 6.4~14.2% 높았다. 텍스트 기반 모델 통신과 비교해도 정확도가 3.1~5.4% 개선됐다.
평균 지연시간은 텍스트 통신보다 2.5배 단축됐다. 연구진은 중간 설명문을 생성하지 않고 모델 내부 표현을 직접 옮기는 구조가 정보 손실과 순차적 생성 지연을 줄였다고 설명했다.
◇ 모델 내부 상태를 직접 전달
논문은 KV-캐시가 단순한 계산용 임시 저장공간을 넘어 모델 간 의미 전달 수단이 될 수 있다고 설명했다. 같은 입력을 처리하더라도 모델마다 축적하는 문맥과 지식의 표현이 다르기 때문에, 이를 결합하면 단일 모델이 놓친 정보를 보완할 수 있다는 취지다.
다만 성능 개선이 모든 상황에서 보장되는 것은 아니다. 연구진은 Sharer 모델이 잘못된 정보를 전달하면 Receiver가 단독으로 맞힐 수 있었던 문제를 오히려 틀릴 수 있다고 밝혔고, 강한 Receiver에 약한 Sharer를 연결할 때 이런 실패가 나타날 가능성이 커진다고 분석했다.
확장성도 과제로 남았다. 현재 C2C는 모델 조합별로 프로젝터와 퓨저를 학습하는 pairwise 구조를 중심으로 설계됐으며, 여러 모델이 동시에 통신하려면 공통 잠재공간을 두는 방식이 필요하다.
다수 모델을 위한 통합 잠재공간 방식은 제안됐지만 논문에서는 초기 실험 단계의 접근법으로 설명됐다. 모델 조합이 늘어날수록 퓨저 학습 비용과 통신 과정에서 발생하는 오류를 함께 관리해야 한다.
실험 결과는 단일 NVIDIA A100 GPU와 제한된 응답 길이, 연구진이 정한 모델 조합에서 측정됐다. 따라서 실제 서비스 환경의 비용·처리량·보안성·오류 전파 수준으로 일반화하려면 추가 검증이 필요하다.
공식 코드는 GitHub 저장소에 Apache-2.0 라이선스로 공개됐다. 저장소에는 일부 모델 조합에 사용할 수 있는 사전 학습 퓨저와 학습·평가 예제가 포함됐지만, C2C가 모든 모델 조합에 즉시 적용되는 범용 통신 표준으로 공개된 것은 아니다.
이번 연구는 중국 연구진이 AI 모델 간 통신 구조를 바꾸는 방법을 제시했다는 데 의미가 있다. 다만 확인된 연구 범위에서는 상용 서비스 도입이나 가상자산·블록체인·반도체 산업과의 직접적인 연결은 제시되지 않았다.

강이안 기자
댓글0
첫 댓글을 남겨 보세요.