AI 모델의 성능 경쟁이 가속화하면서 이를 실제 데이터센터에서 효율적으로 구동할 AI 반도체와 전력 인프라의 중요성이 커지고 있다. 퓨리오사AI는 대규모언어모델(LLM) 시대의 핵심 시장으로 '추론'을 지목하고 고성능·저전력 NPU를 앞세워 AI 인프라 시장 공략에 나서고 있다.
30일 서울 aT센터에서 열린 'GWDC 2026 코리아'에서 정영범 퓨리오사AI 전무(Managing Director)는 '칩에서 시장으로(From Chip to Market)'를 주제로 AI 시장의 변화와 자체 개발 AI 반도체 'RNGD(레니게이드)'의 개발 과정, 성능과 시장 전략을 소개했다.
정 전무는 퓨리오사AI가 2017년 설립된 이후 지금까지 두 종류의 AI 반도체를 개발했다고 설명했다.
1세대에서는 비전 AI 애플리케이션을 효율적으로 구동하는 NPU 개발에 집중했다. 당시 AI 시장이 이미지와 영상 등을 처리하는 비전 AI 중심이었던 만큼 엔비디아 GPU보다 해당 워크로드를 효율적으로 처리하는 NPU를 만드는 것이 목표였다는 설명이다.
시장 변화는 GPT-3 등장과 함께 감지했다.
정 전무는 챗GPT가 등장하기 전 GPT-3가 공개됐을 당시부터 대규모언어모델이 향후 AI 시장의 대세가 될 것으로 판단했다고 밝혔다. 이에 LLM을 효율적으로 처리할 수 있는 2세대 AI 반도체 개발에 착수했다.
2세대 칩 RNGD에는 고대역폭메모리 HBM3를 채택했다. 정 전무는 "앞으로 이런 라지 랭귀지 모델이 대세가 될 것이라고 예측했다"며 HBM3를 활용해 칩을 설계했다고 말했다.
RNGD는 2024년 개발을 완료했으며 올해 양산을 시작해 1월부터 판매에 들어갔다. 2세대 칩은 TSMC의 5나노 공정을 기반으로 제작됐다.
퓨리오사AI가 주목하는 시장은 AI '추론(inference)'이다.
정 전무는 2030년까지 전 세계에 100기가와트(GW) 이상의 데이터센터가 구축되고 이 가운데 약 70%가 AI 추론 용도로 사용될 것으로 전망했다.
AI 모델을 만드는 학습뿐 아니라 이미 만들어진 모델을 실제 서비스에서 지속적으로 실행하는 추론 수요가 빠르게 증가하면서 데이터센터의 컴퓨팅 자원과 전력 효율성이 더욱 중요해질 것이라는 설명이다.
그는 "2030년까지 100기가와트 이상의 데이터센터가 전 세계에서 지어지는데 그중 70%가 인퍼런스용으로 사용될 것"이라고 말했다.

RNGD의 핵심 성능도 공개했다.
정 전무는 NPU와 GPU의 성능을 평가할 때 계산 능력 등 주요 사양을 함께 살펴봐야 한다며 RNGD가 512테라플롭스(TFLOPS)의 연산 성능을 지원한다고 설명했다.
이는 초당 약 512조번의 연산을 처리할 수 있는 수준이다.
다만 퓨리오사AI가 강조하는 경쟁력은 단순한 최대 연산 성능에 그치지 않는다. 실제 데이터센터에서 AI를 운영할 때는 칩의 계산 능력과 함께 전력 소모와 메모리, 실제 애플리케이션에서의 효율성이 중요하다는 설명이다.
특히 AI 데이터센터 확대로 전력 공급이 주요 제약 요인으로 부상하면서 '와트당 성능'이 AI 반도체의 중요한 경쟁 기준이 되고 있다고 강조했다.
정 전무는 RNGD가 엔비디아 GPU와 비교해 높은 전력 효율을 보이고 있다며 "엔비디아 GPU보다 파워 이피션시(power efficiency)하다는 것은 증명이 됐다"고 말했다.
하드웨어 성능만큼 소프트웨어 생태계도 중요하다고 강조했다.
새로운 AI 반도체를 도입하려면 기존 GPU 환경에서 사용하던 AI 모델과 프로그램을 새로운 하드웨어에 맞춰 다시 개발해야 하는 부담이 생길 수 있기 때문이다.
퓨리오사AI는 이를 낮추기 위해 'Furiosa LLM' 소프트웨어를 구축했다.
정 전무는 기존 프로그램에서 Furiosa LLM을 활용할 경우 코드 한 줄 정도를 수정하는 것만으로도 퓨리오사AI NPU에서 AI 모델을 구동할 수 있도록 설계했다고 설명했다.
이는 새로운 NPU를 도입하기 위해 기존 AI 서비스 전체를 다시 개발해야 하는 부담을 줄이고, 기업과 데이터센터가 기존 AI 모델을 상대적으로 쉽게 RNGD 환경으로 이전하도록 하기 위한 전략이다.
정 전무는 AI 반도체 시장이 단순히 더 빠른 칩을 만드는 경쟁에서 실제 데이터센터에서 얼마나 효율적으로 AI 서비스를 운영할 수 있는지를 겨루는 단계로 이동하고 있다고 강조했다.
특히 LLM 활용이 확대될수록 AI 추론에 필요한 컴퓨팅 자원과 전력 수요가 함께 증가하는 만큼 성능과 전력 효율, 메모리 구조, 소프트웨어 호환성을 종합적으로 갖춘 AI 반도체가 중요해질 것으로 전망했다.
퓨리오사AI는 2017년 비전 AI용 NPU 개발에서 출발해 LLM 시장의 성장을 예상하고 2세대 RNGD로 제품 영역을 확장했다. 올해 본격적인 양산과 판매에 들어간 만큼 앞으로는 기술 개발을 넘어 실제 데이터센터와 AI 서비스 시장에서 제품을 확산하는 데 집중한다는 방침이다.
'GWDC 2026 코리아'는 웹3랩스(Web3Labs)와 하이파이랩스가 공동 주최하고 토큰포스트와 테크허브 뉴스가 공동주관하는 글로벌 웹3 개발자 콘퍼런스다. 29~30일 서울 aT센터에서 '빌더를 위한, 빌더에 의한(For Builders, By Builders)'을 주제로 열리며 AI, 블록체인, 디지털자산, RWA, 스테이블코인, 온체인 금융 등 산업 주요 의제를 다룬다.

박아인 기자
댓글0
첫 댓글을 남겨 보세요.