코인베이스 Qwen, 자사 Onramp 사기 탐지 4개 지표서 Opus 4.5 앞서
토포AI로 이 기사 더 깊이 읽기
코인베이스($COIN)가 자체 사기 데이터로 추가 학습한 인공지능(AI) 모델 Qwen3.5-9B가 자사 Onramp 사기 탐지 벤치마크에서 Opus 4.5보다 네 가지 지표 모두 높은 점수를 기록했다. 성능 비교는 코인베이스의 비공개 평가에 한정된다.
코인베이스는 8일 기술 블로그 ‘Owning Intelligence’ 시리즈에서 Qwen3.5-9B를 Onramp 사기 탐지에 맞춰 사후 학습했다고 밝혔다. 회사 벤치마크에서 정밀도는 7.5%포인트, 재현율은 12.0%포인트, F1 점수는 9.6%포인트, 사기 금액 가중 재현율은 35.4%포인트 높았다. 각 수치는 상대 증가율이 아닌 퍼센트포인트 차이다.
Onramp는 이용자가 법정화폐로 가상자산을 구매하는 서비스다. 코인베이스가 공개한 구조에서 AI 에이전트는 기존 머신러닝 모델과 규칙을 통과한 거래의 위험을 추가로 분류하고 등급을 반환한다. 최종 거래 판단은 에이전트가 아니라 기존 시스템이 맡는다.
Qwen3.5-9B는 90억 매개변수의 오픈웨이트 모델이다. 코인베이스는 자체 사기 데이터와 결과 기반 보상 기법인 RLVR(Reinforcement Learning with Verifiable Rewards)을 적용해 모델을 학습했다. 작업에는 SkyRL·Anyscale 환경과 LoRA 방식이 사용됐다.
코인베이스는 단일 NVIDIA RTX PRO 6000 96GB GPU에서 학습 비용이 100달러 미만이었다고 밝혔다. 이 금액에 데이터 준비와 엔지니어링, 운영 및 재학습 비용까지 포함됐는지는 공개하지 않았다.
온라인 추론 지연시간 비교에서 Qwen의 중앙값(P50)은 0.683초, Opus 4.5는 1.515초였다. 99번째 백분위(P99) 지연시간은 각각 1.036초와 3.312초였다. 코인베이스는 지연시간과 탐지 성능을 별도 평가에서 측정했다고 밝혔다.
이번 결과는 앞선 온라인 A/B 실험과 구분된다. 코인베이스는 기존 머신러닝 모델과 규칙에 LLM 위험 평가 에이전트를 추가한 실험에서 사기 거래 건수는 30%, 사기 금액은 22% 감소했다고 공개했다. 이 수치는 해당 에이전트 적용 실험의 결과로, Qwen3.5-9B 단독 성과를 뜻하지 않는다.
벤치마크와 거래 데이터는 공개되지 않아 외부에서 같은 조건으로 결과를 재현하기 어렵다. 따라서 이번 비교는 Onramp의 특정 사기 분류 과제와 코인베이스의 평가 기준에서 나온 결과로 한정된다. 코인베이스의 AI 에이전트가 거래와 금융 워크플로를 지원하는 기능은 그록에서 이용할 수 있게 됐다는 본지 보도에서도 다룬 바 있다.

강이안 기자 




댓글 0
불러오는 중…