코인베이스 과거 평가서 GPT 재현율 20.7%포인트 하락
토포AI로 이 기사 더 깊이 읽기
코인베이스의 과거 결제 거래 평가에서 오푸스·소넷·GPT 계열 최신 모델은 이전 버전보다 사기 거래와 사기 금액을 덜 포착했다. GPT-5.6 (sol)은 사기로 표시한 거래의 정확도는 높였지만, 전체 사기 거래와 금액을 찾아내는 비율은 낮아졌다.
코인베이스($COIN)는 10월 7일 공개한 자체 평가에서 오푸스 4.5와 오푸스 5, 소넷 4.6과 소넷 5, GPT-5.4와 GPT-5.6 (sol)을 비교했다. 9주간의 거래 기록에서 1만6140건을 추려 재생했으며, 이용자는 7293명, 확인된 사기 거래는 813건이었다. 모델별 위험 판정을 실제 차단 결정으로 바꾸는 기준은 같게 유지했다.
세 계열 최신 모델은 모두 이전 버전보다 재현율과 F1 점수, 달러 가중 재현율이 낮았다. 재현율은 실제 사기 거래 중 모델이 찾아낸 비율이고, 달러 가중 재현율은 확인된 사기 금액 가운데 포착한 금액의 비율이다. F1 점수는 정밀도와 재현율을 함께 반영한다.
GPT-5.6 (sol)의 정밀도는 이전 모델보다 11.5%포인트 높았다. 반면 재현율은 20.7%포인트, 달러 가중 재현율은 21.8%포인트 낮았다. 사기로 표시한 거래의 정확성은 개선됐지만 전체 사기 거래와 피해 금액을 포착하는 범위는 좁아졌다.
오푸스 5와 소넷 5는 네 가지 평가 지표 모두 이전 버전보다 낮았다. 오푸스의 재현율은 0.8%포인트 하락했고, 소넷은 재현율과 달러 가중 재현율이 각각 22.2%포인트, 22.9%포인트 떨어졌다. 코인베이스는 하락 원인이 모델 학습 방식이나 특정 변경 때문인지 확인하지 못했다고 밝혔다.
이번 평가는 실시간 서비스에서 발생한 고객 손실을 측정하지 않았다. 과거 거래를 같은 조건에서 다시 평가해 모델 버전 간 차이를 살핀 시험이다. 기존 사기 방지 체계 전체를 최신 AI 모델로 대체했을 때의 성능도 측정하지 않았다.
코인베이스는 앞선 별도 온라인 실험에서 기존 머신러닝 모델과 규칙에 AI 검토를 추가한 뒤 사기 거래가 30%, 사기 금액이 22% 줄었다고 발표했다. 이는 기존 체계에 AI 검토를 덧붙인 실험으로, 이번 모델 버전 비교와 시험 방식이 다르다. 회사의 앞선 사기 방지 실험과 AI 검토 도입을 설명한 보도도 별도 실험 결과를 다뤘다.
코인베이스는 10월 8일 공개한 별도 평가에서 사기 데이터로 추가 학습한 Qwen3.5-9B가 오푸스 4.5보다 네 가지 탐지 지표에서 높은 결과를 냈다고 밝혔다. F1 점수는 9.6%포인트 높았고, 온라인 추론 지연 시간은 55% 짧았다. 이 결과도 코인베이스 자체 데이터와 별도 평가 설정에 기반한다.
이번 비교는 특정 결제 사기 데이터와 판정 기준에서 모델 버전 교체가 탐지 결과를 바꿀 수 있음을 보여준다. 다른 서비스나 실시간 고객 손실에 같은 결과가 적용되는지는 이 평가만으로 판단할 수 없다.

정민석 기자 




댓글 0
불러오는 중…