앤트로픽의 고객지원 AI 사례에서 응답 정확도가 78.6%에서 90.5%로 높아지고 건당 비용은 기존의 약 5분의 1로 줄었다.
앤트로픽은 9월 28일 개발자 블로그에서 Claude Code에서 사용할 수 있는 ‘claude-api’ 스킬에 ‘build-eval’과 ‘hillclimb’ 명령을 추가했다고 밝혔다. build-eval은 실제 운영 기록과 고객지원 티켓 등을 바탕으로 평가 세트를 만들고, hillclimb는 평가 결과에 따라 프롬프트와 모델, 매개변수를 한 번에 하나씩 조정한다. 관련 내용은 앤트로픽 공식 개발자 블로그에 공개됐다.
이번 고객지원 평가에는 티켓 44건이 사용됐다. 이 가운데 30건은 조정 과정에 활용됐고, 14건은 최종 검증을 위해 따로 보관됐다.
시작점은 높은 추론 강도의 Opus 4.8이었다. 조정용 티켓에서 의사결정 정확도는 74.4%, 티켓 한 건당 토큰 비용은 4.6센트(약 62원)였다.
Claude는 먼저 프롬프트를 점검해 강제적인 도구 호출 절차와 초안 작성 단계, 서로 충돌하는 규칙을 제거했다. 이후 낮은 추론 강도의 Opus 5.5를 적용하자 정확도는 87.8%로 높아졌고 비용은 건당 1.9센트(약 26원)로 낮아졌다.
Opus 5.5의 입력·출력 토큰 가격은 Opus 4.8보다 20% 낮고, 캐시 읽기 비용은 60% 낮았다. 앤트로픽은 모델 변경과 프롬프트 정리가 비용 절감에 함께 영향을 줬다고 설명했다.
앤트로픽은 더 저렴한 Sonnet 5도 시험했다. 낮은 추론 강도의 Sonnet 5는 정확도 약 88.9%를 기록하면서 비용을 건당 약 1센트(약 14원)로 줄였다.
여기에 문의 분류 규칙과 환불 한도 교차 확인 절차를 프롬프트에 추가하자 조정용 티켓의 정확도는 98.9%까지 올랐다. 별도로 남겨둔 14건의 검증용 티켓에서는 최종 설정이 90.5%를 기록해 기존 설정의 78.6%를 웃돌았다.
hillclimb의 핵심은 변경안을 한 번에 하나만 적용하는 방식이다. 평가 세트를 조정용과 검증용으로 나눈 뒤 조정용 결과만 읽고 수정안을 제시하며, 조정용 점수만 오르고 검증용 점수가 그대로면 과적합으로 보고 변경을 되돌린다.
과적합은 평가 데이터에서는 성능이 높아졌지만 실제 환경에서는 개선 효과가 나타나지 않는 현상이다. 앤트로픽은 예시로 평가 항목에 이미지 속 글자 인식이 포함됐을 때 조정 과정에서 OCR 도구를 추가할 수 있지만, 실제 사용 환경에서는 도움이 되지 않을 수 있다고 설명했다.
build-eval은 운영 환경의 대화 기록을 우선 검토한다. 이후 오류 보고와 고객지원 티켓, 개발자가 직접 작성한 5~10개 사례, 코드에서 합성한 사례 순으로 입력값을 구성하고, 개발자가 각 입력값을 확인한 뒤 평가에 반영한다.
채점은 출력 형식이 정해져 있으면 가능한 한 저렴한 코드 기반 방식을 사용한다. 자유 서술형 결과는 별도 모델을 평가자로 활용하며, 평가 대상 모델과 같은 모델을 평가자로 쓰지 않는 방식을 제시했다.
앤트로픽은 좋은 평가가 실제 운영 환경을 반영해야 하고, 더 강한 모델과 높은 추론 강도에서 점수가 높아야 한다고 밝혔다. 최상위 모델도 100%에 이르지 않아야 하며 반복 실행 때 점수 변동이 작아야 한다는 조건도 제시했다.
특정 모델이 실패한 문제만 모아 평가하면 애플리케이션의 실제 난도보다 해당 모델의 약점만 측정할 수 있다. 앤트로픽은 이런 편향을 줄이기 위해 운영 데이터와 오류 사례를 함께 활용해야 한다고 설명했다.
앤트로픽은 같은 방식을 claude-api 스킬 자체에도 적용했다. 해당 평가의 통과율은 66%에서 약 88%로 높아졌고, 이 과정에서 누락된 기능과 프로그래밍 언어별 문서 오류, 문제와 채점 기준이 맞지 않는 사례를 찾아 수정했다.
이번 업데이트는 모델 선택과 프롬프트 조정을 별도 작업으로 나누지 않고 반복 가능한 평가 절차로 묶었다는 데 의미가 있다. 다만 이번 수치는 앤트로픽의 내부 고객지원 사례에서 나온 결과로, 다른 서비스에서도 같은 개선이 나타나는지는 평가 데이터와 채점 방식에 따라 달라질 수 있다.

이준한 기자
댓글0
첫 댓글을 남겨 보세요.