TOKENPOST

퍼플렉시티 도구 호출 실패율 21.2% 낮췄다

토포AI로 이 기사 더 깊이 읽기

도구 호출 오류를 다시 실행하는 손과 노트북 / TokenPost.ai

퍼플렉시티가 실제 사용자 세션에서 발생한 오류와 사용자 수정 내용을 모델 학습에 반영해 도구 호출 실패율을 2.24%에서 1.77%로 낮췄다. 상대 감소율은 21.2%다.

퍼플렉시티는 21일 연구 블로그 ‘Learning from Real-World Mistakes’에서 두 후속 학습 체크포인트를 비교한 온라인 A/B 테스트 결과를 공개했다. 이번 수치는 기초 모델인 GLM 5.2와 후속 체크포인트를 직접 비교한 결과는 아니다.

이번 학습 방식은 성공한 세션만 골라 모방하도록 학습하는 거부 샘플링 미세조정(RFT)의 한계를 보완하는 데 초점을 맞췄다. 성공한 세션에서는 유효한 행동을 학습하고, 실패한 세션에서는 사용자 수정과 도구 오류를 바탕으로 교정이 필요한 지점을 추출했다.

교정 단계에는 온폴리시 자기 증류(OPSD)가 적용됐다. 같은 모델이 교사와 학생 역할을 맡고, 교사 모델에만 오류 원인을 설명하는 짧은 힌트를 제공한다. 학생 모델은 힌트를 보지 않은 채 교사 모델의 다음 토큰 예측을 학습한다.

퍼플렉시티는 도구 오류가 표시된 985개 세션을 별도로 재생성한 실험도 제시했다. 힌트를 제공했을 때 기존 오류를 피한 비율은 75.1%에서 93.7%로 올랐고, 수정된 행동을 실제로 수행한 비율은 60.6%에서 82.3%로 상승했다.

다만 이 실험은 오류를 피하는 능력을 측정한 결과다. 오류 회피가 곧 도구 호출 성공이나 전체 작업 성공을 의미하지는 않는다.

오프라인 평가에서는 기본 GLM 5.2의 도구 오류율이 2.79%, RFT 전용 체크포인트가 1.35%, RFT와 OPSD를 함께 적용한 체크포인트가 0.87%로 집계됐다. 퍼플렉시티는 각 체크포인트의 학습 데이터가 달라 OPSD만을 통제한 실험은 아니라고 밝혔다.

작업 단위 성능도 모든 항목에서 일관되게 개선되지는 않았다. 따라서 오프라인 수치만으로 OPSD가 도구 오류율을 낮춘 효과를 독립적으로 확정하기는 어렵다.

온라인 실험은 두 차례 진행됐다. 첫 번째 실험에서 초기 RFT·OPSD 체크포인트의 도구 실패율은 2.82%로 GLM 5.2의 2.94%보다 낮았지만 통계적으로 유의미한 차이는 아니었다.

이후 두 RFT·OPSD 체크포인트를 비교한 실험에서만 2.24%에서 1.77%로 유의미한 감소가 확인됐다. 후속 체크포인트와 GLM 5.2를 직접 비교한 결과는 공개되지 않았다.

사용자 만족도 개선도 통계적으로 확인되지 않았다. 후속 실험에서 중간 이상 수준의 불만족 확률은 이전 체크포인트의 2.58%에서 이후 체크포인트의 2.54%로 낮아졌지만, 차이는 유의미하지 않았다.

관련 연구인 DART-SD 논문도 다중 단계 도구 호출 과정에서 이미 올바르게 수행한 부분까지 전체적으로 다시 학습하면 유효한 탐색 행동이 훼손될 수 있다고 지적했다. 이 논문은 오류가 시작된 임계 지점 이후의 회복 단계만 선택적으로 학습하는 방식을 제안했지만, 퍼플렉시티의 실험과 동일한 방법이나 모델을 사용한 것은 아니다.

AI 에이전트는 검색, 검색 결과 해석, 외부 API 호출처럼 여러 도구를 연속적으로 사용한다. 이 과정에서 잘못된 형식의 요청이나 도구 응답에 대한 오해가 발생하면 최종 답변의 오류로 이어질 수 있고, 불필요한 도구 호출은 계산 비용과 응답 지연을 키울 수 있다.

이런 구조에서는 에이전트가 모든 도구를 한꺼번에 불러오기보다 필요한 도구를 찾아 호출하는 방식도 중요하다. 앞서 AI 에이전트가 필요한 도구만 불러오는 방식이 소개된 것처럼, 도구 연결과 오류 회복은 모델의 답변 능력과 별도로 관리해야 할 과제가 됐다.

레딧 퍼플렉시티 커뮤니티에서는 일부 사용자가 장시간 검색 뒤 도구 호출이 중단되거나 오류가 발생한다고 보고했다. 이는 개별 이용자 경험으로, 퍼플렉시티가 공개한 전체 사용자 집단의 통계와 직접 연결되는 결과는 아니다.

이번 결과는 AI 에이전트 학습에서 최종 답변의 성공 여부뿐 아니라 검색과 외부 도구 호출 과정에서 발생한 오류까지 학습 신호로 활용할 수 있음을 보여준다. 다만 공개된 수치는 도구 호출 신뢰성 개선을 뒷받침할 뿐, 사용자 만족도나 전체 작업 성공률이 함께 개선됐다는 근거로 확대 해석하기는 어렵다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.