장기 작업을 수행하는 인공지능(AI) 에이전트의 Terminal-Bench 2.0 성능이 필요한 순간에만 기억을 주입하는 구조를 적용한 실험에서 8.3%포인트 개선됐다. 별도 메모리 에이전트가 작업 중 핵심 정보를 관리하다가 행동 에이전트가 경로를 이탈하거나 실수를 반복할 가능성이 있을 때만 개입하는 방식이다.
논문 ‘Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents’는 행동 에이전트와 별도로 작동하는 메모리 에이전트를 제안했다. 메모리 에이전트는 최근 작업 기록을 검토해 요구사항, 환경 정보, 과거 실패, 현재 진행 상태를 구조화된 메모리 뱅크에 정리한다.
연구진은 장기 작업에서 결정에 필요한 정보가 대화 기록에 남아 있어도 이후 행동을 충분히 통제하지 못하는 현상을 ‘behavioral state decay’라고 설명했다. 이번 연구는 정보를 많이 저장하는 것보다 행동에 다시 개입할 시점을 판단하는 데 초점을 맞췄다.
Claude Sonnet 4.5를 행동 에이전트로 사용한 실험에서 Terminal-Bench 2.0 pass@1은 37.6%에서 45.9%로 8.3%포인트 상승했다. τ²-Bench task-weighted 평균도 55.0%에서 61.8%로 6.8%포인트 개선됐다.
Claude Opus 4.6을 사용한 실험에서도 Terminal-Bench 2.0은 43.5%에서 45.9%로 높아졌다. τ²-Bench는 66.2%에서 68.7%로 상승했다.
Terminal-Bench 2.0 결과는 전체 89개 과제 가운데 양쪽 평가가 유효했던 85개 과제를 기준으로 계산됐다. 연구진이 제시한 성능 수치는 이들 두 벤치마크 실험에 한정된다.
핵심은 메모리를 모든 단계에서 노출하지 않는 데 있다. 메모리 에이전트는 안정적인 사실과 요구사항, 과거 시도와 실패, 현재 진행 상태를 관리한 뒤 행동 에이전트가 정상적으로 작동할 때는 개입하지 않는다.
행동 에이전트가 경로를 이탈하거나 같은 실수를 반복할 가능성이 있을 때만 짧은 알림을 보낸다. 연구진은 전체 메모리를 매번 노출하거나 모든 단계에서 알림을 보내는 방식보다 선택적 개입이 효과적이었다고 밝혔다.
기존 AI 에이전트의 메모리 방식은 정보를 저장하거나 사용자의 요청에 따라 검색하는 데 집중하는 경우가 많았다. 이번 연구는 기존 행동 모델을 수정하지 않고 별도 메모리 에이전트를 추가할 수 있다는 점을 특징으로 내세웠다.
장기 실행형 AI 에이전트가 이메일 발송, 일정 관리, 여행 예약처럼 여러 단계를 거치는 작업으로 확장되는 가운데 나온 연구라는 점도 눈에 띈다. 메타(Meta)는 9월 8일 개인형 AI 에이전트 Muse를 공개했다.
Muse는 전용 가상머신에서 브라우저와 연결 애플리케이션을 사용해 여러 단계의 작업을 수행하도록 설계됐다. 메타는 Muse가 사용자의 목표를 바탕으로 계획을 세우고 작업을 이어간다고 설명했다.
Muse의 외부 서비스 접근은 별도 Sentinel 시스템이 승인하거나 거부하며, 필요할 경우 사용자 확인을 요청한다. 메타는 Muse의 비밀번호와 인증정보가 에이전트에 직접 노출되지 않는다고 설명했다.
다만 메타의 공식 Muse 발표문과 안전성 문서에는 Muse가 이번 논문의 Proactive Memory Agent를 사용한다는 내용이 없다. Crypto Briefing은 두 기술의 연계를 언급했지만, 공식 자료에서 직접적인 통합이 확인된 것은 아니다.
AI 에이전트의 장기 기억을 검증하고 관리하는 연구는 앞서 마이크로소프트가 AI 기억 검증 후 통과율을 39%에서 73%로 높였다고 소개한 사례에서도 제시됐다. 이번 논문은 기억을 저장하기 전 검증하는 방식보다, 작업 중 개입 시점을 선택하는 구조에 무게를 둔다.
이번 논문과 Muse에서 가상자산 지갑 관리나 온체인 자동화 적용 사례는 제시되지 않았다. 연구 성과가 실제 상용 서비스에서 같은 수준으로 재현되는지는 추가 검증이 필요하다.

김미래 기자
댓글0
첫 댓글을 남겨 보세요.