마이크로소프트, 선택지별 확률 점수 매기는 AI 공개
토포AI로 이 기사 더 깊이 읽기
마이크로소프트($MSFT)가 정해진 선택지에 점수를 매겨 분류와 우선순위 지정, AI 에이전트 제어에 활용하는 ‘Microsoft-Decision-1’을 공개했다. 장문 답변 대신 판단 결과와 확률을 제공해 반복적인 업무 판단을 자동화하는 모델이다.
마이크로소프트는 2026년 10월 9일 개발자 간행물에서 모델을 소개했다. Microsoft Foundry에서 이용할 수 있고 OpenRouter에도 제공할 예정이라고 밝혔다. 사용자는 선택지를 미리 정하고 점수를 기준으로 다음 단계 진행, 작업 재시도, 사람 검토 요청 등을 결정할 수 있다.
활용 분야로는 요청 분류, 작업 우선순위 지정, AI 응답 검증, 모델 선택, 에이전트 행동 제어가 제시됐다. 예컨대 AI가 만든 답변을 기준표에 따라 평가해 수용·수정·거절 중 하나를 고르거나, 사고 보고를 긴급도에 따라 담당 팀으로 보낼 수 있다.
Microsoft-Decision-1은 알리바바의 Qwen3.5-9B를 기반으로 추가 학습해 한 번의 추론으로 판단 점수를 매기도록 설계됐다. 마이크로소프트는 향후 마이크로소프트 AI와 오픈AI의 다른 모델을 기반으로도 업데이트할 계획이라고 밝혔다.
마이크로소프트가 공개한 성능 수치는 자체 평가 결과다. 회사는 약 15만 개 질문을 포함한 36개 벤치마크에서 모델이 가장 높은 정확도를 기록했고, Quyet-1.0-Large보다 4.5배, GPT-6 Sol보다 35배 빠르게 측정됐다고 밝혔다. 입력 변형에 따른 결정 변화율은 평균 1.3%였으며, 유해 요청과 탈옥 시도, 프롬프트 인젝션을 포함한 11개 벤치마크의 5250개 요청도 평가했다고 설명했다.
내부 시험 사례로는 Xbox Research의 게임 의견 분류가 소개됐다. 설문과 Steam, X에 올라온 게임 관련 의견 1만 건 이상을 주제별로 분류했으며, 마이크로소프트는 GPT-6 Sol과 비슷한 품질을 14배 넘는 속도와 200분의 1 수준의 비용으로 얻었다고 밝혔다.
Copilot 팀의 응답 품질 평가에서는 GPT-5.6 Luna와 경쟁 가능한 결과를 100배 빠르게 냈다고 설명했다. 사고 대응 지식 검색과 과학 연구 워크플로 시험 결과도 공개했으나 모두 회사가 제시한 평가다.
확률 점수는 자동 처리와 사람 검토를 나누는 기준으로 활용할 수 있다. 다만 점수 자체가 판단의 정확성을 보장하지는 않으며, 실제 업무에서는 오판에 따른 재작업과 검토 부담, 운영 비용도 함께 살펴야 한다. 현재 공개된 적용 사례는 마이크로소프트 내부 시험에 집중돼 있다.

서지우 기자 




댓글 0
불러오는 중…