ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Microsoft-Decision-1 출시: 긴 글 대신 선택지 채점에 특화한 모델

Microsoft-Decision-1 출시: 긴 글 대신 선택지 채점에 특화한 모델

AI 정보 • Admin • • 31 회 조회

Microsoft-Decision-1은 2026년 10월 9일 마이크로소프트가 공식 블로그를 통해 공개했으며, 현재 Microsoft Foundry에서 사용할 수 있고 곧 OpenRouter에도 제공될 예정이다. 긴 글을 쓰지도, 개방형 추론을 하지도 않는다. 고정된 선택지 집합의 각 항목에 보정된 확률 점수를 매기는 일에만 집중해, 소프트웨어가 점수를 받자마자 다음 동작을 실행할 수 있게 한다.

범용 대형 모델과는 맡은 일이 다르다

Microsoft-Decision-1은 Qwen3.5-9B를 후훈련해 빠른 단일 패스 의사결정 채점에 특화한 모델로, 마이크로소프트는 앞으로 자사 MAI 모델과 OpenAI 모델로 기반을 옮길 계획이다. 예/아니오, 객관식, 척도 평가를 지원하고, 루브릭에 따라 AI 응답과 에이전트 행동을 채점할 수도 있으며, 모두 단순한 구조화 API로 호출한다. 왜 '판단'만을 위한 모델을 따로 만들었을까. 이유는 실무적이다. 워크플로 단계마다 판단이 지연을 쌓는데, 순차 판단 20번에 각각 100밀리초가 더해지면 전체가 2초 늘어난다. 범용 모델이 판단 하나하나를 길게 생각하게 하는 방식은 규모가 커지면 속도와 비용 모두 버티기 어렵다.

먼저 볼 두 가지 숫자: 지연과 안정성

훈련에서 제외된 36개 벤치마크, 약 15만 개 문항(라우팅, 순위, 긴 문맥, 다국어, 안전 등)에서 Microsoft-Decision-1은 마이크로소프트 자체 측정 기준 최고 정확도를 기록했다. P50 지연은 GPT-6 Sol보다 약 35배, 2위인 Quyet-1.0-Large보다 4.5배 빨랐다. 안정성도 별도로 측정했다. 같은 요청에 표현 바꾸기, 순서 변경, 키 변경, 서식 노이즈 등 여덟 가지 변형을 가했을 때 판단이 뒤집힌 비율은 평균 1.3%였고, 선택지 설명을 바꾸거나 순서를 뒤집었을 때는 뒤집힘이 없었다. 확률 자체가 API 출력의 일부다. 90%라고 하면 대표 표본에서 대략 열 번 중 아홉 번 맞아야, 애플리케이션이 자동 실행할지, 미룰지, 사람 검토로 보낼지를 결정할 수 있다. 안전성 측면에서는 유해 콘텐츠, 탈옥, 프롬프트 인젝션을 다루는 11개 벤치마크 5,250개 요청으로 검증했고, 유해 행위를 거부하면서도 유용성을 높게 유지했다고 밝혔다.

마이크로소프트 내부에서 이미 쓰는 곳

Xbox 연구팀은 1만 건이 넘는 플레이어 피드백을 고정 주제로 분류하는 데 사용해 GPT-6 Sol과 동등한 품질을 14배 이상 빠른 속도, 약 200분의 1 비용으로 얻었다. Copilot 팀은 채팅과 에이전트 응답 품질 평가에 사용하며 GPT-5.6 Luna와 경쟁하는 품질을 100배 속도로 얻었다고 보고했다. 당직 엔지니어는 장애 대응 시 지식 검색에, Microsoft Discovery는 실험 계획 채점과 적응형 재계획에 사용해 대형 모델 채점보다 일관성이 46배 높고 전체 루프가 약 4배 빨라졌다고 한다. 이 노선이 마이크로소프트만의 것은 아니다. OpenAI도 같은 종류의 판단을 이미 인터페이스로 만들었고, 이 사이트에서 Decisions API 공개 베타로 다룬 바 있다. 차이는 마이크로소프트가 판단을 대형 모델의 한 모드가 아닌 독립 모델로 만들었다는 점이다.

가격은 입력 100만 토큰당 0.042달러, 출력은 무료다. 선택지가 이미 정해진 판단, 즉 모델 라우팅, 분류, 우선순위 지정, 검증, 워크플로 제어, 에이전트의 다음 행동 점검에 적합하다. 선택지가 없는 개방형 질문에는 맞지 않는다. 구조화된 판단을 대량으로 처리하는 팀이라면 도입 전에 실제 데이터로 두 가지를 먼저 확인하는 것이 좋다. 표현을 바꿔도 판단이 흔들리지 않는지, 그리고 제시된 확률이 실제 정확도와 맞는지를 보는 것이다. 순위표 순서는 그다음이다.

추천 도구

더보기