ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Strands Decider 2B 오픈소스 공개: 선택에만 답하는 2B 모델, 밀리초 단위로 확신 점수까지

Strands Decider 2B 오픈소스 공개: 선택에만 답하는 2B 모델, 밀리초 단위로 확신 점수까지

AI 정보 • Admin • • 5 회 조회

Strands Decider 2B는 2026년 10월 7일 Strands Agents 팀이 오픈소스로 공개했다. 글을 쓰지도, 대화를 나누지도 않는다. 하는 일은 하나뿐이다. 주어진 선택지 중 하나를 고르고, 얼마나 확신하는지 보여주는 것이다. 20억 파라미터, 로컬에서 수십 밀리초 수준의 지연, 가중치와 학습 데이터 전면 공개라는 이 작은 의사결정 모델 부류가 에이전트 워크플로 안에서 원래 대형 모델의 몫이던 영역을 가져가기 시작했다.

일반 대형 모델과 무엇이 다른가

일반 대형 모델은 텍스트를 토큰 단위로 생성해 답하므로 답의 범위에 경계가 없다. 의사결정 모델은 반대다. 후보 선택지를 먼저 고정하고, 한 번의 병렬 연산으로 모든 선택지에 점수를 매긴 뒤, 선택과 점수만 돌려준다. 대가는 분명하다. 텍스트를 생성할 수 없고, 복잡한 추론은 추론 모델보다 확연히 약하며, 코딩·요약·대화에는 쓸 수 없다. 대신 얻는 것도 분명하다. 답은 항상 주어진 선택지 안에 있고, 빠르며, 모든 판단에 보정된 신뢰도 점수가 붙는다. 이 점수는 판단이 맞을 확률을 가늠하는 값이며, 프런티어 모델 API가 보통 직접 제공하지 않는 정보다.

뺄셈으로 만든 아키텍처

Strands Decider 2B는 Qwen3.5-2B를 몸통으로 삼고, 텍스트 생성을 맡는 언어 모델 헤드를 제거한 뒤 100만 개 남짓한 파라미터의 포인터 헤드로 교체했다. 이 헤드는 각 선택지 위치의 내부 상태와 답변 표시 위치의 상태를 대조해 점수를 매긴다. 몸통 자체는 랭크 16 LoRA 어댑터로 미세조정됐다. 팀에 따르면 이번 공개본은 19번째 반복 버전이며, 저장소에는 각 버전에서 무엇이 바뀌었는지, 초기 슬롯 헤드 방식이 왜 버려졌는지도 기록돼 있다.

성적과 속도

공개 벤치마크 JevBench에서 2B급 33개 모델 중 3위를 차지했고, 2B를 살짝 넘는 모델을 제외하면 30개 중 1위였다. 보정 품질은 Brier 점수로 측정돼 정확도와 함께 공개됐다. 지연은 로컬 RTX 3090에서 중앙값 약 115밀리초, M3 MacBook의 작은 작업에서 중앙값 약 153밀리초이며 작업 크기에 따라 대략 선형으로 늘어난다. 도구 호출마다 판단이 필요한 워크플로에서는 이 정도 지연이어야 호출 경로 안에 실제로 넣을 수 있고, 작은 판단마다 대형 모델 추론 비용을 치르지 않아도 된다.

에이전트 안에서 실제로 하는 일

제시된 용도는 모델 라우팅, 도구 선택, 자동 평가, 가드레일, 메모리 관리, 컨텍스트 관리, 정책 분류 등이다. 함께 제공된 예시가 방식을 잘 보여준다. 사용자가 도시를 말하지 않았는데도 날씨 도구를 서둘러 호출하려는 에이전트 앞에서, Decider는 도구 실행 전에 두 가지 예/아니오 질문에 답한다. 인자값이 사용자가 실제로 말한 내용에 근거가 있는지, 지금 호출하는 것이 너무 이른지다. 몇 줄의 코드가 그 답을 진행, 거부, 사람 확인, 피드백과 함께 모델로 되돌리기 중 하나로 바꾼다. 더 큰 그림은 하이브리드 분업이다. 가장 어려운 판단은 대형 모델에 남기고, 반복적이고 범위가 분명한 작은 판단은 의사결정 모델에 맡겨 비용과 지연을 함께 낮추는 것이다.

에이전트를 만드는 팀에게 이번 공개가 주는 신호는 분업의 세분화다. 모든 판단에 프런티어 모델이 필요한 것은 아니다. 경계도 분명하다. 선택지는 사람이나 상위 시스템이 먼저 정의해야 하고, Decider는 고르기만 한다. 선택지 자체가 틀리면 정확히 골라도 소용없다. pip install strands-decider로 로컬에서 써볼 수 있고, 가중치는 Hugging Face에, 학습 데이터와 스크립트도 공개돼 있어, 자체 소형 의사결정 모델을 학습하려는 팀에게 완전한 출발점이 마련됐다.

추천 도구

더보기