Strands Decider 2B は 2026 年 10 月 7 日、Strands Agents チームによってオープンソースで公開された。文章を書くことも、雑談をすることもない。やることは一つだけ。与えられた選択肢の中から一つを選び、どれくらい確信があるかを示すことだ。20 億パラメータ、ローカルで数十ミリ秒級の応答、重みも学習データも全面公開というこの種の小さな意思決定モデルが、エージェントのワークフローの中で、かつて大規模モデルが担っていた領域を切り取り始めている。
通常の大規模モデルと何が違うのか
通常の大規模モデルはテキストを 1 トークンずつ生成して答えるため、答えの範囲に境界がない。意思決定モデルは逆で、まず候補となる選択肢を固定し、1 回の並列計算で全選択肢にスコアを付け、選んだものとスコアだけを返す。代償は明確だ。テキストは生成できず、複雑な推論は推論モデルに大きく劣り、コーディングや要約、対話には使えない。代わりに得られるものも明確で、答えは必ず選択肢の中に収まり、高速で、しかも各判断に校正済みの信頼度スコアが付く。このスコアは判断が正しい確率の目安であり、フロンティアモデルの API が通常は直接出さない情報だ。
引き算で作られたアーキテクチャ
Strands Decider 2B は Qwen3.5-2B を胴体とし、テキスト生成を担う言語モデルヘッドを取り除き、100 万パラメータ強のポインタヘッドに置き換えた。このヘッドは、各選択肢の位置における内部状態と、回答マーカー位置の状態を照合してスコアを付ける。胴体自体はランク 16 の LoRA アダプタで微調整されている。チームによれば今回の公開は 19 番目のイテレーションで、リポジトリには各版の変更内容が記録され、初期の性能が明確に劣ったスロットヘッド方式をなぜ捨てたかも書かれている。
成績と速度
公開ベンチマーク JevBench では、2B 級 33 モデルの中で 3 位、2B をわずかに超えるモデルを除けば 30 モデル中 1 位だった。校正の質は Brier スコアで測られ、正解率と並んで公開されている。遅延はローカルの RTX 3090 で中央値約 115 ミリ秒、M3 MacBook の小タスクで中央値約 153 ミリ秒で、タスク量に応じてほぼ線形に増える。ツール呼び出しのたびに判断が必要なワークフローでは、この桁の遅延なら呼び出し経路の中に実際に入れ込むことができ、小さな判断のたびに大規模モデルの推論費用を払わずに済む。
エージェントの中で実際に何をするのか
想定用途として挙がっているのは、モデルルーティング、ツール選択、自動評価、ガードレール、メモリ管理、コンテキスト管理、ポリシー分類などだ。同梱のサンプルが使い方をよく示している。ユーザーが都市名を言っていないのに天気ツールを急いで呼ぼうとするエージェントに対し、Decider はツール実行前に二つの是非を答える。引数の値はユーザーが実際に言ったことに根拠があるか、今呼ぶのは早すぎないか、だ。数行のコードがその答えを、実行、拒否、人への確認、フィードバック付きでモデルへの差し戻し、のいずれかに変換する。より大きな構図はハイブリッド分業で、最も難しい判断は大規模モデルに残し、反復的で範囲の明確な小さな判断は意思決定モデルに任せ、コストと遅延を一緒に下げる。
エージェントを作るチームにとって、今回の公開が示すのは分業の細分化だ。すべての判断にフロンティアモデルが必要なわけではない。境界もはっきりしている。選択肢は人か上位システムが先に定義しなければならず、Decider は選ぶだけだ。選択肢自体が間違っていれば、正確に選んでも意味がない。pip install strands-decider でローカル試用でき、重みは Hugging Face で公開され、学習データとスクリプトも揃っているため、自前の小さな意思決定モデルを訓練したいチームには完全な出発点が用意された形だ。