ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
ThinkingBox 公開:エージェントは完了と言い、データベースは否と言った

ThinkingBox 公開:エージェントは完了と言い、データベースは否と言った

AI情報 • Admin • • 9 回閲覧

ThinkingBox は、Microsoft と Hugging Face が 2026 年 10 月 3 日に共同公開したエージェント評価ベンチマークで、エージェントが最後に何と言ったかではなく、データベースに何を残したかだけで採点する。507 件のステートフルな業務ワークフローは、小売、自動車保険、旅行、ネオバンク、コンサルティング支援に各 100 件前後配分され、クリーンなバックエンドから各 20 回実行される。チケットの 1 フィールドでも誤った値に書き換えれば、その試行は失敗になる。

終端状態こそが成績表

公開記事が挙げるサポート事例では、エージェントは注文、追跡、顧客プロフィール、返金ポリシーを確認し、9 回のツール呼び出しはすべて正しい形式だったが、チケットを「解決済み」として閉じ、顧客にも処理完了と伝えた。しかし配送業者の例外はまだ開いており、要求される終端状態は「保留」であり、顧客の実際の質問には答えていなかった。ツール呼び出しで採点すれば満点近く、データベースの状態で採点すれば不合格である。

この乖離は逸話ではない。12 モデルを対象とした 121,680 件の有効な試行のうち、79,853 件が実行可能なチェックに不合格だった。失敗の 67.24% は正常に終了し、状態を変更するツールを呼び、最終エラーも報告していなかったにもかかわらず、チェックでは 77.61% に誤ったフィールド値、43.30% に意図しない副作用、25.36% に必要な効果の欠落が見つかった。エージェントの最も一般的な失敗は、支離滅裂になることではなく、自信を持って誤った記録を書き、それに気づかないことだ。

一度できることと、毎回できることは違う

単回成功率のランキングは見慣れた顔ぶれだ。Claude Opus 5.5 が 67.16% で首位、Claude Opus 5 が 66.50%、GPT-5.4 が 65.36%。だが ThinkingBox が本当に問うのは二つ目の問い、同じタスクを 20 回繰り返してどれだけ残るかだ。

Kimi-K3 はカバレッジが最も広く、507 タスク中 476 件、93.89% を少なくとも一度は解いた。ところが 20 回すべて合格したのは 68 件、13.41% にすぎない。Claude Opus 5 は逆の姿で、一度は解けたタスクは少ないが、241 件、47.53% が毎回合格した。新世代の Opus 5.5 は単回スコアこそ高いが、20 回全合格のタスク数は同じ 241 件で、一つも増えていない。GPT-6 Astra は単回成績の 78% を保持し、保持率では最上位だった。新モデルが平均点を上げても、信頼性が自動的に上がるわけではない。

信頼性には別の値段がつく

記事は信頼性にも価格をつける。20 ラウンドの評価コストを、全 20 回合格したタスク数で割った「頼れるタスクあたりのコスト」だ。GPT-5.4 は 1 件 6.80 ドルで最安だが、全合格は 128 件にとどまる。GPT-6 Astra は 7.45 ドルで 231 件、Claude Opus 5.5 は 7.80 ドルで 241 件。一度正解する最安の方法と、安定して正解する最安の方法は同じではない。

失敗の内訳も実務的だ。約 79.9% はツール操作の問題、状態更新の誤りが 10.3%、回答の不完全さが 7.0%、状態を変える行動を取らなかったケースは 2.9% にすぎない。多くのエージェントは課題を理解しながら、ツールエラー、前提条件の不成立、空の検索結果でつまずく。導入側への示唆は三つ。コミット前にモデルの自己申告ではなく終端状態を確認すること、ツールエラーを分類して回復可能なものだけに再試行を集中させること、取り消しにくい変更には人間の承認を残すことだ。ThinkingBox は Hugging Face の OpenEnv 経由で利用でき、自社のワークフローで公開前に再測定できる。

おすすめツール

もっと見る