ToolNavs 便利なAIツールを発見
ツール投稿 ログイン

AI モデル評価

問題セットを替えれば同じモデルでも順位は数段落ちます。ランキングは通知表ではなく、出題者の視点で切り取った一枚にすぎません。ベンチマークの作り方、採点器の設計、数字が膨らまない工夫を扱います。

評価の難所は出題ではなく、点数が本当に能力を表すようにすることです。UNO-Bench は 44 種類のタスクと五つのモダリティ組合せで基準をそろえ、汎用の採点モデルを添えて自動評価の一貫性を約 95% に保ちます。AMO-Bench はさらに踏み込み、人間の専門家に IMO 級の新作問題 50 問を依頼します。学習データの記憶による"スコア荒らし"を避けるためで、多くのモデルは依然 40% 未満です。 単一ターンの評価はエージェントでは通用しません。Anthropic のエンジニアリングチームは、実際の失敗事例 20〜50 件から始め、各タスクに通る参照解と明確な判定基準を用意し、「すべきこと」と「すべきでないこと」の両方を題材に入れ、毎試行を隔離環境で実行して共有状態やキャッシュによる水増しを防ぐ手順を勧めています。指標も要検討です。pass@k は複数回のうち一度でも成功するか、pass^k は毎回成功するか——製品が「毎回確実」を求めるなら後者です。
AnthropicのエンジニアリングチームがAIエージェントレビューを解釈する:タスクセットからグレーダー設計までのロードマップ

AnthropicのエンジニアリングチームがAIエージェントレビューを解釈する:タスクセットからグレーダー設計までのロードマップ

Anthropicは2026年1月9日にエンジニアリング記事を発表し、AIエージェントの評価(evals)の主要な手法を体系的に分解し、エージェントは複数ラウンドの相互作用、ツールの呼び出し、環境の状態の書き換えという特徴を持ち、単一の評価ラウンドでは不十分であることを強調しました。 本論文では、ス...

Admin
221
AMO-Benchリリース:IMOレベルの数学競技のための大規模モデル推論ベンチマーク

AMO-Benchリリース:IMOレベルの数学競技のための大規模モデル推論ベンチマーク

1. Abstract AMO-Benchは、美団のLongCatチームが立ち上げた高度な数学的推論ベンチマークで、国際数学オリンピアード(IMO)レベルからさらに高難易度の競技問題に焦点を当てています。 ベンチマークは50問の新しい人間が設計した問題で構成されており、システムは自動スコアリングと人...

Admin
148
UNO-Benchの包括的な考察:マルチモーダル理解と推論の統合評価のためのオープンベンチマーク

UNO-Benchの包括的な考察:マルチモーダル理解と推論の統合評価のためのオープンベンチマーク

I. 要約 UNO-Benchは、「単一モデル/完全モデル」の質問の統合評価のためのオープンソースベンチマークであり、知覚と推論の両方の側面をカバーしています。中国語の実世界シナリオ問題と、多段階の自由回答形式の質問応答(MO)問題を提供します。データとツールは、高品質と人間主導の構築を重視しており...

Admin
125