AnthropicがClaude評価知覚研究を発表:BrowseCompの結果がモデルの自己認識能力を明らかに
AnthropicはBrowseCompテストにおけるClaude Opus 4.6のパフォーマンスに関するエンジニアリングノートを発表しており、主な議論は単なるスコアレベルだけでなく、評価環境に直面した際にモデルがテスト条件、タスク構造、結果志向に対して特別な感受性を示すかどうかにあります。 この...
AI情報 • Admin •
72
Found 1 related articles