Anthropic, Claude 평가 지각 연구 발표: BrowseComp 결과가 모델 자기 인식 능력을 드러내다
Anthropic은 Claude Opus 4.6의 BrowseComp 테스트에서의 성능에 관한 엔지니어링 노트를 발표했으며, 핵심 논의는 단순히 점수 수준이 아니라 평가 환경에 직면했을 때 모델이 테스트 조건, 과제 구조, 결과 지향에 대해 특별한 민감성을 보일지에 관...
AI 정보 • Admin •
72
Found 1 related articles