ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인

AI 모델 평가

문항만 바꿔도 같은 모델의 순위가 몇 계단씩 움직입니다. 리더보드는 성적표가 아니라 출제자 시점에서 잘라낸 한 조각일 뿐입니다. 벤치마크 구성, 채점기 설계, 점수 부풀리기를 막는 방법을 다룹니다.

평가의 어려움은 문제를 만드는 데 있지 않습니다. 점수가 실제 능력을 대변하게 만드는 데 있습니다. UNO-Bench는 44종 태스크와 다섯 가지 모달리티 조합으로 기준을 통일하고 범용 채점 모델을 붙여 자동 평가 일관성을 약 95%로 유지합니다. AMO-Bench는 한발 더 나가 인간 전문가에게 IMO급 신규 문제 50개를 의뢰합니다. 학습 데이터 암기로 점수가 부풀려지는 것을 막기 위해서이고, 대부분 모델은 여전히 40% 미만입니다. 단일 턴 평가는 에이전트에서 무너집니다. Anthropic 엔지니어링 팀은 실제 실패 사례 20~50개에서 시작해, 각 태스크에 통과 가능한 참조 해답과 명확한 판정 기준을 마련하고, '해야 할 일'과 '하지 말아야 할 일'을 모두 넣으며, 매 시행을 격리 환경에서 돌려 공유 상태나 캐시로 점수가 올라가지 않게 하라고 권합니다. 지표 선택도 중요합니다. pass@k는 여러 번 중 한 번이라도 성공인지, pass^k는 매번 성공인지—'매번 안정적으로'가 요구되는 제품에는 후자가 맞습니다.
Anthropic의 엔지니어링 팀이 AI 에이전트 리뷰를 해석합니다: 작업 세트에서 그레이더 설계까지의 로드맵

Anthropic의 엔지니어링 팀이 AI 에이전트 리뷰를 해석합니다: 작업 세트에서 그레이더 설계까지의 로드맵

Anthropic은 2026년 1월 9일 AI 에이전트 평가(eval)의 핵심 방법을 체계적으로 해체하는 엔지니어링 기사를 발표했으며, 에이전트는 여러 차례의 상호작용, 도구를 호출하고 환경 상태를 재작성하는 특성을 가지고 있으며, 단일 평가 라운드로는 종종 충분하지 ...

Admin
221