AI 모델 평가
문항만 바꿔도 같은 모델의 순위가 몇 계단씩 움직입니다. 리더보드는 성적표가 아니라 출제자 시점에서 잘라낸 한 조각일 뿐입니다. 벤치마크 구성, 채점기 설계, 점수 부풀리기를 막는 방법을 다룹니다.
평가의 어려움은 문제를 만드는 데 있지 않습니다. 점수가 실제 능력을 대변하게 만드는 데 있습니다. UNO-Bench는 44종 태스크와 다섯 가지 모달리티 조합으로 기준을 통일하고 범용 채점 모델을 붙여 자동 평가 일관성을 약 95%로 유지합니다. AMO-Bench는 한발 더 나가 인간 전문가에게 IMO급 신규 문제 50개를 의뢰합니다. 학습 데이터 암기로 점수가 부풀려지는 것을 막기 위해서이고, 대부분 모델은 여전히 40% 미만입니다.
단일 턴 평가는 에이전트에서 무너집니다. Anthropic 엔지니어링 팀은 실제 실패 사례 20~50개에서 시작해, 각 태스크에 통과 가능한 참조 해답과 명확한 판정 기준을 마련하고, '해야 할 일'과 '하지 말아야 할 일'을 모두 넣으며, 매 시행을 격리 환경에서 돌려 공유 상태나 캐시로 점수가 올라가지 않게 하라고 권합니다. 지표 선택도 중요합니다. pass@k는 여러 번 중 한 번이라도 성공인지, pass^k는 매번 성공인지—'매번 안정적으로'가 요구되는 제품에는 후자가 맞습니다.