ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Nemotron 두 개의 금메달 수준: IOI 인간 1위 추월, IMO 기준선 돌파

Nemotron 두 개의 금메달 수준: IOI 인간 1위 추월, IMO 기준선 돌파

AI 정보 • Admin • • 5 회 조회

Nemotron에 대해 NVIDIA 팀이 2026년 10월 7일 Hugging Face 블로그에 총괄 글을 올렸다. 같은 모델 계열을 미세 조정한 두 버전이 2026년 국제정보올림피아드(IOI)와 국제수학올림피아드(IMO)에서 각각 금메달 수준에 도달했고, IOI 점수는 해당 대회 인간 최고점도 넘어섰다.

두 개의 금메달, 나눠서 봐야 한다

정보 분야에서는 경쟁 프로그래밍 버전이 인간 참가자와 같은 시간, 인터넷 차단, 제출 횟수 제한 아래서 실시간으로 답을 작성해 600점 만점에 535.4점을 받았다. 361.12점인 금메달 기준선과 인간 1위의 498.27점을 모두 넘었다. 다만 팀은 이것이 비공식, 무감독 벤치마크 실행이며 IOI 공식 순위에 포함되지 않는다고 분명히 밝혔다. 수학 분야에서는 시스템이 형식 증명 도구도, 외부 도구도, 인터넷도 없이 자연어로만 증명을 써서 42점 중 30점을 받았고, 29점인 공식 금메달 기준선을 넘었으며 여섯 문제 중 네 문제에서 만점을 받았다. 답안은 IMO 공식 채점자가 채점했다. 두 결과의 무게는 성격이 다르므로 나눠서 읽어야 한다.

더 큰 기반 모델 덕분이 아니다

두 프로젝트의 방식은 같다. Nemotron 3을 기반으로 영역 데이터로 지도 미세 조정을 하고, 필요한 곳에 강화학습을 더한 뒤, 생성, 검증, 수정을 반복하는 추론 루프와 결합한다. 프로그래밍 버전은 2만 2000개 문제의 추론 궤적에서 학습했고 GenCorrect라는 전략으로 평가 피드백을 받으며 코드를 여러 차례 고쳤다. 수학 쪽 학습 데이터는 증명 쓰기, 다듬기, 검산, 검산 판정까지 포함해 범용 모델과 미세 조정 모델, 강화학습 모델이 하나의 시스템 안에서 서로의 오류를 지적하게 했다. 팀의 결론은 금메달이 파라미터나 샘플링 횟수의 단순 확대가 아니라 미세 조정과 테스트 시점 연산의 결합에서 나왔다는 것이다.

공개된 것과 말해지지 않은 비용

함께 공개된 것은 두 방향의 모델 체크포인트, 학습 데이터, 추론 파이프라인, 그리고 신규 200문제로 구성된 IMO 벤치마크이며 Hugging Face와 GitHub의 NVIDIA-NeMo 조직 아래에 있다. 연구자에게는 점수에 처음으로 재현 가능한 전체 경로가 붙은 셈이다. 반대쪽도 봐야 한다. 수학 시스템의 최종 선별 단계는 의도적으로 연산량이 크고, 완전한 재실행에는 상당한 연산 자원과 시간이 든다. 가중치 공개는 참여 문턱을 낮추지만 연산 격차를 없애지는 못한다. 이런 공개 경쟁 성과를 축하할 때 함께 기억할 지점이다.

추천 도구

더보기