Mellum2.1은 JetBrains가 2026년 10월 8일 공개한 오픈소스 코딩 모델로, 코딩 에이전트 안에서 실무를 맡는 일꾼이라는 위치다. 코드베이스를 탐색하고, 파일을 편집하고, 자신의 변경을 검증할 수 있다. Hugging Face에 Apache 2.0 라이선스로 공개됐다. 이번 버전에서 볼 것은 파라미터 수가 아니라, JetBrains가 여름 내내 강화학습에 투자하며 대형 모델의 비싸고 느린 배포 문제를 작은 모델로 풀려 했다는 점이다.
아키텍처는 그대로, 승부는 후훈련에서 갈렸다
Mellum2.1은 Mellum2의 아키텍처를 그대로 사용한다. 120억 파라미터의 전문가 혼합 모델이며 토큰당 25억 파라미터만 활성화된다. 공식 블로그에 따르면 이전 버전은 빨랐지만 저장소 안에서 원하는 수준의 작업을 하지 못했다. 이번 변화는 거의 전부 후훈련에 있다. 강화학습은 마지막 짧은 단계에서 훈련의 본체로 격상됐고, JetBrains는 수천 개의 강화학습 환경을 자체 구축해 훈련 전 과정에서 수백만 번의 샌드박스 실행을 돌렸다. 훈련 과제에는 수학, 경쟁 프로그래밍, 과학, 도구 사용, 소프트웨어 공학이 추가됐고, 오픈 데이터는 깨진 테스트, 검증할 수 없는 답, 너무 쉽거나 불가능한 과제를 훈련 전에 걸러냈다.
점수 읽는 법: 강점은 또렷하고 약점도 드러나 있다
JetBrains가 공개한 동일 조건 평가에서 Mellum2.1은 게재된 17개 벤치마크 중 15개에서 이전 버전을 앞섰고, 가장 크게 오른 영역이 에이전트 코딩이다. LiveCodeBench v6에서 82.0을 기록해 동급인 Qwen3.5-9B의 75.4를 앞섰다. 그러나 엔드투엔드 작업 수행 능력을 묻는 Terminal-Bench 2.1에서는 17.4에 그쳐 Qwen3.5-9B의 21.7보다 낮았다. 속도 주장이 더 단단하다. 아키텍처가 그대로라 추론이 느려지지 않았고, 멀티 토큰 예측으로 단일 요청은 약 1.6배 빨라졌으며, H200 한 장에서의 공식 테스트에서 고부하 시 처리량은 Qwen3.5-9B의 거의 두 배였다. 정리하면 속도와 비용에서는 이기고, 가장 어려운 장기 과제에서는 아직 뒤처진다.
누구에게 맞고, 누구에게는 맞지 않나
가장 맞는 용도는 에이전트 시스템 안의 하위 에이전트로 쓰는 것이다. 실패한 테스트의 근본 원인 찾기, 수정 초안 작성, 변경 검증처럼 경계가 분명한 일은 훈련에서 반복해 연습한 바로 그 작업이다. 두 번째로 맞는 것은 자체 호스팅으로, 코드와 데이터를 내부 인프라 안에 둘 수 있어 컴플라이언스 요구가 엄격한 팀이 외부 대형 모델을 호출하는 것보다 설명하기 쉽다. llama.cpp, Ollama, LM Studio용 GGUF 빌드와 멀티 토큰 예측 구성 요소는 곧 제공될 예정이며, 현재는 Hugging Face에서 가중치를 받아 직접 배포하는 방식이다. 피해야 할 기대도 분명하다. 가장 복잡한 엔드투엔드 소프트웨어 공학을 혼자 맡기거나 지식 폭이 가장 넓은 범용 비서로 쓰는 것은 Terminal-Bench 점수가 이미 말해 주고 있다.