ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
샤오미, MiMo-V3 핵심 아키텍처 HySparse2 공개: Prefill 연산을 1/5로, 장거리 멀티턴 에이전트 겨냥

샤오미, MiMo-V3 핵심 아키텍처 HySparse2 공개: Prefill 연산을 1/5로, 장거리 멀티턴 에이전트 겨냥

AI 정보 Admin 3 회 조회

2026년 9월 24일, 샤오미 MiMo 팀은 차세대 모델 MiMo-V3의 핵심 아키텍처 'HySparse2'를 공개했습니다. 앞서 공개된 1세대 HySparse의 업그레이드 버전으로, 장거리 멀티턴 에이전트 작업을 겨냥해 설계됐습니다. 목표는 세 가지입니다. Prefill 연산 감소, KV Cache 축소, 그리고 장문맥 검색의 정확도 향상입니다.

HySparse2가 한 일

HySparse2는 모델을 앞뒤 두 부분으로 나눕니다. 전반부는 Full Attention과 Sliding Window Attention(SWA)을 혼합한 Self-Decoder, 후반부는 Full Attention과 Sparse Attention을 혼합한 Cross-Decoder입니다. 여기에 2단계 KV 공유를 도입했습니다.

1단계 KV Bridging은 전후반을 가로지릅니다. 후반부의 각 Full Attention 레이어는 전반부 대응 Full Attention 레이어의 입력 은닉 상태에서 자신의 KV Cache를 직접 만듭니다. 각 타깃 레이어는 독립적인 K/V 프로젝션을 유지하므로, 같은 소스 은닉 상태에서 서로 다른 KV를 구축할 수 있습니다. 후반부의 KV는 입력이 모든 레이어를 통과할 때까지 기다릴 필요가 없어집니다.

2단계 KV Reuse는 각 Hybrid Block 내부에서 일어납니다. 하나의 Full Attention 레이어와 그 뒤를 잇는 여러 Sparse Attention 레이어가 하나의 블록을 이룹니다. Full Attention 레이어는 연산과 동시에 어텐션 스코어로 중요한 위치를 고르고, 후속 스파스 레이어는 그 KV Cache와 선택 인덱스를 그대로 재사용합니다. 별도의 셀렉터를 따로 학습할 필요가 없습니다.

또 하나의 핵심 변화는 선택 단위가 '블록을 고른다'에서 '토큰을 고른다'로 바뀐 것입니다. 1세대 HySparse는 블록 단위 선택이라 하나의 중요 토큰을 잡기 위해 주변 블록 전체를 연산에 포함하곤 했습니다. HySparse2는 토큰 단위 선택으로 바꿔 같은 어텐션 예산을 더 정밀하게 배분합니다. 로컬 윈도우는 유지됩니다. 최근 128개 토큰은 반드시 선택하고, 윈도우 밖에서 1,024개의 글로벌 토큰을 추가로 선택합니다. 둘 다 Full Attention 레이어가 제공하는 공유 KV Cache를 읽습니다. 독립 SWA 브랜치는 폐지됐고, 그 프로젝션 파라미터와 KV Cache 비용도 사라졌습니다.

Prefill은 절반에서 끝난다

2단계 KV 공유와 로컬 윈도우 통합 덕분에 후반부에 필요한 KV Cache는 모두 전반부의 은닉 상태에서 구축할 수 있습니다. 49개 레이어 모델에서 Prefill은 앞쪽 25개 Self-Decoder 레이어와 브리지 KV 프로젝션만 실행하면 되며, 그중 Full Attention은 단 1개 레이어뿐입니다. Prefill과 Decode를 분리 배포하면 Prefill 노드는 이 Self-Decoder 부분만 탑재하면 되므로 모델 가중치 저장 공간이 거의 절반으로 줍니다. 생성 단계에서는 여전히 전체 네트워크를 사용해 후반부의 글로벌 검색과 모델링 능력을 유지합니다.

실측 수치

80B-A3B MoE 모델에서 동일한 데이터와 학습 레시피로 Hybrid SWA, HySparse, HySparse2를 비교했습니다(HySparse2는 더 컴팩트한 MQA 구성도 사용). 백만 토큰에서 Hybrid SWA 대비 HySparse2의 Prefill 연산량은 1/5로, KV Cache는 12GB에서 2.7GB로 감소했습니다. 1세대 HySparse 대비로는 Prefill 연산량이 1/3로, KV Cache가 6.7GB에서 2.7GB가 됐습니다.

동일한 경량 사후 학습 후 최대 256k 평가 범위에서 HySparse2는 테스트한 모든 길이에서 MRCR-v2와 RULER-v2 점수가 올랐고 AgentPPL과 LongPPL은 낮아졌습니다. 1세대 HySparse와 비교하면 MRCR-v2와 RULER-v2의 길이별 평균 점수가 각각 11.30포인트, 19.81포인트 향상됐습니다. 공식 결론은 이렇습니다. 더 작은 KV Cache와 더 짧은 Prefill은 더 나은 장문맥 검색과 양립할 수 있다, 고요.

왜 에이전트에게 필요한가

에이전트가 긴 작업을 수행할 때 한 번의 도구 호출로 웹 페이지 한 장, 파일 하나, 긴 실행 로그가 통째로 돌아올 수 있습니다. 히스토리는 계속 늘어나고 KV Cache는 부풀며, 새 입력을 읽을 때마다 Prefill 비용이 커집니다. HySparse2는 세 가지 질문에 동시에 답합니다. 읽기는 빠르게, 메모리는 싸게, 긴 히스토리에서의 근거 찾기는 정확하게. 멀티턴 에이전트에서 가장 비용이 드는 세 지점입니다.

어떻게 볼 것인가

첫째, 연속성입니다. MiMo-V2 시리즈의 Hybrid SWA에서 1세대 HySparse, 그리고 HySparse2까지 MiMo 팀은 '모델 능력과 연산 효율을 함께 높인다'는 노선을 이어가고 있습니다. 풀모달 듀얼 버전 MiMo-V2.6도 같은 발상의 산물입니다.

둘째, 역할 분담입니다. 앞서 나온 MiMo-UltraSpeed는 저비트 양자화와 추측 디코딩으로 Decode를 가속했고, HySparse2는 Prefill과 캐시 비용을 압축합니다. 양 끝을 따로 최적화하는 구조입니다.

유보 사항도 분명히 합니다. 이번에 공개된 것은 아키텍처이며 MiMo-V3 본체는 아직 출시되지 않았습니다. 위 수치는 팀 내부 비교라는 공식 입장이며, 제3자의 독립 평가는 아직 없습니다. 그래도 방향은 명확합니다. 장거리 에이전트의 비용은 아키텍처 차원에서 낮아지고 있습니다.

추천 도구

더보기