ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
NaiveAI, 309B 모델 N0.5-Flash 오픈소스 공개: 전체 어텐션 층 전면 제거, 네이티브 100만 컨텍스트

NaiveAI, 309B 모델 N0.5-Flash 오픈소스 공개: 전체 어텐션 층 전면 제거, 네이티브 100만 컨텍스트

AI 정보 • Admin • • 9 회 조회

NaiveAI가 2026년 9월 27일 오픈 웨이트 모델 Naive-N0.5-Flash를 공개했다. 총 파라미터 309B, 토큰당 활성 파라미터는 15.5B인 혼합 전문가(MoE) 모델로, 네이티브 100만 토큰 컨텍스트 윈도를 지원하며 MIT 라이선스로 Hugging Face에 공개됐다. '전체 어텐션 층 없음' 노선에서 지금까지 가장 과감한 엔지니어링 검증이다. 48층 네트워크 전체에 기존 방식의 전체 어텐션을 사용하는 층은 단 하나도 없다.

48개 층 전체에 전체 어텐션 층은 하나도 없다

이 모델은 48층 트랜스포머를 8개의 6층 모듈로 나누고, 각 모듈에 5층의 슬라이딩 윈도 어텐션과 1층의 경량 DeepSeek 희소 어텐션(DeepSeek Sparse Attention)을 결합해 총 39층의 슬라이딩 윈도 층과 9층의 희소 층으로 구성된다. 슬라이딩 윈도는 128 토큰에 불과하고, 희소 층은 백본 어텐션을 위해 상위 2048개 토큰을 선택하며, 4개 KV 그룹을 사용하는 그룹 쿼리 어텐션과 결합한다. 공식 모델 카드의 표현은 직설적이다. 네트워크 전체가 로컬 또는 희소를 유지하면서 전체 어텐션 층 없이 네이티브 100만 컨텍스트를 구현한다.

3.25T 토큰 학습, 베이스는 샤오미 오픈 모델

학습에는 총 3.25T 토큰을 사용했으며, 전부 네이티브 100만 컨텍스트 길이에서 진행했다. 희소 인덱서 웜업에 50B 토큰, 희소 어텐션 학습에 3T 토큰, 마지막으로 학습률 감쇠에 200B 토큰을 투입했다. 베이스는 샤오미의 오픈 웨이트 모델 MiMo-V2.5로, 앞서 샤오미가 오픈소스화한 MiMo-V2.6과 같은 모델 패밀리의 계보에 속한다. 감사의 글에는 DeepSeek 희소 어텐션 설계팀과 SGLang 추론 프레임워크도 이름을 올렸다. 샤오미가 이후 발표한 MiMo-V3의 핵심 아키텍처 HySparse2 역시 희소화 노선을 걷고 있어, '전체 어텐션 제거'는 중국 오픈 모델의 뚜렷한 흐름이 되고 있다.

'AI로 AI를 만든다': 연구 파이프라인 자체가 핵심 메시지

파라미터 수보다 주목할 점은 개발 방식이다. NaiveAI는 함께 공개한 기술 블로그에서 이번 연구·엔지니어링 파이프라인이 '대부분 AI 시스템에 의해 실질적으로 실행됐다'고 밝혔다. 모델 스스로 코드를 작성하고 실험을 돌리고 결과를 모니터링하며 다음 반복을 제안했고, 인간 연구자는 목표·제약·평가 기준 설정과 핵심 의사결정을 맡았다. 기술 보고서의 제목은 'Naive-N0.5-Flash: Building Frontier AI with AI'다. NaiveAI는 올해 2월 칭화대 다이 지펑(Jifeng Dai) 교수가 베이징에서 창업한 지 7개월 된 스타트업으로, 이 모델은 'AI가 AI를 개발한다'는 방법론의 첫 성적표라 할 수 있다.

속도 수치는 화려하지만 전부 자체 발표

모델과 함께 자체 개발 추론 스택 NaiveRT도 공개됐다. 메가 커널 퓨전, Programmatic Dependent Launch, 추론적 디코딩, FP8 혼합 정밀도를 결합해 표준 모드에서 사용자당 50토큰/초, Ultrafast 모드에서 최대 2000토큰/초를 표방한다. 다만 독립 리뷰어들은 이미 주의를 당부했다. 이는 좁은 의미의 디코드 속도 수치일 뿐 엔드투엔드 실측이 아니며, 장문 맥락에서의 정확도 유지도 미검증 상태다. 호스티드 API 가격은 입력 100만 토큰당 0.10달러, 출력 0.40달러, 캐시 읽기 0.01달러로, 목표 워크로드는 코딩과 AI R&D에 맞춰져 있다.

이 소식이 주목받을 만한 이유는 두 가지다. 첫째, '희소 어텐션이 전체 어텐션을 완전히 대체할 수 있는가'라는 질문이 논문상의 논쟁에서 다운로드해 검증할 수 있는 엔지니어링 사실로 바뀌었다는 점이다. 전체 어텐션 층 없이 100만 컨텍스트가 실제로 안정적으로 동작한다면 장문맥 모델의 비용 계산은 근본부터 다시 쓰인다. 둘째, MIT 라이선스는 상용 이용의 장벽을 없애고, 309B 총 파라미터·15.5B 활성이라는 구성은 실제 배포 비용을 중규모 밀집 모델 수준으로 낮춘다. 코드 에이전트와 장문서 RAG를 다루는 팀에 새로운 선택지가 된다. 냉정하게 보면 화려한 수치는 모두 현시점 기업의 자체 발표이며, 진짜 실력은 커뮤니티의 실측을 기다려야 한다. 하지만 오픈 웨이트의 의의는 바로 여기에 있다. 의심스럽다면 직접 실행해 확인하면 된다.

추천 도구

더보기