알리바바 통이첸원은 Qwen3.8-플래시를 출시하며 저비용 추론과 차세대 아키텍처 미리보기를 같은 업데이트에 포함시켰습니다. 이 모델은 다중 모달 MoE 방식을 채택하며, 메인 모델은 125B 매개변수를 가지며 각 토큰은 6B만 활성화합니다; 다음 버전은 장기 문맥 효율성과 단위 추론 비용을 목표로 Qwen4 아키텍처 설계를 미리 도입합니다.
125B 모델은 매번 6B만 활성화합니다
Qwen3.8-Flash-Next는 125B 매개변수 메인 모델과 추가로 51B N-그램 임베딩으로 구성됩니다. N-그램 임베딩은 로컬 맥락을 기반으로 테이블을 조회하여 모델 용량을 증가시키고 추가 계산 부하를 낮은 수준으로 줄여줍니다.
각 토큰은 6B 매개변수만 활성화하는데, 이는 이 MoE 모델 의 핵심 지표입니다. 공식적으로 훈련 비용은 Qwen3.7-Plus의 약 9분의 1에 불과하며, 프로그래밍과 사무 업무 능력은 향상되었고, 모델 경쟁은 "더 큰 규모"에서 "통화당 더 효율적인 "것으로 이동했습니다.
Qwen4 아키텍처는 초기에 공개되었습니다
Qwen3.8-Flash-Next는 완전한 Qwen4가 아니라 차세대 아키텍처의 초기 미리보기입니다. Attention은 GDN과 QSA의 하이브리드 설계를 사용합니다: GDN은 과거 정보를 압축하고, QSA는 장기 시퀀스 계산과 KV 캐시 접근 압력을 줄이기 위해 더 중요한 맥락을 필터링합니다.
잔차 구조도 게이트 잔차로 업그레이드되었으며, 호스트 메모리로 이오프로드할 수 있는 N-그램 임베딩이 적용되었습니다. 이 모델은 기본적으로 262,144개의 토큰 컨텍스트를 지원하며, YaRN을 통해 1M 토큰까지 확장할 수 있습니다. 장기 컨텍스트 효율성이 이 아키텍처 조정의 핵심 목표가 되었습니다.
플래시는 대규모 AI 응용을 목표로 합니다
Qwen3.8-Flash의 생산 버전은 QwenCloud용으로 설계되었으며 기본적으로 1M 컨텍스트를 지원합니다. 이 제품 포지셔닝은 AI 프로그래밍, 문서 처리, 에이전트, 고빈도 API 호출에 더 적합한데, 이러한 시나리오는 긴 컨텍스트가 필요하고 추론 비용과 처리량에 매우 민감하기 때문입니다.
Qwen 팀은 전체 Qwen4 패밀리보다 먼저 Next 아키텍처를 공개하기로 결정했으며, 이는 오픈 소스 생태계에 적응 기간을 주었습니다. 추론 프레임워크, 양자화 도구, 배포 계획은 새로운 구조에 맞춰 사전에 조정할 수 있어, 차세대 모델이 공식 출시될 때 마이그레이션 비용을 줄일 수 있습니다.
Qwen 3.8-Flash는 명확한 방향을 제시합니다: 다음 대형 모델 경쟁은 매개변수와 벤치마크에만 집중하지 않을 것입니다. 더 긴 맥락을 적은 활성화 매개변수와 낮은 메모리 오버헤드로 처리할 수 있는 사람이 진정한 고주파 AI 애플리케이션에 더 많이 진입할 가능성이 높아질 것입니다.