DeepSeek은 공식적으로 DeepSeek-V4.1-Flash를 출시했습니다. 새로운 아키텍처 시리즈 중 가장 작은 모델로 공식 정의되었으며, 멀티모달 시각 이해를 네이티브로 지원하며, 핵심 목표는 더 높은 역량 한계, 더 빠른 추론, 더 높은 처리량, 그리고 더 큰 모델로의 확장성을 의미합니다. 플래시는 더 이상 단순한 '저렴한 버전'이 아니라 차세대 아키텍처의 첫 번째 플랫폼이 되어가고 있습니다.
새로운 아키텍처는 처음에 소형 모델에서 구현됩니다
공식 벤치마크에서 V4.1 Flash는 GPQA Diamond 90.9, Codeforces 3471, Terminal-Bench 2.1 90.6, DeepSWE v1.1 74.2를 달성했습니다. 비전 관련 BabyVision(도구 포함)은 89.6점, 차트(도구 포함)는 78.9점을 받았습니다.
이 결과들은 DeepSeek의 공식 테스트에서 나온 것이며, 독립적인 제3자 검증과 직접적으로 동일시할 수 없습니다. 하지만 방향은 명확합니다: DeepSeek은 여러 전용 진입점을 계속 나누는 대신, 추론, 코드, 에이전트, 비전 기능을 하나의 고처리량 모델에 압축하려고 합니다.
플래시가 프로의 업무를 대신하기 시작했다
DeepSeek V4.1 Flash는 이제 API를 출시했으며, 모델명은 deepseek-flash로 변경되었습니다. 이전 세대 V4 Flash와 V4 Flash Vision Exp는 단종되었으며; 기존 모델명은 당분간 호환되며, 라우팅은 V4.1 Flash로 통합되었습니다.
더 중요한 것은 프로 라인입니다. DeepSeek는 광범위한 테스트 결과 V4.1 플래시가 성능, 비용, 속도, 총 시간 면에서 V4 Pro를 능가한다고 밝혔습니다. 9월 14일 12시부터 V4.1 프로 출시 전부터 deepseek-v4-pro 요청은 V4.1 플래시가 처리하며 플래시 가격으로 요금을 부과합니다.
추론 비용은 계속 감소하고 있습니다
API 사양은 AI 추론 효율성의 우선순위도 반영합니다: V4.1 Flash는 1M 컨텍스트, 최대 384K 출력, API 동시성 한도는 2500입니다; 비교를 위해, 현재 V4 Pro는 동시성 한도가 500입니다.
비수기 시간대에는 캐시된 백만 토큰당 입력 가격이 $0.003, 캐시 누락 $0.15, 출력이 $0.6이며, 피크 기간에는 가격이 두 배로 증가합니다. 기능은 Pro에 가까워지고 있으며, 가격은 Flash 티어에 머물러 있습니다—이것이 이 업그레이드의 가장 직접적인 상업적 신호입니다.
V4.1 플래시는 DeepSeek의 새로운 아키텍처의 선구자와 비슷합니다. 먼저 소형 모델을 사용해 네이티브 비전, 높은 처리량, 추론 효율성을 검증한 후, 더 큰 모델로 확장하는 것입니다. 다음 핵심은 V4.1 Pro가 이 아키텍처의 한계를 얼마나 밀어붙일지입니다.