ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
DeepSeek V4.1 플래시 새 리뷰: 코드 작업 비용은 Astra의 약 15분의 1에 불과합니다

DeepSeek V4.1 플래시 새 리뷰: 코드 작업 비용은 Astra의 약 15분의 1에 불과합니다

AI 정보 Admin 3 회 조회

2026년 9월 14일, AI 추론 플랫폼인 파이어웍스 AI는 DeepSeek V4.1 플래시에 대한 리뷰를 발표했습니다. DeepSWE 코드 작업에서 모델은 최대 74.34%의 점수를 받았으며, 작업당 평균 비용은 $0.430이었습니다; GPT-6 Astra는 xhigh 추론 범위에서 74.12%를 기록하며 $6.524의 비용이 들었습니다. 이 결과를 바탕으로 전자의 단일 작업 비용은 후자의 약 15분의 1에 불과하지만, 이는 특정 플랫폼과 벤치마크를 기반으로 한 비교일 뿐, 모든 개발 시나리오가 동일한 격차를 유지하는 것은 아닙니다.

네 가지 모델의 결과는 얼마나 비슷한가요?

모델DeepSWE 점수작업당 비용
딥시크 V4.1 플래시74.34%$0.430
GPT-6 아스트라 xhigh74.12%$6.524
제미니 3.8 플래시73.83%$2,362
클로드 작품 573.65%$11,838

Fireworks는 또한 DeepSWE가 한 번의 실행 시 약 1.4%에서 3.2%포인트 정도 변동하는 반면, 네 모델 중 최고 점수는 단 0.69%포인트 차이임을 강조합니다. 따라서 이 표만으로는 코드 능력에서 누가 절대적으로 우수한지 판단하기에 충분하지 않습니다; 품질이 비슷한 범위일 때 추론 비용이 라우팅 및 조달 결정에서 핵심 변수가 된다는 점을 더 잘 보여줍니다.

저비용은 어디서 나오나요?

DeepSeek V4.1 Flash는 5,520억 개의 매개변수를 가진 하이브리드 전문가 아키텍처를 사용하며, 입력 시 토큰당 약 80억 매개변수, 출력 시 약 160억 매개변수를 활성화합니다. DeepSWE도 전형적인 입력 집약적 작업으로, 각 작업은 평균 약 3,690만 개의 입력 토큰과 211,000개의 출력 토큰을 처리하며, 비율은 약 174:1이며, 입력 히트의 99.6%가 캐시에 있습니다. Fireworks의 청구 내역에 따르면 캐시 입력은 전체 비용의 약 59.9%, 출력은 약 32.5%를 차지합니다. 이는 모델 아키텍처, 캐시 가격 정하기, 워크로드 형태가 함께 작용하여 전체 매개변수만으로는 설명할 수 없는 결과를 만들어낸다는 뜻입니다.

크로스 벤치마크 시청에서는 결론이 같지 않습니다

Terminal Bench 2.1에서는 DeepSeek V4.1 Flash가 86.5%, Astra가 87.5%, Fireworks는 총 비용 차이가 약 12배에 달했다고 보고했습니다; 하지만 Humanity's Last Exam에서는 각각 34.52%와 50.40%로 성능 차이가 명확히 드러났습니다. 보고서는 또한 "Oracle Routing"의 이론적 상한선을 54.80%로 제시하는데, 이는 항상 올바른 모델을 선택하는 이상적인 결과를 가정하는데, 이는 실제 라우터에서는 불가능할 수 있습니다.

기업들은 이 데이터를 어떻게 활용해야 할까요?

더 안전한 방법은 코드베이스, 컨텍스트 길이, 캐시 히트율, 실패 재시도 규칙을 사용하여 소규모 재테스트를 수행하고, 완료율, 수동 재작업 시간, 지연, 최종 청구 기록도 함께 기록하는 것입니다. 매우 반복적인 코드 리뷰나 창고 이해 작업을 입력하면 캐싱 보너스를 받기 쉬워질 수 있습니다; 추론이 어렵거나 캐시 히트가 적은 작업은 비용 곡선이 완전히 다를 수 있습니다. 이 평가의 가치는 기업에 맞는 독특한 모델을 선택하는 것이 아니라, 다중 모델 라우팅이 품질 구간과 실제 총 비용을 모두 고려해야 함을 보여주는 데 있습니다.

추천 도구

더보기