ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
DeepSeek 正训练 2 万亿参数模型:转投华为 Ascend 芯片,梁文锋称"必须成功"

DeepSeek 正训练 2 万亿参数模型:转投华为 Ascend 芯片,梁文锋称"必须成功"

AI资讯 Admin 2 次浏览

2026 年 9 月 23 日,多家媒体援引 The Information 的报道称,DeepSeek 创始人梁文锋在一场闭门投资者会议上透露:公司正把大模型训练的重心转向国产芯片,计划大规模采用华为昇腾(Ascend)系列做训练;与此同时,DeepSeek 正在训练一个 2 万亿参数的模型,并规划了后续的 8 万亿参数版本。梁文锋把"用国产芯片训练 AI 模型"称为公司最大的战略举措之一,并表示"必须成功"。

需要先说明的是,这不是 DeepSeek 的官方公告,而是一场闭门会议内容的转述。核心信息来自 The Information 的报道,多家科技媒体跟进,但 DeepSeek 和华为均未公开回应。读的时候要按"传闻待官宣"的分量来掂量。

闭门会里说了什么

综合几家媒体的交叉报道,关键点有四条:

一是训练正在转向国产芯片。此前 DeepSeek 训练主要依赖英伟达的高端 GPU,国产芯片更多用在推理侧;这次的说法是,华为昇腾将进入"训练"这个最吃算力的环节,首批新芯片最早 2026 年四季度交付。

二是模型规模继续加码。正在训练的 2 万亿参数模型,外界猜测即下一代旗舰 V4.1 Pro;8 万亿参数则是更远期的规划。作为参照,阿里 Qwen 3.8 Max 是 2.4 万亿参数,月之暗面的 Kimi K3 是 2.8 万亿——8 万亿将是现有最大开源模型的三倍左右。

三是砸钱扩算力。报道称 DeepSeek 计划投入约 300 亿元人民币扩大国产 AI 算力,华为方面也被曝出 DeepSeek 下了 16 万片 Ascend 950DT 的大单,用于其内蒙古 1GW 数据中心。

四是梁文锋的判断:华为芯片几年内能在性能上追上英伟达。这是整件事的信心来源,也是最大的不确定性来源。

算力账:4 比 1 的代价

转投国产芯片不是没有代价的。报道中给出的换算关系是:训练 OpenAI 级别的最大模型,大约需要 5 万片英伟达 GB300,或至少 20 万片华为 Ascend 950——大约 4:1 的数量比。另一种口径是,训练 2 万亿参数模型约需 6 万片昇腾,对比 3 万片英伟达 H100/H200。

这意味着同样的训练任务,国产方案要付出数倍的物理规模、功耗和运维复杂度。DeepSeek 敢接这个账,赌的是两件事:出口管制下英伟达高端卡越来越难拿,以及华为芯片的迭代速度能跑赢这个差距。

为什么是现在

时机并不偶然。一方面,美国对华芯片出口管制持续收紧,英伟达在华销售屡屡受挫,囤卡的窗口在收窄;另一方面,华为 4 月已披露其芯片部分参与了 DeepSeek 轻量模型 V4-Flash 的训练——从"推理试水"到"训练主力",这次是把试探变成了战略。

巧合的是,就在一天前,阿里刚发布了自研 AI 芯片镇岳 V900(阿里发布镇岳V900:性能翻三倍,剑指十万亿参数模型 (/article/2050-alibaba-launches-zhenwu-v900-triple-the-performance-aiming-at-10-trillion-parame)),同样瞄准万亿级参数模型的训练与推理。国产 AI 芯片正在从"备用方案"变成"主赛道",DeepSeek 这一注只是最重的一笔。

怎么看

这件事的象征意义大于技术细节:中国头部大模型公司第一次公开把"训练"押在国产芯片上。如果 DeepSeek 真能在昇腾上训出 2 万亿参数模型,等于给整个国产算力链做了一次可行性验证——芯片、互联、训练框架、运维,每一环都得过关。

但也要看到风险面:4:1 的算力代价是实实在在的,华为的供货还受先进存储和元器件短缺制约,梁文锋自己也承认"必须成功"——这句话本身就说明,这是一场没有退路的豪赌。对英伟达而言,失去 DeepSeek 这样的标杆客户,是其在华 AI 芯片份额松动的又一个信号。

对普通开发者来说,短期内这不会改变你调用 API 的价格;但中长期看,国产算力如果真能把训练成本打下来,开源大模型的迭代速度和开放程度都可能受益。先看 2026 年四季度华为的第一批交付能不能如期到货——那是验证这场豪赌的第一个时间点。

推荐工具

更多