2026年9月30日,DeepSeek开源昇腾基础设施组件。DeepSeek 今日通过官方微信公众号宣布,正式开源面向华为昇腾算力平台的六个基础设施组件:TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前面向英伟达平台开源的组件一一对应,官方仓库全部在 GitHub 上(组织名 tile-ai 与 deepseek-ai)。
这批开源真正值得关注的不在模型本身,而在"软件栈"。国产 AI 芯片这些年的短板从来不是算力,而是生态:写代码、调性能的工具链成熟度远不及 NVIDIA CUDA。有外媒跟进认为,这是国产 AI 补齐软件生态短板的关键一步。
一次开源了哪六个组件
- TileLang:Pythonic 语法的领域专用语言与编译工具链,基于 TVM 编译器基础设施,兼顾开发效率与底层优化。GitHub 仓库
tile-ai/tilelang的 README 在今日更新中宣布正式支持昇腾 950 NPU 原生代码生成、自动调度与同步、SIMD/SIMT 向量编程。 - DeepGEMM:矩阵加速库,昇腾版仓库为
deepseek-ai/DeepGEMM-Ascend。 - DeepEP:分布式通信库,昇腾版仓库为
deepseek-ai/DeepEP-Ascend。 - TileKernels:通用算子集合;FlashMLA:稀疏注意力算子;DeepSelect:数据筛选工具。
DeepSeek 同时确认,V4 系列训练中绝大多数算子基于 TileLang 实现——这批工具已经在最前沿的大模型训练里验证过,不是纸面工程。
为什么叫"对标 CUDA"
对应关系是直接的:英伟达生态里,CUDA 是编程语言层,cuBLAS 做矩阵加速,NCCL 做集合通信。TileLang 对应 CUDA 的语言层,DeepGEMM 对应高性能矩阵计算,DeepEP 对应集合通信。开发者一旦熟悉这套工具链,就不再被绑定在单一硬件上——"降本增效"落到实处,就是国产算力用得起来、用得便宜。
华为协同:性能接近理论上限
这不是简单的"代码搬家"。按 DeepSeek 的说法,华为团队深度参与了协同研发:双方共同完成昇腾 950 的 128 卡超节点方案落地,对计算、通信链路做了深度调优,多项测试显示计算与通信性能接近硬件理论上限。超节点是大模型训练的关键形态,这意味着昇腾平台已经具备支撑旗舰训练的实战能力。
谁受益,门槛在哪
直接受益的是在国产算力上训练和推理大模型的团队:不用从零造轮子,就能直接优化算子、加速训练。门槛有两道:硬件面向昇腾 NPU,没有昇腾环境很难上手;技术栈要求同时熟悉 TileLang 的 DSL 与底层算子调优。但更大的意义在产业信号层面——当顶尖模型团队开始把工具链建在国产硬件上,生态的飞轮就转起来了。