DeepSeek 开源昇腾「六件套」,TileLang 硬刚 CUDA!国产算力软件栈,真的要翻身了?
9 月 30 日DeepSeek 干了一件可能改变国产 AI 格局的事把训练自家大模型的那套底层软件全部开源给了华为昇腾芯片。中心是一套叫TileLang的编程语言外界直接把它称为「中国版 CUDA」。很多人盯着芯片性能看热闹但真正的行家一眼就看出DeepSeek 这次打的是英伟达最坚固的那道墙——不是硬件是软件生态。这篇文章我带你把这个「六件套」拆开揉碎讲清楚它为什么重要、能走多远以及作为开发者你该不该现在就开始学。一、9 月 30 日到底发生了什么一句话概括DeepSeek 通过官方微信公众号宣布开源一整套面向华为昇腾 AI 芯片的编程工具链共六个模块华为全程参与支持。关键信息先给你划重点六件套TileLang内核编程语言 五个配套组件DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect对标对象英伟达的 CUDA 生态官方定位DeepSeek 称这套工具是它「做 AGI 研究的核心工具」训练 V4 系列大模型的绝大多数算子都基于 TileLang 实现配套硬件双方联合调优了一个由128 块昇腾 950 芯片组成的「超节点」落地规模DeepSeek 计划在内蒙古建一个部署至少16 万块昇腾加速器的数据中心。为什么这则消息分量这么重因为它戳中了中国 AI 产业多年来的一个隐痛芯片能造出来但软件生态跟不上导致「有芯无用」。二、先破一个认知CUDA 的护城河从来不是芯片很多人以为英伟达的霸权靠的是显卡性能。错了。性能只是门票真正的护城河是 CUDA 软件生态。有几个数字能说明问题全球大约有400 万开发者写过 CUDA 代码十几年积累下来的优化算子库cuDNN、cuBLAS、TensorRT……、教程、社区问答、第三方工具形成了一道极高的迁移成本墙对很多团队来说选英伟达不是因为芯片最快而是因为「工具链好用、出了问题网上有人答」。所以美国出口管制卡住先进芯片真正卡的其实是——中国就算造出了够用的芯片没有配套软件开发者也不愿意迁移。这才是「卡脖子」最狠的一层。DeepSeek 这次的动作本质上是往这道墙上凿洞它把训练前沿大模型真正用到的那套算子库公开给昇腾等于替所有想上国产芯片的团队把最难啃的软件迁移活干了一大半。一个很形象的类比CUDA 生态是一套运营了十几年的「高速公路 服务区 导航 4S 店」体系。DeepSeek 这次不是修了一条新路而是直接给昇腾配上了全套服务设施让后来的人能直接上路跑。三、六件套拆解每一个都是训练大模型的刚需这套工具不是「为了开源而开源」的噱头它里面的每一个模块都是训练和推理一个前沿大模型绕不开的环节。我做成一张表给你看模块干什么用的对应英伟达生态里的角色TileLangTile 化内核编程语言写高性能算子的「语法」对标 CUDA CDeepGEMM-Ascend矩阵乘法算子库神经网络的核心运算对标 cuBLASDeepEP-Ascend大规模集群通信库多卡协同训练/推理对标 NCCLTileKernels通用向量运算与内存访问算子对标 CUDA 的基础 kernelFlashMLA多头潜在注意力MLA算子长文本场景对标 FlashAttentionDeepSelect数据过滤工具数据预处理环节看这张表你就懂了这六个模块恰好覆盖了「训练一个大模型」从数据、到计算、到通信的完整链路。而每一个模块都对应着 DeepSeek 此前已经为英伟达芯片开源的同名工具。也就是说DeepSeek 把自己的「英伟达全家桶」完整复刻了一份「昇腾版」。其中有一个细节特别值得注意——TileKernels 做到了「一套 Python 接口、两套底层」同一段代码跑在英伟达 GPU 上自动走 CUDA 实现跑在华为 NPU 上自动走昇腾实现由程序在运行时自己选择。这对开发者意味着什么迁移成本被压到了最低——你几乎不用改代码换个后端就行。四、重点讲 TileLang它凭什么敢叫「中国版 CUDA」六个模块里真正的 C 位是 TileLang。这是理解整件事的关键。4.1 它是什么TileLang 是一种Tile-based分块的内核编程语言。它的核心思想是写高性能算子时你思考的单元不是「一个个线程」而是「一块块数据」Tile。CUDA 编程为什么难因为你要手动管理线程、线程块、共享内存、显存层级写一个高效的矩阵乘法要操心一大堆底层细节。这是 CUDA 十几年来让无数人劝退的门槛。TileLang 的思路是把这些复杂度抽象掉你只需要描述「数据怎么分块、块与块之间怎么流动」编译器负责把它翻译成高效的底层代码。用更少的心智负担逼近硬件的性能上限。一个概念性的对比示意代码帮助理解思想非可运行源码# 传统 CUDA 思路你脑子里要装着一堆线程、block、shared memory# 一个矩阵乘法的 kernel 动辄上百行还容易写出低效实现# TileLang 思路描述数据分块 块间搬运即可tile_kerneldefmatmul(A:Tile[128,128],B:Tile[128,128],C:Tile[128,128]):# 把大矩阵切成 128x128 的块块内并行算块间按需搬运C[...]A B# 编译器自动处理调度、同步、内存层级、向量化注以上为帮助理解的示意伪代码非 TileLang 真实 API真实写法涉及更细的 tile 布局与流水线标注。把两者放在一起对比差异会更直观维度CUDATileLang编程单元线程 / 线程块 / 网格数据块Tile内存管理手动管理显存层级、共享内存编译器自动处理线程同步手动写同步逻辑极易出错自动调度与同步上手门槛高需理解 GPU 底层架构相对低描述数据流即可性能天花板极高充分优化可逼近理论极限高官方称关键算子达 95% 硬件极限生态成熟度十几年积累极成熟早期正在构建中一句话概括两者的关系CUDA 像手动挡掌控一切但门槛高TileLang 像自动挡牺牲一点极致自由度换取大幅降低的上手成本。对一个想要「更快上手国产芯片」的新生态来说后者显然更友好。4.2 它从哪来一个很多人不知道的背景TileLang 最早不是 DeepSeek 发明的而是 2025 年初由北京大学的研究者提出。DeepSeek 在英伟达老芯片上做了充分验证后把它当成了自己的主力工具随后一路推进到昇腾平台。这个出身决定了它的一个独特优势——它不绑定任何一家硬件厂商。TileLang 的位置在「模型」和「芯片」之间芯片厂商只需要提供编译后端和底层指令接口上层基于 TileLang 写的算子生态就能复用。这句话的分量我们放到第六节专门展开。4.3 怎么上手核心仓库已经全部公开这套工具不是 PPT 发布是真金白银地放到了 GitHub 上。想上手核心仓库先 clone 下来# TileLang 昇腾后端内核编程语言gitclone https://github.com/tile-ai/tilelang-ascend.git# DeepSeek 昇腾矩阵乘法算子库对标 cuBLASgitclone https://github.com/deepseek-ai/DeepGEMM-Ascend.git# DeepSeek 昇腾通信库多卡协同训练/推理对标 NCCLgitclone https://github.com/deepseek-ai/DeepEP-Ascend.git需要提醒一句这几个仓库仍依赖华为的 CANN 计算软件层才能跑起来也就是说上手前提是你手上得有昇腾的硬件环境或云资源。对绝大多数人来说现阶段更现实的是「先读代码、先理解思想」而不是急着跑通。五、性能到底行不行看数据别听口号「对标 CUDA」这话谁都会说关键看数字。DeepSeek 这次给了几个硬指标测试项实测性能相对硬件理论极限昇腾 950 稀疏注意力算子读取/输入阶段410 TFlops95%昇腾 950 稀疏注意力算子生成/逐步输出阶段360 TFlops83%翻译成人话在关键算子上DeepSeek 已经把昇腾 950 压榨到了接近硬件物理极限的程度。这背后的工程意义是什么要知道一块芯片的「纸面算力」和「实际能跑出来的算力」之间往往隔着巨大的差距——差的这一截就是软件优化的功夫。能把利用率做到 95%说明这套软件栈在「充分释放硬件性能」这件事上已经达到了相当高的成熟度。不过这里我必须给你泼一盆冷水保持冷静第六节细说这些数字目前是 DeepSeek 单方面公布的还没有经过第三方独立验证。真实世界的采纳情况要看它是否稳定、可扩展、且「DeepSeek 之外的团队」也能用好。六、真正的深意国产芯片第一次「共享算子生态」如果只看到「华为芯片 DeepSeek 软件」你就只看到了第一层。往深一层看这件事的战略意义大得多。长期以来国产 AI 芯片最大的问题不是「造不出来」而是「各自为战」寒武纪、海光、摩尔线程、沐曦……每一家都有自己的一套软件体系模型厂商每适配一家芯片都是一次全新的迁移开发资源被反复消耗没有统一的算子生态开发者就不愿意来开发者不来生态就更荒——这是个死循环。而 TileLang 的位置恰好打破了这种割裂。因为它不归属任何一家硬件厂商芯片厂商只需要提供「编译后端 底层指令接口」上层基于 TileLang 写的算子生态就能被所有芯片复用。昇腾这次开放了Ascend C 与 PTO ISA 底层指令体系就是迈出了「让算子生态跨芯片复用」的第一步。这意味着什么如果这条路走通未来国产芯片可能第一次拥有一个「共享的算子生态」——就像英伟达的 CUDA 生态里开发者写一次代码N 卡都能跑。这对整个国产 AI 产业的想象力远超任何单款芯片的性能参数。用一句大白话总结DeepSeek 这次不只是在帮华为它是在试图给整个国产芯片产业铺一条「共享的软件地基」。七、这不是突袭是一场蓄谋已久的布局如果你以为这是 DeepSeek 一拍脑袋的「突袭」就把它看浅了。把时间线拉出来你会发现这是一场谋划了一年多的「明牌」时间事件信号2025-08DeepSeek 发布 V3.1采用 UE8M0 FP8 数据格式官方明说「为下一代国产芯片设计」2025-09-29V3.2-Exp 发布并开放算子实现昇腾同日完成适配TileLang-Ascend 当天开源模型方与芯片方开始深度协同2026-04-24V4 预览版发布华为宣布 V4 在昇腾首发多家国产芯片厂商跟进适配国产芯片首次承接前沿模型「首发」2026-09-30开源昇腾「六件套」联合调优 128 卡超节点把训练底层工具链整体开放这张时间线透露了一个清晰的信息DeepSeek 和华为的协同是从「模型设计阶段」就开始的而不是事后补适配。尤其 2025 年 8 月那个「UE8M0 FP8」格式的细节很妙——DeepSeek 在设计模型时就直接按照国产芯片的能力来定数据格式。这意味着未来国产芯片不再是「追赶者被动适配前沿模型」而是「从一开始就被纳入模型设计」的参与者。角色变了格局就变了。八、冷静一点现实里的三道坎一道都绕不过去说了这么多「重大意义」如果不讲清楚局限就是不负责任。摆在 TileLang 昇腾面前的三道坎一道比一道硬第一道坎性能差距依然存在。更早的公开报告显示华为昇腾 910C 的推理性能大约是英伟达 H100 的60%。昇腾 950 虽然更强但至今没有经过大规模独立基准测试。纸面数据再漂亮也要等第三方实测说话。第二道坎软件生态的差距是全方位的。DeepSeek 开源的六件套解决的是「核心算子」这一环。但 CUDA 生态里还有 profiler性能分析器、调试工具、PyTorch 算子覆盖率、社区知识沉淀……这些「周边」的完善程度昇腾离 CUDA 还有相当距离。换芯片从来不只是换几个算子是换掉一整套日常工具链。第三道坎地缘政治的不确定性。全球开发者对这套工具的态度是分裂的——海外团队会担心长期支持、供应链、合规风险国内团队虽然热情高但要真正迁移生产环境也需要时间和成本。所以我的判断是这是一次意义重大的「破冰」但离「翻身」还有很长的路。它解决的是「从 0 到 1」的可用性问题而「从 1 到 100」的生态繁荣需要的是年复一年的迭代、文档、bug 修复和第三方验证——这恰恰是英伟达花了十几年才攒下的家底。九、作为开发者你该现在就开始学吗这是大家最关心的问题我分人群给建议如果你在国产芯片相关赛道AI 基础设施、云厂商、信创项目现在就该关注。这是趋势早学早占位。TileLang 的门槛比 CUDA 低上手曲线更友好值得投入时间。如果你是普通应用层开发者写业务、做 Web、做 App暂时不用焦虑。你离「手写算子」还很远你的日常是调 API、写业务逻辑这套东西跟你关系不大。保持关注即可。如果你想在 AI 底层方向建立差异化竞争力这是一个值得押注的时间窗口。国产算力软件栈的人才未来几年会很稀缺。现在入局窗口期正好。不过无论哪类人记住一条不要因为「国产」两个字就盲目乐观也不要因为「差距」两个字就盲目唱衰。理性看待——它在解决真问题但离「全面对标 CUDA」还早。十、结语软件才是这场博弈里最被低估的胜负手很多人看 AI 芯片之争只盯着晶体管数量、算力 TFLOPS。但 DeepSeek 这次用行动提醒了所有人一个朴素的事实芯片决定下限软件决定上限。英伟达用 CUDA 生态筑起了十几年的护城河而 DeepSeek 开源昇腾六件套是中国团队第一次系统性地、从软件层面对这道护城河发起正面冲击。成败尚早但方向清晰了。对普通开发者来说这轮变革最值得记住的一句话是当「硬件」开始可替代「软件生态」就成了新的主战场——而生态从来都是靠无数个开发者一行一行代码、一篇一篇文档垒起来的。国产算力软件栈能不能真正翻身答案不在 DeepSeek 一家身上而在每一个愿意进来踩坑、贡献、复用的开发者身上。你怎么看这波国产算力软件栈的突围是「真破冰」还是「概念先行」评论区聊聊你的判断。本文信息综合自 DeepSeek 官方公告、Reuters、Bloomberg、SCMP、The New York Times、The Next Web 等公开报道数据截至 2026 年 10 月 2 日。性能数据为 DeepSeek 官方口径尚未经第三方独立验证请理性参考。