腾讯科技 3小时前
DeepSeek加速向华为靠拢
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文|苏扬

编辑|晓静

9 月 30 日,DeepSeek 宣布开源面向华为昇腾的基础设施组件,涵盖 TileLang 算子编程语言及其编译支持、计算库和分布式通信库,并强调:" 所有组件与此前面向英伟达平台的开源组件一一对应。"

DeepSeek 正将支撑自家模型研发的核心工具和算子能力,系统地扩展到昇腾平台。双方的合作,由模型适配进一步深入训练与推理所依赖的基础软件。

官方还披露,DeepSeek 与华为共同推进基于昇腾 950 的 128 卡超节点方案,并对计算与通信进行深度优化。

01 让核心研发工具有另一条硬件路线

这套开源里,最关键的角色是 TileLang。

大模型研究中的新想法,需要通过算子变成芯片能够执行的计算。算子开发越复杂,研究者验证新结构、优化训练效率所需的时间就越长。DeepSeek 对 TileLang 的期待,是让开发者用更简单的语言编程,同时保留充分利用芯片性能的能力。

按照 DeepSeek 的介绍,相较 CUDA,TileLang 能够简化代码逻辑、提高开发效率;相较其他同类高级语言,其编程模型能够更充分地发挥芯片特性。这条路线先在英伟达平台得到验证,如今已承载 V4 系列模型训练中大部分算子的实现,是 DeepSeek 开发高性能算子的核心工具。

此次昇腾版本封装了底层 Ascend C 指令。DeepSeek 称,目前训练中使用的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。

这项进展的意义,是 DeepSeek 能够将已经熟悉的研发工具延伸到另一种硬件上,减少为不同平台重复开发的负担。昇腾获得的支持,也更贴近模型团队自身的训练需求。

但编程工具只是其中一环,模型还需要高效执行具体计算,并在多张卡之间交换数据。

因此,此次开放的组件还包括加速矩阵运算的 DeepGEMM、处理跨设备通信的 DeepEP,以及覆盖向量计算与访存、稀疏注意力,以及用于注意力索引和采样的 Top-K 选择等操作的 TileKernels、FlashMLA 和 DeepSelect。它们为常见任务提供可复用的实现,让开发者不必逐项从头优化。

" 一一对应 " 也由此有了实际含义。部分项目已经对齐上层接口,例如 TileKernels 支持同一套 Python 接口在英伟达 GPU 与华为 NPU 上运行,底层实现根据硬件选择。

不过,接口能够复用,性能仍需针对硬件打磨。DeepSeek 在公告中感谢华为团队给予 " 毫无保留的大力支持 ",双方围绕 128 卡超节点共同优化计算与通信,正是为了让这些软件能力在具体系统中发挥作用。

DeepSeek 称,多项关键测试用例的性能已接近硬件上限。这些成绩仍属于特定测试条件下的结果,但显示双方的工作已经进入性能深度优化阶段。

此次进展之前,昇腾生态已围绕 DeepSeek 模型开展多轮适配。

02 从推理服务,逐步进入模型研发

2025 年 8 月,DeepSeek 发布 V3.1 时,解释其 UE8M0 FP8 设计面向即将发布的下一代国产芯片。虽然没有点名华为,但这一表态说明,国产硬件需求已开始进入模型团队的技术设计考量。

2025 年 9 月 29 日,DeepSeek-V3.2-Exp 发布,引入稀疏注意力机制,并开放相关算子实现。同一天,TileLang-Ascend 开源,围绕昇腾建设高级语言开发能力的工作由此公开。

2026 年 4 月 24 日,V4 预览版发布,昇腾适配已延伸至推理和训练侧。开放原子开源基金会披露,相关实践包括推理优化、Ascend C 融合算子,以及训练优化和续训练;TileLang-Ascend 也发布了 V4 算子。

此次 DeepSeek 明确将适配范围对齐自家训练使用的 TileLang 算子,并将计算与通信组件成套开放,同时披露了与华为围绕昇腾 950 开展联合优化的进展。

从已发布模型的部署适配,到面向新结构的算子优化,再到此次基础设施组件开放,昇腾对 DeepSeek 的支持正进一步深入模型研发所需的软件层。

03 扩充算力,需要跨过软件这一关

9 月 24 日,腾讯科技报道,DeepSeek 规模为 500 亿元的第二轮融资已接近结束,但部分审核仍在进行,具体落地时间尚不确定。路透社此前也报道,DeepSeek 已聘请中信证券筹备潜在的科创板 IPO,上市时间及募资规模尚未确定。

资金可以支持研发和基础设施投入,但新增硬件能否转化为有效算力,还取决于软件适配与运行效率。

据 The Information 报道,梁文锋在近期投资者会议上表示,DeepSeek 将超过 70% 的算力用于模型训练,留给推理的算力不足 30%。这也解释了,为训练所依赖的核心工具增加硬件选择,具有怎样的现实分量。

对 DeepSeek 而言,昇腾上的工具与组件越完善,未来选择算力平台时,需要重新投入的工程成本就可能越低。对华为而言,与模型团队共同优化,有助于让芯片软件更快跟上模型结构变化,将适配经验用于后续产品。

开源又使这种合作具备向外扩展的可能。DeepSeek 表示,希望 TileLang 昇腾版本能为更多 AI 芯片建立高可用软件生态起到示范作用。如果其他团队可以复用这些工具,更多国产芯片承接前沿模型的门槛也有望降低。

从组件开源到稳定承担大规模生产任务,仍有工作要做。DeepEP 昇腾版还列有开发中的功能,此次公告也未披露 V4 已在昇腾上完成全流程大规模训练,但可以看出 DeepSeek 正与华为一起完善一条能够持续支持模型研发的硬件路线。

评论
飞行机o
1小时前
怪不得越来越难用
大家都在看