DeepSeek开源昇腾基础组件,与昇腾共建AI芯片软件生态

9月30日,DeepSeek正式开源面向昇腾算力平台的基础设施组件,包括TileLang高级语言编译工具、高性能计算库与分布式通信库,与此前面向GPU平台开源的组件形成对应。DeepSeek团队面向华为昇腾平台开源发布基础设施加速库,为中国AI软件生态提供了新的算力平台选择。
此次开源中,DeepSeek发布了DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库组件以及DeepEP分布式通信库。昇腾提供稳定、开放的Ascend C API接口,使用户能够对访存路径及计算流水线进行深度调优,完成高性能算子开发。同时,依托开放Ascend C编程接口与PTO ISA底层指令体系,支持了DeepSeek的TileLang编程开源工作。昇腾生态兼顾不同开发范式,既支持资深开发者进行精细的手工调优,也支持TileLang等高级语言的编译对接。
华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,支持超低时延推理和前沿基座模型的大规模训练需求。基于全互联的UBL128超节点,昇腾提供了ASC-COMM高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。DeepSeek团队开发了高性能DeepEP通信库,涵盖EP/CP/PP/FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到Dispatch 375 GB/s、Combine 347 GB/s的通信性能,接近硬件上限。
为支持广泛的开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将此次联合创新的成果在CANN社区开源,包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架纯模型性能可实现TPOT=5ms,每卡输出吞吐2469 tokens/s;TPOT=10ms,每卡输出吞吐5102 tokens/s。(注:Benchmark数据均基于Offline推理模式采集,不包含Serving调度和框架负载均衡影响。ContextLength = 128K,Dspark 投机接受率 0.85,profiling链接详见附录:DeepSeek-V4.1-Flash超节点部署推理优化实践)
基承其本,算展其用。华为昇腾平台将与DeepSeek等前沿模型团队,持续深耕芯模协同,联合创新。以AI算力底座承载模型能力,深度适配,双向奔赴,打通推理到训练的全链路,携手打造开放、高效、易用的AI软件生态。
https://gitcode.com/KunpengSDK/agentENV/blob/main/agentenv-kunpeng-optimization-practice.md
https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/agent/DeepSeekV4.1-Flash-Model-Agent.md
https://gitcode.com/cann/cannbot-skills/tree/master/plugins-official/tilelang-op-orchestrator
本文由华为提供,量子位获授权转载,观点归原作者所有。


华为P70闪拍功能意外爆火,CTO亲自下场解读技术原理

三星明星机又悲剧!万元折叠屏,玩不过2天,组团黑屏,蜜汁凸起
折(zhe)着折(zhe)着就折(she)了

7分钟分析人类全基因组,他们刷新全球纪录,此前最快也要24小时

本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

