9月30日,据雷峰网报道,DeepSeek宣布其算子开发工具链原生支持华为昇腾950,TileLang及DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect同步推出昇腾版本。报道称,这是国产算力首次在核心算子工具层面做到与英伟达生态能力对标。

算子开发长期是AI底层门槛最高的工作之一。雷峰网称,底层算子不达标时,芯片算力利用率可能只有20%,写算子的目标是把硬件利用率提高到95%以上。过去手写CUDA性能高但绑定英伟达、难移植,cuBLAS等厂商算子库灵活差,Triton等高层DSL对昇腾、AMD等非英伟达硬件原生支持不足。TileLang以多级分块为核心,开发者声明数据块在哪里计算,编译器自动完成搬运和线程同步,性能直逼手写CUDA,主攻GEMM、FlashAttention、稀疏MLA等大模型核心算子。

TileLang复用Apache TVM编译能力,采用前后端解耦架构,新芯片适配只需新增目标后端。雷峰网称,基于TileLang优化的DeepSeek V3.2稀疏注意力TopK算子比原生PyTorch快2至20倍,在H100上MLA解码性能超过PyTorch原生实现和Triton,追平cuBLAS与官方FlashAttention,在AMD MI300X上也接近硬件极限。

DeepSeek将国产芯片置于核心战略位。9月21日,据《The Information》报道,梁文锋在投资人闭门会上称,使用华为或其他国产芯片训练模型是公司当前“最大的赌注之一”,必须成功。彭博社此前报道,DeepSeek已投入25.6亿美元订单,采购至少16万颗华为昇腾950DT,用于内蒙古乌兰察布在建的吉瓦级数据中心,最快2026年第四季度交付。这批芯片主要面向推理侧,训练仍主要依赖英伟达。

迁移面临三项难关。训练软件栈需重写,DeepSeek-V3、V4训练代码原为英伟达架构编写,需将cuBLAS、NCCL调用替换为Ascend C、HCCL,并验证FlashMLA、DeepEP、DeepGEMM在昇腾950上的性能。通信原语从NCCL到HCCL在API设计、性能曲线、容错模型上不同,适配偏差可能导致整轮训练静默失效。芯片产能上,出口管制同样制约华为扩大Ascend 950产能;知情人士称,受先进内存等核心元器件短缺影响,华为面临生产瓶颈,DeepSeek短期仍无法完全摆脱英伟达硬件依赖。

另据量子位9月30日发布的直播回顾,西门子Xcelerator中国销售与生态成功负责人顾欣与阿丘科技创始人兼CEO黄耀讨论工业AI落地。黄耀以半导体晶圆切割为例称,识别不准会直接切坏晶圆;阿丘科技用多模态模型提升识别精度和泛化能力,并把设备工程师部分经验沉淀进智能体,案例中设备OEE和产能可提升25%左右。顾欣表示,工业AI最关键的是具备工业级可靠性,判断标准要可信、可追溯、可量化。

黄耀认为,工业应用高度碎片化,不同门类、场景、工艺差异大,同一企业不同工厂的设备、数据、流程和规范也可能不同;工业数据少、难获取,还涉及工艺和商业机密,模型到新现场需重新适配。顾欣称,西门子Xcelerator希望做好连接器和放大器,把技术接到真实需求,并在方案验证后接入集成、交付和生态资源;西门子成都工厂与阿丘科技通过PoC共创验证。黄耀判断,当前工业AI机会来自高价值、数据ready、技术可行交叉点,典型是围绕良率、工艺、OEE的单点应用。