据量子位报道,阿里巴巴集团CEO吴泳铭9月22日在云栖大会上介绍新一代AI芯片真武V900,称其为目前中国算力性能最强的AI芯片,性能达到M890的3倍。次日,平头哥公布AI软件栈T-Head SAIL最新开源进展,进一步扩大框架适配、加速库、工具链和通信库等领域的开放范围。

平头哥将AI芯片比作发动机,软件栈相当于变速箱、传动系统和驾驶系统。真武AI芯片已服务20多个行业的650多家客户,蚂蚁、小红书、小鹏汽车等企业已开始使用T-Head SAIL。小红书基于T-Head SAIL开源代码开发模型迁移与算子优化Agent,用于加速生成式推荐模型在真武上的部署。

今年7月WAIC上,平头哥宣布启动T-Head SAIL开源,向开发者提供SDK、驱动、性能分析与调试工具以及技术文档下载。两个多月后的云栖大会,团队公布进一步进展。已开源项目包括PyTorch-for-sail框架适配、sailify源码迁移工具、Triton-for-sail算子开发工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等计算加速项目。

平头哥半导体软件生态资深总监陆生华表示,从业务角度看,客户最大的诉求是迁移成本有多大。T-Head SAIL首先要解决迁移问题,让开发者继续沿用熟悉的模型开发方式,由迁移工具辅助处理已有代码,再根据新硬件完成必要适配。迁移跑通后还要继续优化性能,开发者可查看DeepGEMM-for-sail、FlashAttention-for-sail等开源项目实现,根据自身模型和业务负载继续修改。

新模型发布当天能否在算力平台上使用,也是客户对算力平台的期待。据现场演讲披露,截至2026年9月,平头哥在ModelScope上已提供39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超过34.8万次。TensorFlow、JAX适配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等通信组件和调试监控工具仍在推进开源。

客户实践中,小鹏借助SAIL将原先运行在GPU平台上的业务模型迁到真武云端集群,开展智能驾驶模型训练,并利用性能分析工具定位训练瓶颈,围绕算子和框架优化。SAIL支持C++、Triton、TileLang等开发方式。蚂蚁集团推理服务团队已基于SAIL在真武810E和M890上完成主要前沿模型的推理适配,接下来继续推进量化、推理阶段分离、专家并行负载均衡、稀疏注意力接入等工作。

陆生华提到一个矛盾:客户想针对芯片开发高性能算子,又需要保护自己的算法和知识产权。开放软件代码和架构信息后,客户可自行完成相关工作,核心业务逻辑留在内部,愿意公开的工具和优化则可提交给社区。T-Head SAIL建立了贡献流程,开发者可提出问题、修改代码、提交贡献,经过自动化测试和维护者、社区评审后合入主线,随版本发布。开源后已有阿里内部和外部客户提交代码贡献。

平头哥收到的反馈包括希望贡献项目、需要更多硬件架构信息以开发定制算子,以及希望新模型、新框架得到更快支持。真武架构信息已经公开,社区治理和贡献规则仍在完善;团队正推动软件组件解耦发布,并将面向真武的适配成果逐步提交回上游社区。陆生华认为,软件的成熟度和客户对二次开发的需求共同促成了此时的开放。从2019年含光800、2021年倚天710到真武系列,平头哥已在真武M890上完成两代完整芯片交付。

把适配和优化提交回PyTorch、vLLM、Triton等上游社区,可让真武支持随主流软件一起演进。云栖大会上,吴泳铭明确阿里将长期投入AI模型、AI芯片和AI云。2025年2月,阿里宣布三年内至少投入3800亿元建设云和AI基础设施,随后又提出增加投入。陆生华介绍,平头哥正与千问团队合作,探索让模型生成高性能算子。SAIL全称Seed of AI Library。