据MarkTechPost报道,字节跳动Seed团队与清华大学智能产业研究院(AIR)近日发布CUDA Agent,这是一个用强化学习训练大语言模型编写GPU内核的系统,在KernelBench基准上实现了98.8%的通过率,并使96.8%的内核运行速度快于编译器torch.compile,几何平均加速达2.11倍。
该研究针对的问题在于:现有前沿模型已能生成正确CUDA内核,但速度偏慢。以基础模型Seed1.6为例,它在KernelBench上能通过74%的任务,但只有27.2%的内核比torch.compile更快,几何平均速度仅0.69倍,即总体慢于编译器。CUDA Agent将模型置于真实的CUDA开发环境中,配备性能剖析、正确性检查和权限锁定沙箱,再用PPO算法训练150步,上下文长度为131,072个token。
结果显示,在250项任务的KernelBench基准上,CUDA Agent的通过率为98.8%,比eager模式快的内核占98.4%,比torch.compile快的占96.8%;几何平均加速分别为2.60倍和2.11倍。在最难的Level-3任务上,通过率为94%,比torch.compile快的比例为90%,几何平均加速1.52倍,比Claude Opus 4.5和Gemini 3 Pro高出约40个百分点。
不过,该智能体并未完全开放。据报道,训练好的智能体未发布,系统基于Seed1.6构建,这是字节跳动的专有混合专家模型,激活参数230亿,总参数2300亿,论文未提供权重。公开内容仅包括CUDA-Agent-Ops-6K数据集、SKILL.md规格说明以及奖励和预热方法。
复现门槛较高。仅性能剖析沙箱就使用了128块英伟达H20 GPU,全面复现只在前沿实验室、GPU云和大型基础设施团队可行。中型团队可复用部分组件,如数据集、里程碑奖励、防奖励黑客约束和技能规格说明,配合开源基座模型使用。
数据合成方面,研究团队从PyTorch和Transformers库中爬取参考算子,让大语言模型采样至多5个torch算子类并堆叠成融合层。过滤条件包括:算子需在eager和compile两种模式下都能执行、输出确定且非常量、eager模式运行时间在1毫秒至100毫秒之间。与KernelBench任务AST相似度高于0.9的样本被移除。最终得到的CUDA-Agent-Ops-6K数据集包含6000个样本,其中83.77%为双算子组合。
训练环境与奖励机制也值得关注。智能体循环复用了OpenHands工具集,包括Bash、读写、编辑、搜索等操作,采用ReAct模式。SKILL.md规范指导模型剖析PyTorch模型、用自定义内核改写model_new.py、在GPU沙箱中编译,并迭代至内核比torch.compile至少快5%,误差容限设置为atol=1e-2、rtol=1e-2。为防止奖励黑客行为,系统设了五道防线:权限锁定的验证和剖析脚本、禁止torch.nn.functional回退的上下文管理器、对五个随机输入的检查、带设备同步和预热的剖析、禁用网络搜索工具。奖励是离散值,r∈{−1,1,2,3}:正确性失败为−1,同时快于eager和torch.compile超过5%得3分,仅快于eager得2分,其余为1。
论文结果表显示,Level-2(算子序列)表现最强:通过率100%,快于torch.compile比例100%,几何加速2.80倍。但报道同时指出一处不一致:论文摘要和引言称Levels 1-3的快于编译器的比例分别为100%、100%、92%,而Table 1报告的是97.0%、100.0%、90.0%。MarkTechPost称Table 1为主结果表。
消融实验显示各组件的重要性:移除智能体循环后,快于torch.compile的比例从96.8%跌至14.1%;改用原始速度比奖励为60.4%;不做拒绝采样微调(RFT)为49.8%且奖励崩溃;不做价值预训练为50.9%且轨迹失控。
案例研究展示了策略学习到的具体优化:一个对角矩阵乘法被重写为行缩放,获得73.31倍于torch.compile的加速;一个矩阵乘法-除法-求和-缩放链被重排融合,加速24.04倍;一个ResNet BasicBlock将批归一化折叠进卷积并调用cudnnConvolutionBiasActivationForward,加速3.59倍。