据MarkTechPost报道,该媒体于2026年9月15日发布一篇教程,介绍NVIDIA cuDNN的Graph API以及cuDNN Frontend的使用方式。教程从框架底层展开,把计算描述为操作图,由cuDNN选择执行引擎,再让开发者自行控制这一选择。
报道称,教程中构建的每个内核都采用同一套表达方式:按维度和步幅声明张量,在其上串联操作,然后运行五步构建流水线,依次为验证、构建操作图、创建执行计划、检查支持和构建计划,最后针对指针变体包执行。整个流程在单个Colab GPU上运行,每个结果都与PyTorch参考实现比对,以同时检查融合是否正确以及融合的代价。
教程主题逐层递进,从单个融合卷积开始,延伸到跨引擎配置的自动调优、FP8风格epilogue、注意力、计划序列化、动态形状以及CUDA graph捕获。报道称,这些主题建立在彼此之上,展示cuDNN Frontend的Graph API从基本融合到更复杂执行控制的能力范围。
在代码部分,教程先安装nvidia-cudnn-frontend并定位libcudnn。其处理首次运行常见问题的方式是,先强制PyTorch加载其捆绑的cuDNN,再显式预加载共享对象,使前端自身的dlopen调用解析到已在进程中驻留的库。随后教程报告GPU计算能力,据此选择bfloat16或float16,创建cuDNN句柄,并定义声明张量、标量以及构建、执行和基准测试所需的辅助函数。
报道还提到,教程在构建图时可使用启发式模式,并通过策略参数控制build_plans,同时提供工作区分配和基准测试函数,用于测量内核执行时间与TFLOP/s。原文以代码块形式给出完整示例,并说明当环境缺少pip安装的cuDNN包时,会回退到系统cuDNN。