据MarkTechPost 2026年9月10日报道,英伟达详细介绍了 BioNeMo 推理运行时 BioIR,称其可在 NVIDIA GPU 上加速受支持的结构预测模型,同时保留标准 PyTorch 工作流。在一项 1000 个人类二聚体靶标的基准中,BioIR 加速的 Boltz-2 在 8 张 H100 上实现每 GPU 小时 5.85 万残基的折叠吞吐,较开源实现提升 2.90 倍。

报道称,BioIR 已用于 AlphaFold 数据库扩展,生成覆盖 4777 个蛋白质组的蛋白复合物结构,涉及约 3100 万个候选复合物,其中 181 万个作为高置信度预测发布。BioIR 现已作为开源 GitHub 仓库提供,包含带预编译 CUBIN 的 wheel 包。运行时需要 Python 3.12+、兼容的 NVIDIA GPU 和驱动、分阶段模型检查点及每条链的 A3M 多序列比对,不需要 nvcc、CUDA 源码、CMake 或 CUDA 工具包。

BioIR 支持 Boltz-2、OpenFold2 和 OpenFold3 等结构预测模型,并针对通用推理栈未充分优化的操作,包括 Pairformer 和 Evoformer 栈、三角运算、成对注意力、扩散 Transformer 和原子级模块。模型仍为普通 torch.nn.Module,无需引擎构建或导出步骤。它提供端到端处理器,将 InputRequest 经过解析、分词、特征生成、GPU 推理和 PDB 或 mmCIF 写入;也支持直接 PyTorch 集成,允许构建受支持模型或在自定义代码中复用优化模块。每个蛋白链需要 A3M MSA,模板需手动提供,因为 BioIR 不运行 HHsearch 或 HMMsearch;处理器支持配体结构预测,但不支持配体亲和力预测。

加速分三层。内核选择根据模型配置、GPU、数据类型和张量形状,在 BioIR 自定义、cuEquivariance 或 PyTorch 回退实现之间选择;模块优化通过 optimize() 为兼容模块启用 CUDA Graph 捕获,减少启动开销;流水线扩展使用 Ray 执行器,在每张可见 GPU 上放置一个完整模型副本并分发独立输入,使 CPU 阶段与 GPU 折叠重叠。报道指出,Ray 不会把单次前向传播拆分到多张 GPU,副本模式扩展的是工作队列而非单个靶标;上下文并行折叠已规划但尚未提供。

端到端基准使用 1000 个人类二聚体靶标,合并序列长度低于 2800 残基。BioIR 加速的 Boltz-2 与 torch 编译的开源 Boltz-2 在 8 张 H100 80GB 上对比,两者使用相同靶标、已分阶段 MSA、推理配方(3 次 recycle、200 个采样步、5 个扩散样本)和 GPU 配置。BioIR 完成全部 1000 个靶标,每分配 GPU 小时交付 5.85 万成功折叠残基;公开实现交付 2.02 万残基,并在 29 个靶标上耗尽内存。按残基归一化吞吐计算,提升 2.90 倍。报道强调,这些是特定数据集和硬件上的折叠阶段测量,不包括 MSA 生成、预处理 CPU 分配、存储、数据传输和重试,不应推广到所有 BioIR 支持模型或数据集。

将基准线性外推到 100 万个可比靶标,BioIR 估计需要 11 MWh,公开实现需要 35 MWh(按 8 GPU TDP 当量);按全节点最大功率当量计算,分别为 21 MWh 和 64 MWh。这些是基于额定功率、仅折叠阶段的 IT 设备估算,并非实际计量,也不包括 PUE 等数据中心开销。报道称,每百万靶标节省 23 至 43 MWh,对蛋白质组规模任务具有实质意义。