据科技媒体MarkTechPost报道,Meta本周推出了一项名为MetaRoCE的全新RDMA传输协议,专为AI负载在普通以太网上设计。该协议被描述为“白纸式”的RDMA传输,打破了标准RoCE依赖无损网络的假设,将排序、路径选择和恢复功能从交换网络转移到网卡侧。Meta计划通过开放计算项目(OCP)发布该协议的规范、参考软件实现和合规测试套件。
随着集群规模扩展到数十万GPU,网络已成为训练模型的关键瓶颈。集体通信操作如all-reduce和all-to-all需要同步数千个加速器,最慢的传输决定了整个任务的节奏。标准RoCE期望网络按序交付所有帧,依赖优先级流控(PFC),且不鼓励大规模多平面网络中的包喷洒。MetaRoCE则相反,它将网络视为有损的,利用网卡处理乱序、多路径和丢包恢复。据Meta介绍,其核心设计包括:默认乱序交付,数据包到达后直接写入最终内存位置,无需重排序缓冲区;原生多路径,每个路径有独立的UDP源端口、窗口和往返时间估计,可将流量从坏路径移开;采用选择性确认位图精确重传丢包;拥塞控制由发送端和接收端共同驱动,接收端在确认中返回带宽分配提示;不依赖包修剪、网络内遥测或信用流控,仅需标准交换机都具备的ECMP和ECN标记;连接状态不再随队列对数量爆炸。
在性能验证中,Meta在64节点AMD GPU集群上使用RCCL集合通信库将MetaRoCE与RoCEv2进行了直接对比。在all-reduce和all-to-all中,MetaRoCE实现了更高的吞吐量和更低的流完成时间。在1%丢包率下,它仍能维持约86%的吞吐量;即使丢包率达到10%,也继续提供有效带宽,而非崩溃。在4平面和8平面拓扑中,最多4000条并发连接的测试表明,吞吐量随平面数量线性扩展,模拟平面故障时也能优雅收敛。
不过,MetaRoCE目前尚不可部署。Meta可能在2026年OCP全球峰会上正式发布该规范、DPDK优化的软件参考实现以及生产级合规框架。硬件支持仍处于早期,Meta已在AMD Pensando可编程网卡上验证,其他厂商的实现正在进行中。目前,这更多是一个网络架构决策,而非可以直接采购的产品。