据Hugging Face Blog 2026年10月9日发布的文章,Ai2人工智能基础设施团队称,该团队负责为Ai2的大规模分布式训练提供GPU算力,并已用一套包含GPU时间预算、分层公平份额分配和时间切片契约的新系统,替换原有的基于优先级的调度器。Ai2管理数千块NVIDIA H100、B200和B300 GPU,集群规模从88块到1024块不等,服务约150名内部研究人员,覆盖LLM和VLM训练、机器人强化学习仿真以及科学智能体后训练等方向。
团队将调度任务描述为四层指标构成的“金字塔”。最底层是可用性,即硬件健康并可供工作的时间比例;其上是占用率,即可用时间中分配给特定工作负载的比例;再往上是影响力,即最有价值的工作负载被选中获得资源的频率;顶层是利用率,即GPU容量在工作负载生命周期内被使用的比例。文章称,此次调整针对的是提升调度决策的“影响力”。
Ai2的GPU需求远超供给。按照提交的工作负载计算,该机构在任何时刻未满足的GPU请求量都是可用GPU的2至3倍,相当于每块可用GPU小时有2至3个研究工作负载在竞争。
历史上,Ai2使用基于优先级的调度器,并允许工作负载选择不被抢占。每个团队对可免于抢占的工作负载设有并发GPU上限,可抢占工作负载则可在空闲GPU上超出该上限。文章称,这种策略产生了可预测的问题:一是出现GPU“占坑”,用户停放无操作工作负载,以便需要时连接;二是优先级膨胀,最终100%的已调度工作负载都使用高优先级,较低优先级完全得不到GPU时间。由于可抢占性可选,值班工程师还花费大部分工单响应时间,协商关闭运行在已知维护问题主机上的不可抢占工作负载。
文章说,这些问题出现时,团队起初难以识别根源。最初尝试更严格控制优先级设置,并最终绕过基于优先级的调度器,把GPU垄断权明确分配给重要项目。团队后来意识到,这构建了一个观察“公地悲剧”的实验室:个体争夺稀缺共享资源,追求个人最优,却导致全局非最优并滥用资源。
文章提到,资源分配研究中的核心问题是,用户往往比组织更了解自己工作的价值,但有动机隐藏价值或占用资源,即使这样做会损害总体表现。文章引用Ghodsi等人2011年提出Dominant Resource Fairness的论文中的一则轶事:一家搜索公司只向能保证高利用率的作业提供专用机器,随后发现用户会在代码中撒入无限循环,人为抬高利用率。文章称,硬件在变,但使资源分配复杂的基本问题持续存在。
对于公地悲剧,经典解法是将共享资源私有化,让所有者有动机最大化其财产价值。Ai2曾把一组GPU的垄断权分配给团队,但文章认为这过于粗糙,导致GPU因研究季节性而闲置:不同团队准备运行实验和训练的时间不同,垄断会使某些时段没有作业可执行,而其他团队仍在等待容量。文章称,团队当时在手工求解一个背包问题,试图把动态变化的研究需求放进静态计划,希望保留所有权激励。