研究 2026-10-10 · 原文发布 10-09

Ai2 用 GPU 时间预算替代优先级调度:占用率保持 98%,调试任务 p90 排队从 2 小时降到 30 秒

一份来自真实集群的调度改造记录,讲清楚怎么让抢资源变得不划算。

一手来源 Ai2(Hugging Face 博客) · huggingface.co 读原文 ↗

// 要点

  • Ai2 的集群规模 88 到 1024 张 GPU 不等,服务约 150 名研究员,需求是供给的 2 到 3 倍。
  • 改为由管理者设定 GPU 时间预算、分层公平共享调度:任务声明的最短运行时间受保护不被抢占并计入预算,预算外的时间免费但可被抢占。
  • 改造前后占用率都保持在 98%;30 天测试中各团队拿到应得 GPU 时长的 98%,15 个分配里 13 个达到 95% 以上。
  • 调试任务 p90 排队从 2 小时降到 30 秒,需要人工介入的修复减少 74%。

开发者视角这篇没有开源代码,但思路可以直接用:把「优先级」换成「预算」,抢资源就有了成本。团队内部共享推理或微调 GPU 时,我会先按项目分预算、给调试任务留快速通道,比反复调优先级省心得多。