Margrop
Articles284
Tags733
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 推理 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 评测 Agent 路由 Agentic AI Agentic SOC Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention AutoSynthData Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Falcon ASR Fireworks AI FlashAttention FlashDreams Frontier AI Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-6 GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GPU 集群 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini 3.8 Gemini 4 Argon Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo Holo4 HomeAssistant Hugging Face IBM Granite IBM Research In-context Learning Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Prompt 缓存 Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Speech-to-Text Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Tabular Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open d1 open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 事件响应 交换机 人才争夺 人机协作 代理 代码生成 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 决策模型 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 合成数据 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多模态模型 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安全评测 安全运营 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 强化学习 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数学推理 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型微调 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 表格基础模型 视觉语言模型 视频生成 视频问诊 认证 训练基础设施 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 资源调度 超时 路由 路由器 软件工程 软件管家 软路由 边缘 AI 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长任务编排 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 非人类身份 飞书

Hitokoto

Archive

GPU 集群调度:AI Agent 训练如何减少空转并公平分配算力?

GPU 集群调度:AI Agent 训练如何减少空转并公平分配算力?

GPU 集群调度与 AI Agent 基础设施

先说结论

Ai2 最近公开的 GPU 集群调度实践,给 AI Agent 工程一个很实用的提醒:算力调度的核心不是把队列排得更复杂,而是把“谁应该获得多少 GPU 时间”从临时抢资源,变成可审计的预算、可恢复的时间片和可模拟的调度合同。他们把优先级调度改成 GPU 时间预算、层级 fair-share 和最小运行时间契约,在需求长期超过供给 2—3 倍的情况下,30 天内交付了应得 GPU 时长的 98%,集群 occupancy 保持 98%,调试任务的 p90 排队时间从 2 小时降到 30 秒。

这不是说任何团队照抄算法就能多出 30% 算力。官方案例的价值在于,它把“公平”“高利用率”“快速调试”和“维护可自动化”放进同一套系统约束里。我的判断是,Agent 训练和评测平台最应该先学的不是某个调度器名字,而是把任务预算、可抢占性、最小进展和恢复能力写进任务合同;否则 GPU 越多,争抢和空转只会越昂贵。

发生了什么

主来源是 Ai2 在 Hugging Face 官方博客发布的《Impactful scheduling for GPU clusters》,发布日期为 2026 年 10 月 9 日,原始 URL:https://huggingface.co/blog/allenai/impactful-scheduling。

官方事实包括:Ai2 管理数千张 NVIDIA H100、B200 和 B300 GPU,集群规模从 88 张到 1024 张不等,提交的训练请求在任意时刻通常是可用容量的 2—3 倍。旧系统以优先级为主,还允许任务选择不可抢占,结果出现了占坑任务、优先级通胀和维护时需要人工协调停机的问题。

新系统采用 GPU 时间预算、层级公平分享和时间切片合同。30 天测试中,团队实际获得了应得 GPU 时长的 98%,15 个团队分配中有 13 个达到 95% 以上,最低为 90%;集群 occupancy 在改造前后都保持 98%。调试任务的 p90 排队时间从 2 小时降到 30 秒,最大 H100 集群的中位排队时间从 5 分钟降到 24 秒,p90 从 2.8 小时降到 1.8 小时。官方还报告,因主机维护需要人工介入的修复工作下降了 74%。

这些数字属于 Ai2 的特定集群、工作负载和 30 天观察窗口。本文后面对 Agent 平台如何借鉴的内容,是我的判断,不是对其他环境的性能承诺。

技术细节

1. 四个指标不能混成一个“利用率”

Ai2 把算力管理拆成一座四层指标金字塔:availability 是硬件健康并可接任务的比例,occupancy 是可用时间被某个工作负载占用的比例,impact 是高价值工作被选中的比例,utilization 则是一个工作负载在整个生命周期真正使用的 GPU 容量比例。这个拆分很关键。

如果只看 occupancy,系统可能让 GPU 一直被占着,却被无意义任务占用;只看 utilization,又可能因为频繁抢占和重新初始化浪费大量时间。Agent 训练平台应同时记录任务是否被分配、是否真正推进、是否完成有效 checkpoint,以及失败重试消耗了多少算力。

2. 预算替代静态优先级

旧方案中,高优先级没有明确成本,不可抢占任务还能长期占住并发额度,最终几乎所有任务都声明高优先级。新方案不直接给团队“固定几张 GPU”,而是给项目分配一段 GPU 时间预算,再用层级 fair-share 管理实际占用。

预算树可以映射组织或项目结构。一个项目获得总容量的一部分,子项目再在内部继续分配。调度器在滑动窗口内比较实际 occupancy 与分配时间:低于应得份额的工作负载更容易获得资源,已经超额使用的任务则相对靠后。Ai2 默认使用 7 天回看窗口,让公平性在时间范围内收敛,而不是要求每个瞬间都严格平均。

这对 Agent 很像 token budget,但对象从请求变成了 GPU 时间。一个训练任务、评测批次或批量推理作业都应知道自己的预算来源、已经消耗的资源和可接受的抢占方式。没有预算归属,所谓公平只会退化成排队顺序。

3. 最小运行时间构成“调度合同”

长时间训练任务不能每秒都被抢占,否则 checkpoint、初始化和通信开销会吞掉有效工作。因此任务提交时要声明 minimum runtime,也就是至少需要连续运行多久才有意义。这个窗口内任务受到保护,时间达到后,调度器可以重新平衡;可恢复任务被抢占后重新入队,继续按 fair-share 排序。

最小运行时间为零的任务则是不分配预算、从一开始就可抢占的空闲工作。这样,空闲 GPU 仍能被利用,但不会阻塞已经获得预算的工作。这个机制把“可抢占性”从一个含糊开关变成了明确的工程合同:提交者要声明进展单位,调度器要保证基本进展,平台要能恢复状态。

4. 模拟器先于生产切换

调度策略改变是零和问题,给一个项目增加资源就可能让另一个项目排队更久。Ai2 在上线前建立了模拟环境,输入工作负载提交时间、所需 GPU 数量和总运行时间,快速推演等待时间、抢占事件和项目之间的 GPU 分配。

他们专门测试了 debug workload:只需少量 GPU、最小运行时间不超过 15 分钟,目的是尽快知道代码能否启动,而不是完成大规模训练。模拟预测 p90 等待时间可以从约 6 小时降到 5 分钟,真实上线后则从约 2 小时降到 30 秒。对 Agent 平台,这种模拟器比上线后凭感觉调参数可靠得多,也能提前发现大任务因资源碎片化而变慢的问题。

对 Agent / 工程的影响

第一,训练任务要提交“资源合同”,而不是只提交镜像和启动命令。合同至少包含 GPU 数量、最小有效运行时间、是否可恢复、checkpoint 位置、预算归属、超时策略和最大重试次数。调度器据此做资源决策,Agent 负责解释任务状态,但不能临时绕过预算。

第二,评测与调试应该有单独的快车道。一个只需验证环境是否正确的短任务,不应该和需要数百张 GPU、运行数小时的训练任务使用同一套等待逻辑。可以给短调试任务定义较小资源和较短保护窗口,同时保留完整的失败证据,避免开发者为了“抢到一张卡”而长期占坑。

第三,checkpoint 和恢复能力决定可抢占性是否真的可用。若任务被中断后只能从头开始,时间切片会把公平换成浪费。训练框架、数据读取和 Agent 评测环境都应保存可验证的进度点;恢复时检查模型版本、数据版本、代码提交和随机状态,防止把不兼容的旧状态继续跑下去。

第四,成本指标要按成功实验计算。建议同时看预算兑现率、occupancy、真实利用率、队列 p50/p90、抢占次数、恢复成功率、checkpoint 开销、GPU 空转比例和每个通过评测的成本。对 Agent 训练,便宜但反复失败的作业并不便宜;高 occupancy 也不代表实验有效。

第五,调度器必须提供可解释的原因。任务被延迟、抢占或重新入队时,平台应告诉工程师是预算不足、窗口超额、资源碎片、主机维护还是输入约束冲突。这个原因可以交给 Agent 生成摘要,但原始规则结果和资源证据必须由程序产生,不能让模型凭感觉解释。

第六,安全边界不能被“自动调度”掩盖。调度器可以决定资源顺序,却不应自行扩大数据权限、读取无关项目的原始内容或把凭据写进训练日志。涉及私人数据的任务只应传递最小的脱敏状态,平台长期保存的也应是版本、耗时、状态和资源摘要。

我的判断

Ai2 这套实践最值得借鉴的地方,是把 GPU 调度从“谁先喊得响”变成了预算 + 公平分享 + 时间片 + 模拟器。我会把这四件事优先用于 Agent 训练和评测平台,先覆盖可回滚、可恢复的低风险工作负载。

我不会直接承诺“公平调度等于多出算力”。它更准确的价值是减少占坑、降低调试等待、让资源分配可解释,并把维护工作从人工协调变成系统行为。对长时间运行的 Agent,能否保存状态并稳定恢复,比调度器是否足够聪明更重要。

Q&A

Q1:来源、发布日期和原始 URL 是什么?

A:来源是 Ai2 在 Hugging Face 官方博客发布的《Impactful scheduling for GPU clusters》,发布日期为 2026 年 10 月 9 日,原始 URL:https://huggingface.co/blog/allenai/impactful-scheduling。文章详细介绍 GPU 时间预算、层级 fair-share、最小运行时间合同、模拟器和上线结果。

Q2:为什么不用简单的优先级队列?

A:优先级没有成本时,所有人都会把任务标成高优先级,长期运行任务还可能占住资源。预算让资源消耗与项目分配关联,fair-share 则在滑动窗口内纠正长期失衡。

Q3:可抢占任务怎样避免从头开始?

A:提交时声明可恢复,并持续写入兼容的 checkpoint。恢复前还要核对代码、数据、模型和运行时版本;如果任务不可恢复,就不应把它当成可以随意时间切片的工作负载。

Q4:这个方法适合 Agent 的哪些任务?

A:适合模型训练、批量评测、可回放的仿真和大规模推理。短调试任务还可以单独设置小资源、短保护窗口和优先恢复策略。付款、权限修改等高影响动作不属于 GPU 调度问题,仍需确定性权限检查。

Q5:最容易踩的坑是什么?

A:只看 occupancy 不看有效进展;没有模拟器就直接更换调度策略;允许任务声明无限长的保护窗口;缺少 checkpoint 导致抢占变成重跑;以及没有展示排队和抢占原因,让工程师只能靠猜。

来源

  1. Ai2,Impactful scheduling for GPU clusters,发布日期:2026-10-09,原始 URL:https://huggingface.co/blog/allenai/impactful-scheduling
  2. Hadoop Fair Scheduler,相关背景链接:https://issues.apache.org/jira/browse/HADOOP-3746
  3. SLURM Fair Tree,相关实现说明:https://slurm.schedmd.com/fair_tree.html

本文区分官方事实与作者判断;GPU 数量、队列延迟、预算兑现率和维护收益均来自 Ai2 的特定环境,不能直接视为其他集群的 SLA。
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-10-10-gpu-scheduling-agent-infrastructure(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-10-10-gpu-scheduling-agent-infrastructure/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可