Nemotron 3:专用微调加验证循环,能把 Agent 推到金牌级吗?
先说结论
Hugging Face 上 NVIDIA 团队 2026 年 10 月 7 日公开的 Nemotron 3 竞赛结果,真正值得关注的不是“模型拿到了两个金牌级分数”,而是背后的工程组合:领域数据、监督微调、强化学习,以及生成—验证—修订的推理循环必须一起设计。在 IOI 2026,Nemotron-3-Ultra-CC 得到 535.4/600;在 IMO 2026,生成—验证—修订系统得到 30/42,超过官方金牌线 29 分。
我的判断是,Agent 团队不应再把“换一个更大的通用模型”当成默认升级路径。对于代码、数学、审计、规划等有明确验收标准的任务,先做小而可靠的专业化模型,再用验证器和多轮修订把结果闭环,往往比无止境增加采样次数更可控。
发生了什么
主来源是 Hugging Face 官方博客《One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026。
官方事实包括:IOI 侧采用 Nemotron-3-Ultra-CC、监督微调和 GenCorrect,在与人类选手相同的时间、联网和提交限制下进行了一次前瞻性运行,得到 535.4/600;该结果属于非官方、无监督测试,没有进入 IOI 正式排名。IMO 侧采用通用模型与 SFT、RL 检查点组成的生成—验证—修订系统,提交的证明由官方 IMO 评分,最终得到 30/42。
官方还公布了训练和开放资源:IOI 侧整理了 22,000 道题;IMO 的 SFT 数据包含 414,890 个质量过滤样本、覆盖 15,818 道不同证明题,RL 使用了 9,597 道接近模型能力边界的题目。相关论文、数据集、模型和推理流程通过 Hugging Face、arXiv 与 NeMo-Skills 提供。后文关于 Agent 工程落地的建议,是我的判断,不代表官方对所有生产环境的承诺。
技术细节
1. 不是“微调一次就结束”
IOI 和 IMO 的任务形式完全不同:IOI 要写出能通过隐藏测试、满足时间和提交限制的程序;IMO 则要求自然语言证明严谨、完整、没有逻辑跳步。Nemotron 的做法不是训练一个万能检查点,而是围绕任务分别做专业化。
在 IOI 实验中,Nemotron-3-Nano-CC 有 300 亿总参数、30 亿激活参数,经过 SFT 后从 130 分提升到 280 分,再经 RL 到 291 分;加入 GenCorrect 的迭代生成、评估、修订后达到 468 分,超过 IOI 2025 的金牌线 438.3。5500 亿总参数、550 亿激活参数的 Ultra-CC 使用 SFT 和测试时策略后,IOI 2025 达到 502 分;面向 IOI 2026 的运行则是 535.4/600。
这里最重要的信号是:不同规模的模型不一定需要同样的后训练配方。官方文章指出,SFT 给 Nano 带来了主要提升,RL 是较小但稳定的增益;对更强的 Ultra,单个 SFT epoch 就能超过完整后训练 Nano 在多个代码评测上的表现。
2. 数学侧把“证明能力”拆成多个子任务
IMO 的 SFT 数据不只包含最终答案,还覆盖证明生成、证明修订、验证和元验证。换句话说,模型既要会写证明,也要会指出证明漏洞、回应批评,并判断一份证明是否完整。RL 数据则聚焦在接近模型能力边界的问题上,避免把训练资源平均撒在已经容易的题目上。
最终系统让多个检查点互补:候选证明先被生成,再被评分和批评,随后对最有希望的方案进行修订,最后用更高计算量的阶段选择提交答案。它没有使用形式化证明器、外部工具或互联网,而是在自然语言闭环中得到 30/42,其中六道题有四道拿到满分。
3. 关键是模型、数据、推理循环的协同
如果只做微调,模型可能更熟悉题型,却不一定能发现自己的错误;如果只做大量采样,候选数量增加了,错误验证也可能随之增加。GenCorrect 和 IMO 的验证循环把“生成”和“判断”拆开,让系统可以反复利用批评信息改写候选答案。
这也是 Agent 架构熟悉的模式:规划器产生方案,执行器完成动作,验证器检查状态,修订器根据失败证据重试。区别在于,验证器必须有可执行的判据,而不能只让另一个模型凭感觉说“看起来正确”。
对 Agent / 工程的影响
第一,任务专业化比盲目扩大模型更值得先做。代码 Agent 可以按语言、仓库类型和测试框架整理高质量轨迹;数学 Agent 可以把“提出证明、找漏洞、修订证明”分别评测;企业流程 Agent 则可以按业务规则、权限边界和最终状态构造训练样本。稳定的任务边界,才有可能形成可复用的专业模型。
第二,数据集要覆盖失败过程,而不只是成功答案。对于 Agent,真正有价值的样本包括工具超时、权限不足、部分成功、状态回滚、验证失败和重复调用。模型如果只看完美轨迹,会学会模仿格式,却不一定学会在失败后收敛。
第三,推理循环需要把成本和延迟纳入设计。不是每个请求都值得跑多轮生成、批评和修订。可以先用便宜的规则检查和单次模型输出处理简单任务;只有当风险较高、验证失败或结果不确定时,才升级到多模型、多轮循环。指标至少要包含最终通过率、错误接受率、平均轮数、P95 延迟、GPU 成本和人工接管率。
第四,验证器应当独立于生成器。代码任务优先运行测试、静态检查和沙箱;结构化业务任务检查 Schema、权限和状态变化;数学任务则需要明确的评分协议或人工抽检。模型的自评可以作为线索,但不应单独作为放行条件。
第五,开放资源降低了复现实验门槛,但不等于可以直接复制生产能力。公开的模型、数据和流程仍要重新检查许可证、硬件需求、推理吞吐、评测污染、数据质量和安全边界。竞赛分数说明方法有效,不自动说明它适合长链路业务。
我的判断
Nemotron 这次结果说明,Agent 的下一阶段竞争点会从“谁的基础模型更大”转向“谁能把专业数据、验证器和推理循环组合得更好”。我的建议是先为一个窄任务建立可回放的失败集和确定性验收器,再决定是否微调;没有验证器的微调,通常只是更会生成答案,不是更会完成任务。
短期内,我会把这类方法用于代码修复、结构化分析和可测试的规划任务,不会把竞赛级结果直接外推到开放世界的自动决策。先证明系统能稳定发现并纠正错误,再扩大工具权限和任务范围。
Q&A
Q1:来源、发布日期和原始 URL 是什么?
A:来源是 Hugging Face 官方博客《One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026。博客同时链接了 IOI 论文、IMO 论文、模型、数据集和 NeMo-Skills 推理流程。
Q2:535.4/600 和 30/42 是否等于正式竞赛冠军?
A:不完全等同。535.4/600 是在 IOI 约束下的非官方、无监督测试,没有进入正式排名;30/42 的 IMO 证明由官方评分,超过 29 分的金牌线,但它仍然是一个系统结果,不应简单理解为通用模型在所有数学问题上都达到同等水平。
Q3:Agent 怎样复用生成—验证—修订?
A:把任务拆成候选生成、确定性检查、错误归因、修订和最终验收五步。检查失败时保存结构化失败原因,只针对失败点重试;不要把整条链路无条件重复运行。
Q4:SFT 和 RL 应该怎么选?
A:先用高质量 SFT 让模型学会任务格式、基本策略和工具协议,再用 RL 优化可验证的结果指标。若没有稳定奖励函数和可靠验证器,贸然做 RL 往往会放大投机行为。
Q5:落地时最大的坑是什么?
A:把竞赛指标误当生产指标。生产还要验证延迟、成本、失败恢复、数据泄露、权限边界、版本漂移和人工接管;同时要防止模型把“验证通过”当成文本上的一句话,而不是系统状态的真实变化。
来源
- Hugging Face,One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO,发布日期:2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026
- IOI 2026 论文,原始 URL:https://arxiv.org/abs/2609.02849
- IMO 2026 论文,原始 URL:https://arxiv.org/abs/2609.10712
- NeMo-Skills 推理流程,原始 URL:https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/nemotron-imo-tts
本文区分官方事实与作者判断;模型能力、数据许可、硬件需求和实际效果以官方资料及目标环境复现为准。