Margrop
Articles280
Tags724
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 推理 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 评测 Agent 路由 Agentic AI Agentic SOC Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention AutoSynthData Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Frontier AI Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-6 GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini 3.8 Gemini 4 Argon Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo Holo4 HomeAssistant Hugging Face IBM Granite IBM Research In-context Learning Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Prompt 缓存 Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Tabular Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 事件响应 交换机 人才争夺 人机协作 代理 代码生成 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 合成数据 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安全评测 安全运营 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 强化学习 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数学推理 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型微调 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 表格基础模型 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件工程 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长任务编排 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 非人类身份 飞书

Hitokoto

Archive

Nemotron 3:专用微调加验证循环,能把 Agent 推到金牌级吗?

Nemotron 3:专用微调加验证循环,能把 Agent 推到金牌级吗?

Nemotron 专用模型与验证循环

先说结论

Hugging Face 上 NVIDIA 团队 2026 年 10 月 7 日公开的 Nemotron 3 竞赛结果,真正值得关注的不是“模型拿到了两个金牌级分数”,而是背后的工程组合:领域数据、监督微调、强化学习,以及生成—验证—修订的推理循环必须一起设计。在 IOI 2026,Nemotron-3-Ultra-CC 得到 535.4/600;在 IMO 2026,生成—验证—修订系统得到 30/42,超过官方金牌线 29 分。

我的判断是,Agent 团队不应再把“换一个更大的通用模型”当成默认升级路径。对于代码、数学、审计、规划等有明确验收标准的任务,先做小而可靠的专业化模型,再用验证器和多轮修订把结果闭环,往往比无止境增加采样次数更可控。

发生了什么

主来源是 Hugging Face 官方博客《One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026。

官方事实包括:IOI 侧采用 Nemotron-3-Ultra-CC、监督微调和 GenCorrect,在与人类选手相同的时间、联网和提交限制下进行了一次前瞻性运行,得到 535.4/600;该结果属于非官方、无监督测试,没有进入 IOI 正式排名。IMO 侧采用通用模型与 SFT、RL 检查点组成的生成—验证—修订系统,提交的证明由官方 IMO 评分,最终得到 30/42。

官方还公布了训练和开放资源:IOI 侧整理了 22,000 道题;IMO 的 SFT 数据包含 414,890 个质量过滤样本、覆盖 15,818 道不同证明题,RL 使用了 9,597 道接近模型能力边界的题目。相关论文、数据集、模型和推理流程通过 Hugging Face、arXiv 与 NeMo-Skills 提供。后文关于 Agent 工程落地的建议,是我的判断,不代表官方对所有生产环境的承诺。

技术细节

1. 不是“微调一次就结束”

IOI 和 IMO 的任务形式完全不同:IOI 要写出能通过隐藏测试、满足时间和提交限制的程序;IMO 则要求自然语言证明严谨、完整、没有逻辑跳步。Nemotron 的做法不是训练一个万能检查点,而是围绕任务分别做专业化。

在 IOI 实验中,Nemotron-3-Nano-CC 有 300 亿总参数、30 亿激活参数,经过 SFT 后从 130 分提升到 280 分,再经 RL 到 291 分;加入 GenCorrect 的迭代生成、评估、修订后达到 468 分,超过 IOI 2025 的金牌线 438.3。5500 亿总参数、550 亿激活参数的 Ultra-CC 使用 SFT 和测试时策略后,IOI 2025 达到 502 分;面向 IOI 2026 的运行则是 535.4/600。

这里最重要的信号是:不同规模的模型不一定需要同样的后训练配方。官方文章指出,SFT 给 Nano 带来了主要提升,RL 是较小但稳定的增益;对更强的 Ultra,单个 SFT epoch 就能超过完整后训练 Nano 在多个代码评测上的表现。

2. 数学侧把“证明能力”拆成多个子任务

IMO 的 SFT 数据不只包含最终答案,还覆盖证明生成、证明修订、验证和元验证。换句话说,模型既要会写证明,也要会指出证明漏洞、回应批评,并判断一份证明是否完整。RL 数据则聚焦在接近模型能力边界的问题上,避免把训练资源平均撒在已经容易的题目上。

最终系统让多个检查点互补:候选证明先被生成,再被评分和批评,随后对最有希望的方案进行修订,最后用更高计算量的阶段选择提交答案。它没有使用形式化证明器、外部工具或互联网,而是在自然语言闭环中得到 30/42,其中六道题有四道拿到满分。

3. 关键是模型、数据、推理循环的协同

如果只做微调,模型可能更熟悉题型,却不一定能发现自己的错误;如果只做大量采样,候选数量增加了,错误验证也可能随之增加。GenCorrect 和 IMO 的验证循环把“生成”和“判断”拆开,让系统可以反复利用批评信息改写候选答案。

这也是 Agent 架构熟悉的模式:规划器产生方案,执行器完成动作,验证器检查状态,修订器根据失败证据重试。区别在于,验证器必须有可执行的判据,而不能只让另一个模型凭感觉说“看起来正确”。

对 Agent / 工程的影响

第一,任务专业化比盲目扩大模型更值得先做。代码 Agent 可以按语言、仓库类型和测试框架整理高质量轨迹;数学 Agent 可以把“提出证明、找漏洞、修订证明”分别评测;企业流程 Agent 则可以按业务规则、权限边界和最终状态构造训练样本。稳定的任务边界,才有可能形成可复用的专业模型。

第二,数据集要覆盖失败过程,而不只是成功答案。对于 Agent,真正有价值的样本包括工具超时、权限不足、部分成功、状态回滚、验证失败和重复调用。模型如果只看完美轨迹,会学会模仿格式,却不一定学会在失败后收敛。

第三,推理循环需要把成本和延迟纳入设计。不是每个请求都值得跑多轮生成、批评和修订。可以先用便宜的规则检查和单次模型输出处理简单任务;只有当风险较高、验证失败或结果不确定时,才升级到多模型、多轮循环。指标至少要包含最终通过率、错误接受率、平均轮数、P95 延迟、GPU 成本和人工接管率。

第四,验证器应当独立于生成器。代码任务优先运行测试、静态检查和沙箱;结构化业务任务检查 Schema、权限和状态变化;数学任务则需要明确的评分协议或人工抽检。模型的自评可以作为线索,但不应单独作为放行条件。

第五,开放资源降低了复现实验门槛,但不等于可以直接复制生产能力。公开的模型、数据和流程仍要重新检查许可证、硬件需求、推理吞吐、评测污染、数据质量和安全边界。竞赛分数说明方法有效,不自动说明它适合长链路业务。

我的判断

Nemotron 这次结果说明,Agent 的下一阶段竞争点会从“谁的基础模型更大”转向“谁能把专业数据、验证器和推理循环组合得更好”。我的建议是先为一个窄任务建立可回放的失败集和确定性验收器,再决定是否微调;没有验证器的微调,通常只是更会生成答案,不是更会完成任务。

短期内,我会把这类方法用于代码修复、结构化分析和可测试的规划任务,不会把竞赛级结果直接外推到开放世界的自动决策。先证明系统能稳定发现并纠正错误,再扩大工具权限和任务范围。

Q&A

Q1:来源、发布日期和原始 URL 是什么?

A:来源是 Hugging Face 官方博客《One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026。博客同时链接了 IOI 论文、IMO 论文、模型、数据集和 NeMo-Skills 推理流程。

Q2:535.4/600 和 30/42 是否等于正式竞赛冠军?

A:不完全等同。535.4/600 是在 IOI 约束下的非官方、无监督测试,没有进入正式排名;30/42 的 IMO 证明由官方评分,超过 29 分的金牌线,但它仍然是一个系统结果,不应简单理解为通用模型在所有数学问题上都达到同等水平。

Q3:Agent 怎样复用生成—验证—修订?

A:把任务拆成候选生成、确定性检查、错误归因、修订和最终验收五步。检查失败时保存结构化失败原因,只针对失败点重试;不要把整条链路无条件重复运行。

Q4:SFT 和 RL 应该怎么选?

A:先用高质量 SFT 让模型学会任务格式、基本策略和工具协议,再用 RL 优化可验证的结果指标。若没有稳定奖励函数和可靠验证器,贸然做 RL 往往会放大投机行为。

Q5:落地时最大的坑是什么?

A:把竞赛指标误当生产指标。生产还要验证延迟、成本、失败恢复、数据泄露、权限边界、版本漂移和人工接管;同时要防止模型把“验证通过”当成文本上的一句话,而不是系统状态的真实变化。

来源

  1. Hugging Face,One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO,发布日期:2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026
  2. IOI 2026 论文,原始 URL:https://arxiv.org/abs/2609.02849
  3. IMO 2026 论文,原始 URL:https://arxiv.org/abs/2609.10712
  4. NeMo-Skills 推理流程,原始 URL:https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/nemotron-imo-tts

本文区分官方事实与作者判断;模型能力、数据许可、硬件需求和实际效果以官方资料及目标环境复现为准。

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-10-07-nemotron-specialization-gold-results/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可