Margrop
Articles277
Tags715
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 评测 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention AutoSynthData Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Frontier AI Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-6 GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini 3.8 Gemini 4 Argon Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo Holo4 HomeAssistant Hugging Face IBM Granite IBM Research In-context Learning Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Prompt 缓存 Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Tabular Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 合成数据 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安全评测 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 强化学习 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 表格基础模型 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件工程 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长任务编排 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

GPT-6 家族:Agent 如何选模型、控成本并跑稳长任务?

GPT-6 家族:Agent 如何选模型、控成本并跑稳长任务?

GPT-6 家族与 Agent 模型选择

先说结论

OpenAI 这次发布的重点,不只是把 GPT-6 家族分成三个型号,而是把“模型选择、推理强度、缓存、压缩和长任务协作”放进同一套工程指南里。对 Agent 团队来说,最值得抄的不是某个型号的宣传语,而是一条明确的生产原则:模型要按任务路由,成本要按成功任务核算,长任务要有可暂停、可转向和可恢复的机制。

我的判断是,GPT-6 家族真正改变的是 Agent 的调度层,而不是让所有请求都换成最强模型。日常抽取、分类和结构化摘要应优先使用便宜快速的型号;复杂编码、研究和电脑操作再升级到中档或高档推理。没有任务级评测和预算控制,所谓“模型升级”很容易只变成账单升级。

发生了什么

主来源是 OpenAI 官方文章《A model guide for the GPT-6 family》,发布日期为 2026-10-02,原始 URL:https://openai.com/index/practical-guide-building-gpt-6。文章的副标题是“在管理时间和成本的同时,获得 GPT-6 模型的最佳结果”,内容覆盖生产准备、型号选择、提示与技能、长时间运行以及电脑操作。

官方事实包括:GPT-6 家族包含 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna。官方页面列出的输入/输出价格分别为:Astra 每百万 token 10/50 美元,Sol 为 2/10 美元,Luna 为 0.10/0.50 美元;缓存输入价格分别为 1、0.10 和 0.01 美元。OpenAI 同时强调,实际选择还要综合能力、推理强度和速度模式,而不是只比较型号名称。

文章还建议在生产中使用提示缓存和上下文压缩,并测量任务成功率、延迟和每个成功任务的成本。对长时间运行的工作,API 侧可以使用中途转向、异步工具调用和多 Agent 委派;Codex 侧则应明确什么时候可以继续、什么时候需要人工澄清。以上是官方公开内容,后文关于路由策略、验收指标和安全边界的部分是我的工程判断。

技术细节

1. 三个型号对应三种工作负载

OpenAI 对 Astra 的定位是最难的推理工作;Sol 面向复杂编码、研究和电脑操作;Luna 则用于目标清晰、重复量大的日常任务,例如抽取发票字段、分类请求和生成结构化摘要。这个分层比“一个模型解决一切”更符合 Agent 的实际运行方式。

可以把路由写成一个确定性的前置策略:先看任务类型、失败代价、输入规模、时间预算和是否需要工具;再决定型号与推理强度。低风险且结构清晰的任务直接走 Luna;需要规划、代码修改或多步工具调用的任务走 Sol;只有在高难度调试、复杂研究或关键审查中才考虑 Astra。模型可以参与解释路由结果,但不应自行修改预算和权限边界。

2. 推理强度是比换模型更细的旋钮

官方把推理水平分成低、中、高,以及在支持时尝试更高档位。低档适合事实抽取和小修改,中档适合方案比较与功能规划,高档适合困难调试和细致审查。这说明同一个型号内部也可以做成本分层:先用较低强度完成初稿,只有当规则检查失败、证据不足或任务复杂度升高时再提升。

工程上要避免“高档位默认化”。如果所有请求都用最高推理,团队可能得到更长的回答,却未必得到更高的任务成功率。更稳的做法是为每类任务设定升级条件,例如测试失败、关键字段缺失、工具返回冲突、证据无法闭合或模型连续两次无法完成计划。升级前后要记录成本与成功率,验证更高推理是否真的值得。

3. 缓存和压缩解决的是两个不同问题

提示缓存适合反复使用的稳定内容,例如系统规则、工具定义和长期不变的参考资料。官方建议把稳定指令和参考内容放在变化任务之前,以提高复用率,并提醒把缓存写入和长上下文比例纳入完整成本估算。缓存降低的是重复输入的价格,不会自动解决过期知识、权限泄露或状态冲突。

上下文压缩则用于较长的工作过程。它的目标是缩小上下文,同时保留继续任务所需要的状态。压缩前应该先把事实、工具回执、待办、失败原因和未知项整理成结构化摘要;不能只让模型把上一大段对话“概括一下”,否则最容易丢掉的恰恰是约束和未完成动作。

4. 长任务需要异步、转向和委派

在 API 中,异步工具调用允许应用继续做不依赖慢工具结果的工作,等工具准备好再回填结果;中途转向允许外部系统更新指令,但不会撤销已经完成的动作;多 Agent 委派则适合拆分彼此独立的调查工作。三者都不是“让模型自由运行”的许可,而是要求编排器明确依赖关系和边界。

例如,代码 Agent 可以一边等待测试,一边整理变更说明,但不能在测试结果回来前宣布修复完成。两个子任务可以并行调查不同模块,但涉及同一个文件、同一份配置或同一个外部动作时必须串行。所有异步工作都应有超时、取消、重试上限和最终汇总状态。

对 Agent / 工程的影响

第一,模型路由应从“按品牌选择”变成“按任务合同选择”。每类任务都要定义输入 Schema、允许的工具、成功条件、预算、最大延迟和升级规则。模型只是执行者,路由器和状态机负责确定边界。

第二,成本指标必须从 token 价格升级为“每个成功任务成本”。一次便宜但失败的调用,可能引发多轮重试、人工返工和错误外部动作;一次较贵但首次成功的调用,反而可能更划算。建议同时记录首次成功率、最终成功率、P50/P95 延迟、重试次数、人工接管率、输入输出 token 和每个成功任务成本。

第三,缓存要配合数据治理。稳定内容可以缓存,但不应把个人信息、凭据、内部网络细节或不必要的原始资料长期放进可复用上下文。缓存键、失效规则和访问范围都要可审计;一旦工具定义或权限发生变化,应主动失效相关缓存,避免旧规则继续影响新任务。

第四,压缩摘要必须区分规则结果、输入证据、AI 解释和未知项。规则程序可以确定某个测试是否通过,工具回执可以作为证据,模型可以解释失败原因,但模型不能把尚未验证的推测写成事实。对外部动作,还要保留幂等键、前置条件和回滚状态。

第五,长任务的人工介入点要具体。不要只写“必要时询问用户”,而要规定哪些决策可以自主完成、哪些需要确认、哪些必须暂停。例如模型可以自行整理代码审查意见,但修改权限配置、发送外部通知、发布生产版本和删除数据前必须停下,并展示证据与影响范围。

第六,先建立小型路由评测集。准备抽取、分类、代码修复、研究、电脑操作和多工具编排等任务,分别跑不同型号与推理强度,固定工具和预算,比较成功率、成本、延迟与失败类型。只看公开价格或单次演示,无法证明路由方案适合自己的业务。

我的判断

GPT-6 家族的发布,最重要的信号是“Agent 编排开始成为产品能力的一部分”。我不会把所有任务统一切到 Astra,而会用 Luna 做规模化基础层、Sol 做复杂工作层、Astra 做少量高价值审查层,并把升级条件写进确定性路由器。

OpenAI 对缓存、压缩、异步工具和委派的建议也值得采纳,但它们必须落在可观测的状态机上。先把成功条件、预算、暂停和恢复做清楚,再谈让 Agent 运行几小时甚至几天;否则长任务只是把短任务的错误拖得更久。

Q&A

Q1:来源、发布日期和原始 URL 是什么?

A:来源是 OpenAI 官方文章《A model guide for the GPT-6 family》,发布日期为 2026-10-02,原始 URL:https://openai.com/index/practical-guide-building-gpt-6。文章介绍 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna,以及生产、缓存、压缩和长任务编排建议。

Q2:三个型号应该怎么选?

A:官方定位是 Astra 面向最难的推理工作,Sol 面向复杂编码、研究和电脑操作,Luna 面向高频、目标清晰的日常任务。实际还要结合自己的成功率、延迟、预算和工具风险做对照测试。

Q3:缓存能把成本降低多少?

A:官方指南给出的说明是,缓存输入在不同模型上最高可比未缓存输入便宜 95%,具体比例取决于型号和实际命中情况。应以自己的缓存命中率、失效规则和完整工作流账单为准,不能只按最高折扣预算。

Q4:异步工具调用会不会让 Agent 乱跑?

A:不会自动解决这个问题。异步只允许应用并行处理互不依赖的工作;依赖工具结果的步骤仍要等待结果。实现时必须设置超时、取消、重试上限、依赖关系和最终状态检查。

Q5:哪些动作不适合交给长时间运行的 Agent?

A:付款、删除、权限变更、生产发布、对外发送和其他不可逆动作,不应因为任务可以运行更久就自动放开。Agent 可以准备计划和证据,确定性程序负责校验,最终动作需要明确确认或经过受控审批。

来源

  1. OpenAI,A model guide for the GPT-6 family,发布日期:2026-10-02,原始 URL:https://openai.com/index/practical-guide-building-gpt-6

本文区分官方事实与作者判断;GPT-6 各型号的价格、能力和可用范围以 OpenAI 官方文档为准,不构成其他环境的性能保证。
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-10-04-gpt-6-agent-model-selection(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-10-04-gpt-6-agent-model-selection/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可