Margrop
Articles400
Tags858
Categories7

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 30s timeout 4-bit 量化 6-DoF SLAM AC ACL ACL 切换 ACP AI AI Agent AI Coding Assistant AI Tech AI tutor AI 安全 AI 日记 AI编程助手 AI辅助 AI辅助编程 AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 Agent Agent Harness Agent 入侵 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 路由 AgentPlan Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Attention Baseten Blog CC-Switch CI/CD CLI Tools CLI 工具 CLI工具 CPU 推理 CSRF Cache Hit Rate Caddy Categories 404 ChatGPT Claude Code Claude Sonnet ClawLoader Cloudflare Code Interpreter Codex Coding Plan Coding Plan Dashboard ComfyUI Computer Use Context Compression Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron D1 DFIR DIY-MINI Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Docker Compose Efficiency Tools Electerm Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Flask GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-Live GPT-Red GPU 加速 GPU 性能分析 Gateway Gemini Gemini 3.5 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub GitHub Actions GitHub PR Google Google AI Google Research Grabette Gripette HA HADashboard HF Security Incident Hailuo Hermes HermesAgent Hexo HomeAssistant Hugging Face Hugo IBM Research IP IPv4 Inference Providers Isaac Lab Java KV cache Kimi Kimi Code Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Markdown Memory 上限 Meta Microsoft 365 Copilot MiniMax MiniMax H3 Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NewAPI Newton Nginx Node-RED Node.js Nunchaku OAuth 凭据 OCR OOM OlmoEarth On-device AI Open Source Open Viking OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 PPPoE Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RPC RTEB Real-Time Inference Red Teaming Responses API Restart SIGTERM SNAP SOCKS5 SOCKS5 代理 SPED SSH 审计 SSL SVDQuant Scientific Computing Self-Forcing Distillation Session Shell Skill 管理 Sol Subagent Surgical Robotics Synology NAS TTS Terra Think button TimeMachine TutorMoments UI 微调 UML Uptime Kuma V4-Pro VPN VPS VoiceEQ WARP Web WebRTC WebSocket Win11 Windows Workers World Foundation Model activate ad adb adblock agent agentic aligenie aliyun alpine annotation aop authy autofs backup baidupan bash bg-review bitwarden boot brew browser budget control caddy2 cc-switch-cli cdn centos cert certbot charles chat chrome classloader client clone closures cloudflare cmd command commit commoditization conn_id container cron 排错 crontab cross_sync ctyun cyber capability dashboard ddsm demo dependency deploy developer devtools disconnect topic dll dns docker domain download drafter draw drawio dsm dump dylib easytier edge environment hooks exception exit code 1 export fail2ban feign firewall-cmd flow fork free tier frontier hosted model frp frpc frps fuckgfw full-duplex function fuzzy match gateway gcc gfw git github glm-latest golang gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage idea image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iptv ipv6 iso java javascript jetbrains jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s keepalive keepalive ping timeout kernel key kid kms kodi koolproxy koolproxyr kvm lan lastpass launchctl learning lede letsencrypt linux live llama.cpp low-code lvm lxc m3u8 mac macos mariadb markdown maven md5 mdadm memory 上限 microcode mirror modem modules monitor mount mstsc multimodal mysql n2n n5105 nas network newapi nfs no close frame node node-red nodejs nohup notepad++ npm nssm ntp one-api 容器 oop open weights openclaw openfeign openssl openviking os otp ovz p14 packet capture pat pdf pem perf ping pip plugin png powerbutton print pro productive struggle proxy pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina root route router rule rules runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student skill_manage slmgr so socks source spk spring springboot springfox ssh ssl stash string supernode support svg svn swagger sync synology systemctl systemd tap tap-windows tapwindows telecom template terminal tls tmux token totp tvbox txt ubuntu udisk ui undertow uninstall unlocker upgrade url v2ray vLLM vhd viking_search vim vlmcsd vm vmdk web websocket wechat windows with worker wow xiaoya xml yum zai-org/GLM-5.2 zip 三维切片 上下文压缩 个人品牌 中国电信 临时关权限 临时提权 云电脑 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 体检 供应链 值班 健康检查 光猫 免费层 公众号 公网IP 内存 内存优化 内容发布 内网 内网IP 内网渗透 写作 分布式推理 分布式训练 医疗 AI 升级 协作 协作习惯 协议层 协议转换 单平台型异常 博客 博客同步 博客改名 博客运维 卫星影像 反向代理 反诉 变更审计 可靠性 后台 Review 启动 告警 告警优化 周一 周一傍晚 周一焦虑 周三傍晚 周五 周六 周四傍晚 周四晚 周报 周日 周末 回滚 地球观测 地理空间推理 复盘评测 夏令时 多 agent 工具链 多 token 预测 多协议并发 多智能体 多模态 多节点 多节点管理 多语言 多通道并发 大厂人才战 大模型评测 天猫精灵 天翼云 失败模式 字体大小 安全 安全事件 安全意识 安装 定时任务 实战反思 实时语音 客户端 SDK 容器 容器网络 导入 小米 屏幕理解 工作感悟 工具审计 工具白名单 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 并发窗口 广告屏蔽 序列号 应用市场 开放 API 开权重 开源权重 开源模型 开源项目 异常 异步任务 异步委派 微信 微信公众号 微信限流 心智成长 心跳 心跳检查 性能优化 总账号数 感悟 成本优化 成本控制 打工 打工人 打工人日记 扩散模型 技术 抓包 按 provider 优先级 排查 排障思路 推理加速 推理预算 描述文件 提示词工程 提示词敏感性 故障 故障归因 故障恢复 故障排查 效率 效率工具 教育数据开源 教育评测 数据 文本编码器 断线重连 旁路由 无服务器 日志分析 日志排查 日记 时区 时段权限 显卡虚拟化 智能体集成 智能家居 智能音箱 暗黑风格 服务器 服务管理 本地 agent 本地安装 本地工具 本地接口 机器人仿真 机器人数据采集 权限管理 架构 框架级切片 梯子 模块 模型推理 模型精简 模型路由 残存访问 治理层 流式推理 流程 流程图 浏览器 漫游 激活 火山引擎 火绒 灾难恢复 焦虑 独立仓库 玄学 生活 电信 画图 监控 监控系统 监管 直播源 直觉 磁盘 磁盘故障 磁盘管理 稀疏样本 稀疏注意力 立体声 端侧 AI 端口 端口冲突 端口扫描 管理 续期 网关 网络 网络风暴 群晖 群晖 NAS 脚本 脚本优化 腾讯 自动化 自动化反思 自动化运维 自动恢复 自动攻击 自动重启 自动重连 自托管 LLM 网关 自部署 苹果 虚拟机 视觉语言模型 视觉验收 视频生成 视频问诊 订阅额度 认证 证书 评测基准 评测方法学 诉讼 语雀 语音 AI 语音 Agent 质量检查 资产清理 超时 跨平台 路由 路由器 软件管家 软路由 运维 运维日常 运维监控 进程生命周期 远程接口 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 钉钉 钉钉断开 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 需求变更 风险控制 飞书

Hitokoto

Archive

DeepSeek V4-Pro 上线:Agent 为什么需要可调推理与峰谷价格

DeepSeek V4-Pro 上线:Agent 为什么需要可调推理与峰谷价格

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

DeepSeek V4-Pro 的 Agent 推理与峰谷定价

先说结论

DeepSeek 在 2026 年 8 月 13 日发布 V4-Pro GA,真正值得 Agent 工程团队关注的不是又多了一个模型名,而是三件事被放在了同一份官方公告里:可调推理力度、原生 Responses API、峰谷价格。这意味着模型调用开始从“选哪个型号”转向“这次任务应该花多少推理预算、用哪种协议、安排在什么时间运行”。我的判断是:V4-Pro 最适合被当成一个带成本控制旋钮的 Agent 后端,而不是所有请求都默认开到最高推理档。

官方事实与我的判断需要分开。官方资料确认了 V4-Pro GA、V4-Pro 与 V4-Flash 支持灵活推理力度、原生支持 OpenAI Responses API、针对 Codex 做了一键配置,并公布了峰谷价格切换时间。至于它在真实生产任务中的准确率、延迟和单位成本,还需要工程团队用自己的任务集验证,不能仅凭发布公告下结论。

发生了什么

DeepSeek API Docs 在 2026-08-13 发布《DeepSeek-V4-Pro GA Release》:

  • V4-Pro 正式 GA,上线 App / Web 的 Expert Mode,也可通过 API 调用;
  • V4-Pro 与 V4-Flash 提供灵活的 reasoning effort,简单任务可用低档,日常 Agent 工作流可用高档,复杂任务可用 max 档;
  • API 原生支持 OpenAI Responses API,并针对 Codex 提供一键配置;
  • 模型名称保持不变,具体接入方式以 API 文档为准;
  • V4 系列上线后,API 价格引入 peak 与 off-peak 两种费率,off-peak 比 peak 低 50%;
  • 新价格将在 2026-08-16 16:00 UTC 起生效。

原始来源: DeepSeek-V4-Pro GA Release — DeepSeek API Docs(2026-08-13)。这是一篇官方发布页,篇幅不长,但信息密度很高:它同时触及模型能力、调用协议和账单策略三个层面。

需要特别说明的是,公告没有给出完整价格表、每个推理档位的具体 token 预算、不同档位的延迟承诺,也没有在这页上提供一张独立 benchmark 总表。因此,本文不会自行补齐这些数字,而是围绕官方已经确认的变化,分析它们对 Agent 架构意味着什么。

技术细节

1. reasoning effort 把“模型选择”变成“任务预算选择”

传统 Agent 路由经常是这样做的:简单问题走便宜模型,复杂问题走昂贵模型。这个方法有效,但颗粒度比较粗,因为模型型号同时决定了能力、延迟和价格。V4-Pro 的灵活 reasoning effort 提供了另一种切法:同一条模型线路上,根据任务难度调整推理投入。

可以把它类比成导航软件。去附近便利店,不需要把所有道路都算一遍;跨城出行,才需要更长的规划时间。低档 effort 适合分类、改写、简单抽取和短回答;高档 effort 适合需要多步工具调用、长上下文规划和结果复核的任务;max 档则应该留给真正容易走错的复杂任务,而不是作为默认值。

这并不等于“高 effort 一定更聪明”。它更准确的含义是:模型获得了更多处理任务的预算。预算增加可能提升复杂任务的可靠性,也可能带来更高延迟和成本。生产系统必须用任务成功率、平均耗时和每次请求成本三项指标一起评估。

2. Responses API 降低 Agent 协议适配成本

官方公告确认 V4-Pro 原生支持 OpenAI Responses API,并针对 Codex 提供一键设置。对 Agent 工程来说,协议兼容的价值往往比宣传页上的单项跑分更直接。

如果一个 Agent 框架已经围绕 Responses API 组织输入、输出、工具调用和多轮状态,那么后端切换的主要工作就从“重写整个适配器”变成“确认模型能力边界”。这不能保证所有高级功能完全等价,但至少减少了请求格式、工具结果回传和状态管理上的重复工程。

这里仍然要留一个边界:协议兼容不等于行为兼容。工具调用字段、并行调用、流式事件顺序、错误码和上下文限制,都需要用最小测试集逐项验证。所谓一键配置,适合帮助你开始接入,不等于可以跳过生产验收。

3. off-peak 低 50% 把调度变成成本控制手段

官方给出的核心数字是:off-peak 费率比 peak 低 50%,新价格从 8 月 16 日 16:00 UTC 起生效。这个变化对批处理 Agent 很重要,因为很多任务并不需要立刻完成:夜间索引、离线摘要、历史文档分类、评测回放和缓存预生成,都可以延迟到价格更低的时间窗口。

但峰谷价格不能简单理解成“所有任务都等便宜时段”。实时客服、交互式编码和告警响应有明确的时效要求,等待价格窗口可能比节省调用费用更贵。更合理的做法是把任务分成两类:用户正在等待的在线任务,优先保证延迟;可以排队的离线任务,优先利用 off-peak。

从系统设计角度看,这要求队列系统知道任务的截止时间,而不仅仅知道任务的优先级。一个任务如果“越晚越便宜”,但超过某个时间点就失去价值,就应该携带 deadline、最大预算和允许的 reasoning effort。模型调用不再只是函数调用,而会变成调度系统的一部分。

4. V4-Pro 与 V4-Flash 的分工值得通过路由验证

公告同时提到 V4-Pro 和 V4-Flash 都支持灵活推理力度,但没有在这篇公告里给出两者完整的能力与价格对照。因此,工程上不应该直接假设“Flash 负责简单任务、Pro 负责复杂任务”就已经成立,而要用自己的流量做路由实验。

一个可执行的实验可以包含四组:短文本抽取、带工具调用的多步任务、长文档规划、需要自检的代码修改。每组任务分别测试低、高、max 三档,记录成功率、首 token 延迟、总耗时、输入输出 token 和重试次数。最终比较的不是单次回答好不好,而是单位有效任务成本:完成一个合格结果,平均要花多少钱和多少秒。

对 Agent / 工程的影响

立刻能用的场景

第一,给 Agent 增加 effort 路由。可以先用规则判断任务类型,再为简单任务选择低档,为多步任务选择高档,为少量高风险任务选择 max 档。规则应该能被日志记录,避免出现“模型自己偷偷改变预算、工程师却不知道”的黑盒行为。

第二,把可延迟任务放进峰谷调度。离线摘要、向量化前的清洗、评测集回放和夜间报告都适合进入可排队队列。队列需要保存预计耗时、截止时间和最大费用,不能只保存一条 prompt。

第三,利用 Responses API 的兼容性做后端抽象。把协议层和模型路由层分开,未来更换供应商时,尽量只改模型能力声明、价格表和错误重试策略,不要让业务代码到处拼接供应商特有格式。

需要进一步验证的地方

一是各 reasoning effort 档位到底对应多少额外计算、延迟和 token 消耗,官方公告没有给出完整数字;二是 Responses API 的工具调用、流式事件和多轮状态是否与现有实现逐项一致;三是 off-peak 的时间窗口如何按账户、区域和任务类型计算;四是高峰时段是否存在排队、限流或吞吐变化;五是 V4-Pro 与 V4-Flash 在真实业务任务上的质量差异是否足以抵消价格差。

短期不要碰的做法

不要把 max effort 设成所有请求的默认值,也不要把“价格便宜一半”理解成“系统成本自动下降一半”。如果高 effort 让单次请求耗时翻倍、重试减少有限,最终单位有效任务成本可能并没有下降。也不要只根据协议兼容就直接替换线上模型,至少要先跑工具调用、结构化输出、超时和失败重试测试。

我的判断

第一,V4-Pro 这次发布的核心产品不是单独的模型能力,而是“推理预算 + 调度价格 + Agent 协议”的组合。第二,最值得先落地的不是把所有线上流量迁移过去,而是拿一批可回放任务做 effort 与峰谷调度实验。第三,如果你的系统有明显的离线任务,off-peak 低 50% 可能比一次 benchmark 排名更快转化成真实成本收益;如果全部请求都要求即时响应,这项价格能力的价值会被大幅削弱。

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 DeepSeek 官方文档页 DeepSeek-V4-Pro GA Release,发布日期为 2026-08-13。官方页确认 V4-Pro GA、可调 reasoning effort、Responses API、Codex 一键设置,以及 off-peak 比 peak 低 50%、新价格于 2026-08-16 16:00 UTC 生效。

Q2:现在可以直接把现有 Agent 切到 V4-Pro 吗?

A:可以开始做兼容性验证,但不建议跳过灰度。先用小规模回放任务测试文本输出、工具调用、流式事件、结构化结果、超时与重试,再比较旧后端和 V4-Pro 的有效任务成本。

Q3:哪些任务适合放到 off-peak?

A:不要求即时反馈的批处理更合适,例如历史文档摘要、离线评测、索引预处理和夜间报告。实时交互、告警响应和用户正在等待的任务不应为了省费用而延迟。

Q4:reasoning effort 应该怎么选?

A:先按任务复杂度分档,而不是按模型名称分档。简单抽取从低档开始;需要多步规划或工具调用的任务测试高档;只有高错误成本、复杂且可接受更高延迟的任务,才考虑 max 档。

Q5:官方公告有没有给出完整价格表和 benchmark?

A:这篇公告只明确说明 off-peak 比 peak 低 50% 以及生效时间,没有给出本文所需的完整价格表、每档预算和独立 benchmark。因此这些指标必须等待更完整的价格文档,或由工程团队用自己的任务集实测。


参考资料:

  1. DeepSeek-V4-Pro GA Release — DeepSeek API Docs(2026-08-13,官方发布页)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、商业秘密或未脱敏身份字段
封面 seed:2026-08-14-deepseek-v4-pro-agent-pricing(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-14-deepseek-v4-pro-agent-pricing/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可