Margrop
Articles272
Tags702
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 评测 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo Holo4 HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件工程 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

DeepSeek V4-Pro 上线:Agent 为什么需要可调推理与峰谷价格

DeepSeek V4-Pro 上线:Agent 为什么需要可调推理与峰谷价格

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

DeepSeek V4-Pro 的 Agent 推理与峰谷定价

先说结论

DeepSeek 在 2026 年 8 月 13 日发布 V4-Pro GA,真正值得 Agent 工程团队关注的不是又多了一个模型名,而是三件事被放在了同一份官方公告里:可调推理力度、原生 Responses API、峰谷价格。这意味着模型调用开始从“选哪个型号”转向“这次任务应该花多少推理预算、用哪种协议、安排在什么时间运行”。我的判断是:V4-Pro 最适合被当成一个带成本控制旋钮的 Agent 后端,而不是所有请求都默认开到最高推理档。

官方事实与我的判断需要分开。官方资料确认了 V4-Pro GA、V4-Pro 与 V4-Flash 支持灵活推理力度、原生支持 OpenAI Responses API、针对 Codex 做了一键配置,并公布了峰谷价格切换时间。至于它在真实生产任务中的准确率、延迟和单位成本,还需要工程团队用自己的任务集验证,不能仅凭发布公告下结论。

发生了什么

DeepSeek API Docs 在 2026-08-13 发布《DeepSeek-V4-Pro GA Release》:

  • V4-Pro 正式 GA,上线 App / Web 的 Expert Mode,也可通过 API 调用;
  • V4-Pro 与 V4-Flash 提供灵活的 reasoning effort,简单任务可用低档,日常 Agent 工作流可用高档,复杂任务可用 max 档;
  • API 原生支持 OpenAI Responses API,并针对 Codex 提供一键配置;
  • 模型名称保持不变,具体接入方式以 API 文档为准;
  • V4 系列上线后,API 价格引入 peak 与 off-peak 两种费率,off-peak 比 peak 低 50%;
  • 新价格将在 2026-08-16 16:00 UTC 起生效。

原始来源: DeepSeek-V4-Pro GA Release — DeepSeek API Docs(2026-08-13)。这是一篇官方发布页,篇幅不长,但信息密度很高:它同时触及模型能力、调用协议和账单策略三个层面。

需要特别说明的是,公告没有给出完整价格表、每个推理档位的具体 token 预算、不同档位的延迟承诺,也没有在这页上提供一张独立 benchmark 总表。因此,本文不会自行补齐这些数字,而是围绕官方已经确认的变化,分析它们对 Agent 架构意味着什么。

技术细节

1. reasoning effort 把“模型选择”变成“任务预算选择”

传统 Agent 路由经常是这样做的:简单问题走便宜模型,复杂问题走昂贵模型。这个方法有效,但颗粒度比较粗,因为模型型号同时决定了能力、延迟和价格。V4-Pro 的灵活 reasoning effort 提供了另一种切法:同一条模型线路上,根据任务难度调整推理投入。

可以把它类比成导航软件。去附近便利店,不需要把所有道路都算一遍;跨城出行,才需要更长的规划时间。低档 effort 适合分类、改写、简单抽取和短回答;高档 effort 适合需要多步工具调用、长上下文规划和结果复核的任务;max 档则应该留给真正容易走错的复杂任务,而不是作为默认值。

这并不等于“高 effort 一定更聪明”。它更准确的含义是:模型获得了更多处理任务的预算。预算增加可能提升复杂任务的可靠性,也可能带来更高延迟和成本。生产系统必须用任务成功率、平均耗时和每次请求成本三项指标一起评估。

2. Responses API 降低 Agent 协议适配成本

官方公告确认 V4-Pro 原生支持 OpenAI Responses API,并针对 Codex 提供一键设置。对 Agent 工程来说,协议兼容的价值往往比宣传页上的单项跑分更直接。

如果一个 Agent 框架已经围绕 Responses API 组织输入、输出、工具调用和多轮状态,那么后端切换的主要工作就从“重写整个适配器”变成“确认模型能力边界”。这不能保证所有高级功能完全等价,但至少减少了请求格式、工具结果回传和状态管理上的重复工程。

这里仍然要留一个边界:协议兼容不等于行为兼容。工具调用字段、并行调用、流式事件顺序、错误码和上下文限制,都需要用最小测试集逐项验证。所谓一键配置,适合帮助你开始接入,不等于可以跳过生产验收。

3. off-peak 低 50% 把调度变成成本控制手段

官方给出的核心数字是:off-peak 费率比 peak 低 50%,新价格从 8 月 16 日 16:00 UTC 起生效。这个变化对批处理 Agent 很重要,因为很多任务并不需要立刻完成:夜间索引、离线摘要、历史文档分类、评测回放和缓存预生成,都可以延迟到价格更低的时间窗口。

但峰谷价格不能简单理解成“所有任务都等便宜时段”。实时客服、交互式编码和告警响应有明确的时效要求,等待价格窗口可能比节省调用费用更贵。更合理的做法是把任务分成两类:用户正在等待的在线任务,优先保证延迟;可以排队的离线任务,优先利用 off-peak。

从系统设计角度看,这要求队列系统知道任务的截止时间,而不仅仅知道任务的优先级。一个任务如果“越晚越便宜”,但超过某个时间点就失去价值,就应该携带 deadline、最大预算和允许的 reasoning effort。模型调用不再只是函数调用,而会变成调度系统的一部分。

4. V4-Pro 与 V4-Flash 的分工值得通过路由验证

公告同时提到 V4-Pro 和 V4-Flash 都支持灵活推理力度,但没有在这篇公告里给出两者完整的能力与价格对照。因此,工程上不应该直接假设“Flash 负责简单任务、Pro 负责复杂任务”就已经成立,而要用自己的流量做路由实验。

一个可执行的实验可以包含四组:短文本抽取、带工具调用的多步任务、长文档规划、需要自检的代码修改。每组任务分别测试低、高、max 三档,记录成功率、首 token 延迟、总耗时、输入输出 token 和重试次数。最终比较的不是单次回答好不好,而是单位有效任务成本:完成一个合格结果,平均要花多少钱和多少秒。

对 Agent / 工程的影响

立刻能用的场景

第一,给 Agent 增加 effort 路由。可以先用规则判断任务类型,再为简单任务选择低档,为多步任务选择高档,为少量高风险任务选择 max 档。规则应该能被日志记录,避免出现“模型自己偷偷改变预算、工程师却不知道”的黑盒行为。

第二,把可延迟任务放进峰谷调度。离线摘要、向量化前的清洗、评测集回放和夜间报告都适合进入可排队队列。队列需要保存预计耗时、截止时间和最大费用,不能只保存一条 prompt。

第三,利用 Responses API 的兼容性做后端抽象。把协议层和模型路由层分开,未来更换供应商时,尽量只改模型能力声明、价格表和错误重试策略,不要让业务代码到处拼接供应商特有格式。

需要进一步验证的地方

一是各 reasoning effort 档位到底对应多少额外计算、延迟和 token 消耗,官方公告没有给出完整数字;二是 Responses API 的工具调用、流式事件和多轮状态是否与现有实现逐项一致;三是 off-peak 的时间窗口如何按账户、区域和任务类型计算;四是高峰时段是否存在排队、限流或吞吐变化;五是 V4-Pro 与 V4-Flash 在真实业务任务上的质量差异是否足以抵消价格差。

短期不要碰的做法

不要把 max effort 设成所有请求的默认值,也不要把“价格便宜一半”理解成“系统成本自动下降一半”。如果高 effort 让单次请求耗时翻倍、重试减少有限,最终单位有效任务成本可能并没有下降。也不要只根据协议兼容就直接替换线上模型,至少要先跑工具调用、结构化输出、超时和失败重试测试。

我的判断

第一,V4-Pro 这次发布的核心产品不是单独的模型能力,而是“推理预算 + 调度价格 + Agent 协议”的组合。第二,最值得先落地的不是把所有线上流量迁移过去,而是拿一批可回放任务做 effort 与峰谷调度实验。第三,如果你的系统有明显的离线任务,off-peak 低 50% 可能比一次 benchmark 排名更快转化成真实成本收益;如果全部请求都要求即时响应,这项价格能力的价值会被大幅削弱。

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 DeepSeek 官方文档页 DeepSeek-V4-Pro GA Release,发布日期为 2026-08-13。官方页确认 V4-Pro GA、可调 reasoning effort、Responses API、Codex 一键设置,以及 off-peak 比 peak 低 50%、新价格于 2026-08-16 16:00 UTC 生效。

Q2:现在可以直接把现有 Agent 切到 V4-Pro 吗?

A:可以开始做兼容性验证,但不建议跳过灰度。先用小规模回放任务测试文本输出、工具调用、流式事件、结构化结果、超时与重试,再比较旧后端和 V4-Pro 的有效任务成本。

Q3:哪些任务适合放到 off-peak?

A:不要求即时反馈的批处理更合适,例如历史文档摘要、离线评测、索引预处理和夜间报告。实时交互、告警响应和用户正在等待的任务不应为了省费用而延迟。

Q4:reasoning effort 应该怎么选?

A:先按任务复杂度分档,而不是按模型名称分档。简单抽取从低档开始;需要多步规划或工具调用的任务测试高档;只有高错误成本、复杂且可接受更高延迟的任务,才考虑 max 档。

Q5:官方公告有没有给出完整价格表和 benchmark?

A:这篇公告只明确说明 off-peak 比 peak 低 50% 以及生效时间,没有给出本文所需的完整价格表、每档预算和独立 benchmark。因此这些指标必须等待更完整的价格文档,或由工程团队用自己的任务集实测。


参考资料:

  1. DeepSeek-V4-Pro GA Release — DeepSeek API Docs(2026-08-13,官方发布页)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、商业秘密或未脱敏身份字段
封面 seed:2026-08-14-deepseek-v4-pro-agent-pricing(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-14-deepseek-v4-pro-agent-pricing/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可