Margrop
Articles261
Tags676
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 安全 AI 工程 AI 应用 AI 日记 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安装 定时任务 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 按 provider 优先级 排查 推理加速 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

GPT-5.6 Sol 做量子计算实验:AI Agent 能把研究流程推进到哪一步?

GPT-5.6 Sol 做量子计算实验:AI Agent 能把研究流程推进到哪一步?

GPT-5.6 Sol 与量子计算实验

先说结论

OpenAI 最近发布的案例《How GPT-5.6 Sol helps run quantum computing experiments》,把 GPT-5.6 Sol 放进了量子计算实验流程,而不是只展示一个聊天窗口里的答案。这个案例真正值得 Agent 工程师关注的地方,是模型开始参与“提出假设—编写实验代码—运行验证—解释结果”的连续工作流。

我的判断是:科研 Agent 的价值不在于让模型替研究人员按下一个“发现按钮”,而在于把大量可重复、可检查的实验劳动压缩成更短的迭代周期。但这类系统越接近真实实验,越不能把模型输出直接当作结论。代码、实验参数、测量结果和解释必须分别留痕,并且每一步都要有可复现的验收条件。

发生了什么

本文主来源是 OpenAI 官方文章 How GPT-5.6 Sol helps run quantum computing experiments,发布日期为 2026-09-08。官方事实是:GPT-5.6 Sol 被用于协助量子计算实验,文章将重点放在模型如何参与实验过程,而不是单纯比较问答分数。

需要区分两层内容。上面这段是官方页面明确表达的事件事实;下文关于 Agent 分层、证据链和上线边界,是我基于这个案例做的工程分析。由于官方页面在抓取时受到访问保护,本文不补写无法核验的性能数字,也不把案例描述扩大成“模型已经独立完成科学发现”。

技术细节

1. 量子实验天然适合拆成工具链

一个量子计算实验通常可以拆成几类动作:定义问题和假设,选择电路或算法,生成实验代码,提交到模拟器或量子硬件,读取测量结果,再根据结果调整下一轮实验。模型最适合参与其中的“候选生成”和“实验编排”部分;真正的执行仍然需要确定性的工具接口。

这和普通聊天的差别很大。聊天只要回答看起来合理,任务就可能结束;实验工作流必须把输入参数、代码版本、运行环境、随机种子、测量结果和失败原因一起保存。没有这些证据,模型给出的“结果解释”只能算一个待验证假设。

2. Agent 的核心不是一条超长提示词

如果把整个实验过程塞进一条提示词,系统很快会遇到上下文膨胀、状态丢失和错误难以定位的问题。更稳妥的设计是把流程拆成几个有明确输入输出的阶段:规划器只产生实验计划,代码代理只修改受限目录中的实验代码,执行器只调用白名单工具,分析器只读取结构化结果,审查器负责检查是否满足停止条件。

每个阶段都应该输出版本化结构。例如实验计划可以包含问题、假设、变量、预算和预期观测;执行结果可以包含状态、日志摘要、测量数据位置和校验值。模型可以解释这些字段,但不能自行改变字段含义,也不能绕过 Schema 验证。

3. 量子结果尤其需要区分“噪声”和“新现象”

量子实验的测量结果通常带有统计波动,硬件还可能引入退相干、门误差和读出误差。模型看到一次异常曲线时,可能会倾向于给出一个漂亮的解释;工程系统却应该先问:样本量够不够?对照实验是否存在?同样参数重跑是否复现?模拟器与硬件的差异是否已隔离?

因此,分析阶段不应只让模型输出自然语言结论,而要强制它同时列出支持证据、替代解释、尚未验证的假设和下一步最小实验。未知项必须保留为未知,不能为了让报告完整而补成确定事实。这条原则适用于科研 Agent,也适用于任何会调用外部工具的通用 Agent。

4. 工具权限要比模型能力更早设计

量子硬件、云计算资源和实验数据都可能产生真实成本。一个能写代码的模型不应默认拥有提交任务、扩大预算、删除结果或修改生产配置的权限。推荐把权限拆成只读、模拟运行、低预算试跑和正式提交四级,并为每一级设置人工确认或自动阈值。

对 Agent / 工程的影响

第一,评估指标要从“回答是否正确”扩展到“实验闭环是否可靠”。至少要测计划通过率、代码可执行率、结果复现率、无效实验比例、平均工具调用次数和单次实验成本。只测最终文字报告,很容易掩盖中间步骤的错误。

第二,记忆层应保存实验事实而不是模型印象。下一轮 Agent 需要找回的是某个参数组合、对应的代码版本、真实测量结果和失败原因,而不是一段没有来源的“上次经验总结”。这也是科研 Agent 与普通知识问答系统的分水岭。

第三,失败恢复必须是显式状态机。网络超时、硬件排队、结果格式错误、测量方差过大和代码回归,应该分别进入不同的重试或人工审查路径。让模型自由决定“再试一次”会造成重复计费,甚至把偶然噪声误判为进展。

我的判断

GPT-5.6 Sol 参与量子实验的意义,不是证明通用模型已经替代物理学家,而是展示了一个更现实的方向:模型可以成为实验室里的“高带宽研究助理”,负责把想法快速翻译成可执行的候选实验,再把结果整理成便于人审查的证据包。

我更看好“人定义问题,Agent 扩大搜索,工具产生证据,人批准结论”的结构,而不是完全自动化的黑箱科学家。短期内,最容易落地的场景是算法原型、参数扫描、文献中的实验复现和低风险模拟;涉及昂贵硬件、不可逆操作或正式论文结论时,人工复核仍然是系统的一部分,不是流程上的障碍。

Q&A

Q1:这是不是说明 GPT-5.6 Sol 已经能独立做科学研究?

不是。官方案例说明它被用于协助量子计算实验,并不等于它独立提出、验证并确认了新的科学结论。是否“独立”必须看权限、实验设计、复现证据和最终责任边界。

Q2:为什么不能让模型直接执行实验代码?

可以在受控环境中执行,但应先经过代码审查、资源预算、工具白名单和结果校验。模型生成代码只是候选动作,不能自动获得硬件或数据权限。

Q3:普通 Agent 工程师能借鉴什么?

最值得借鉴的是实验闭环:把计划、执行、观测和解释拆开,为每一步定义结构化输出,并保留能回放的证据。无论工具是量子模拟器、浏览器还是数据库,这套边界都成立。

来源

  1. OpenAI,How GPT-5.6 Sol helps run quantum computing experiments,发布日期:2026-09-08,原始 URL:https://openai.com/index/codex-quantum-computing-experiments
本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-09-09-gpt56-sol-quantum-experiments/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可