Margrop
Articles262
Tags678
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安装 定时任务 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 按 provider 优先级 排查 推理加速 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

Google AI & Economy ATLAS:Agent 生产力数据能否指导工程投入?

Google AI & Economy ATLAS:Agent 生产力数据能否指导工程投入?

Google AI & Economy ATLAS 与 Agent 工程

先说结论

Google 在 2026 年 9 月 15 日更新了 AI & Economy ATLAS,公开了新的交互式数据探索入口,并发布了基于 ATLAS 的科学家 AI 使用研究。最值得工程团队注意的不是“AI 使用率又涨了”,而是数据把生产力提升和流程瓶颈放在了同一张图里:受访科学家平均每周节省接近 7 小时,但验证输出、物理实验和临床验证等环节出现了新的积压。

我的判断是:Agent 项目的投资决策不能只看模型调用次数或单个员工节省了多少时间,还要看下游是否有能力消化新增的计划、假设和任务。如果 Agent 只加速前端生成,却让审批、实验、核验和交付排队,系统得到的不是生产力,而是更大的工作队列。ATLAS 的价值正在于提醒我们:工程指标必须覆盖完整流程,而不是只测模型这一段。

发生了什么

主来源是 Google 官方博客文章 New insights from Google’s AI & Economy ATLAS,发布日期为 2026-09-15。Google 表示,新的开放式交互体验可以帮助读者探索 ATLAS 的数百万个全球数据点,包括不同职业的 AI 使用情况、不同国家的采用率,以及人们在工作和生活中如何使用 AI。

官方还披露了几组具体观察。印度的创意产业使用 AI 的比例高于全球其他地区,艺术、设计、娱乐、体育和媒体相关职业占工作场景 AI 使用的 19%,约为全球平均份额的 1.6 倍。美国的技术类 AI 采用更突出,计算机与数学职业占工作场景 AI 使用的 30%,约为其他地区的两倍。对于人工任务,巴西和德国有 7% 的工作场景 AI 使用用于实时设备诊断和故障排查,是全球平均水平的 1.4 倍;日本对应比例为 4%。

Google、Google DeepMind 与 MIT FutureTech 的新研究,则分析了 2600 个专业 AI 模型,并调查了 600 多名美国和英国科学家。官方说,接近一半受访科学家每天使用某种 AI;他们平均每周节省接近 7 小时。不过,研究同时发现,AI 输出验证的时间增加,尚未测试的假设形成积压,物理实验和临床验证成为新的瓶颈。

以上是官方事实。下文关于 Agent 架构、指标设计和工程投入优先级的内容,是我的判断,不是 Google 对所有组织的效果保证。ATLAS 是观察和研究工具,不能直接替代某个团队自己的成本、质量和安全评估。

技术细节

1. ATLAS 不是一个“AI 排名表”

很多 AI 报告最后会变成一个简单排行榜:哪个国家采用率高,哪个职业使用得多,哪个模型更热门。但这次更新更像一个可查询的数据层。它把职业、国家、任务类型和使用场景放到同一个分析框架中,读者可以观察“谁在用 AI”“用来做什么”以及“采用率与经济水平是否匹配”。

这对 Agent 工程有一个直接启示:不要只记录模型名称,要记录任务类型和流程位置。同样一次模型调用,如果用于草拟实验计划、检查代码、生成营销文案或诊断设备,价值、风险和验收标准完全不同。生产系统至少需要把调用映射到任务类别、输入输出类型、人工确认点和最终业务结果,而不是只统计 token 和请求数。

2. LLM 与专业模型是互补关系

Google 的科学家研究指出,大语言模型和专业 AI 模型都被广泛使用,但承担的工作并不完全相同。像 Gemini 这样的 LLM 使用范围覆盖多个科学领域和任务类别;专业模型则更常见于健康与生命科学,以及领域专属的数据预测、生成和模拟任务。

这不是“通用模型将取代专业模型”的证据,反而说明 Agent 更可能成为两者之间的编排层。Agent 可以用 LLM 理解问题、整理文献和提出候选步骤,再把数值预测、分子模拟、图像检测或设备诊断交给专业模型。关键不在于让 LLM 亲自完成所有计算,而在于建立清楚的工具合同:输入 Schema、单位、版本、适用范围、失败状态和结果验证都必须确定。

如果工具输出是数值、分类或模拟结果,Agent 的自然语言解释不能替代原始证据。界面应分别呈现规则结果、输入证据、AI 解释和未知项。尤其在科研和设备诊断场景中,“模型认为可能是故障 A”与“规则检查确认传感器读数超过阈值”不是同一种事实。

3. 节省时间不等于流程产出同比增加

“每周节省接近 7 小时”听起来非常诱人,但它只说明部分工作环节变快了。若一个科研人员原本把时间花在文献整理、代码草拟和结果汇总上,Agent 可以释放这些时间;然而新的假设仍然需要实验,实验仍然需要排期,临床结果仍然需要严格验证。于是,前端生成速度提高后,后端可能出现更长的待办队列。

可以把完整流程抽象成四段:提出问题、生成候选、验证候选、形成可交付结果。Agent 通常最先改善第二段,却未必能同步改善第三和第四段。当第二段的吞吐量超过验证能力时,团队会获得更多“看起来值得做”的想法,但不会自动获得更多可靠结论。

这也是为什么 Agent 评测不能只看响应速度和单轮通过率。还应测验证等待时间、人工复核队列长度、无效候选比例、从候选到交付的周期、重复返工次数以及最终结果质量。否则,系统可能在演示中很快,在真实流程中更堵。

4. 数据要能支持“哪里值得自动化”的判断

ATLAS 的区域和职业差异也说明,自动化机会不是平均分布的。技术职业、创意职业、办公室工作和设备诊断,对 AI 的需求与约束不同。一个组织不能因为某个行业整体采用率高,就把所有岗位统一接入同一个 Agent。

更稳妥的做法是先建立任务地图:哪些步骤输入结构稳定、结果容易验证、失败可回滚;哪些步骤需要专业判断、涉及敏感数据或会产生不可逆影响。前一类适合优先自动化,后一类则应从只读建议、证据整理和人工确认开始。数据分析的作用不是替工程师决定一切,而是帮助工程师找到可测量、可控风险的切入口。

对 Agent / 工程的影响

第一,Agent 项目的核心指标应从“调用量”转向“闭环产出”。建议同时记录单位任务成本、端到端完成时间、验证通过率、人工接管率、返工率和不可逆动作拦截率。对于科研类 Agent,再加入实验复现率、无效实验比例、假设积压量和从计划到验证的等待时间。

第二,路由应该按任务风险和专业性设计。简单的信息整理可以由成本较低的模型完成;需要数值模拟、设备诊断或专业数据预测时,应调用经过版本锁定的领域工具;涉及权限、医疗、财务或外部发布的动作,则必须增加确定性校验和人工确认。不能让模型根据自然语言自评“这件事很简单”,再自行降低安全等级。

第三,工作流要为下游瓶颈留出背压。Agent 不应无限生成候选任务,而应读取验证队列容量、预算和人员可用性。当验证环节已经拥堵时,系统可以降低生成频率、提高候选筛选门槛,或只输出能够自动验证的任务。这样做看似减少了 Agent 的活跃度,实际上更接近真实生产力。

第四,数据治理必须先于大规模接入。ATLAS 公开的是聚合研究数据,企业自己的运行数据可能包含个人、客户、实验或设备信息。日志默认只保留任务类型、模型代号、Schema 版本、状态、耗时和成本等元数据;原始提示词、文件、音频和实验记录按最小必要原则处理,不应为了证明“用过 AI”而无限留存。

第五,先做合成样例和可回放评测。可以构造一组不含真实个人信息的任务,覆盖候选生成、专业工具调用、验证失败、队列拥堵和人工接管。固定输入后重复运行,观察模型是否稳定、规则是否拦截越界动作、失败后是否进入正确降级路径。只有闭环指标改善,才值得扩大模型预算。

我的判断

Google 的 ATLAS 更新最有价值的地方,是把“AI 能节省多少时间”改写成了一个更完整的问题:节省下来的时间最终有没有转化为经过验证的产出?我会把 Agent 投资优先放在可验证、可回滚、下游容量足够的流程,不会因为一项平均节省时间的调查结果,就直接复制到所有团队。

对工程团队来说,最应该借鉴的不是某个地区的采用率,而是“从任务到结果”的测量方式。Agent 的成功标准不是生成更多内容,而是让可信结果更快、更便宜、更可追溯地抵达下一环节。如果验证、审批和交付没有同步升级,继续堆模型只会把瓶颈向后推。

Q&A

Q1:来源和发布日期是什么?

A:来源是 Google 官方博客 New insights from Google’s AI & Economy ATLAS,发布日期为 2026-09-15。文章公布了 ATLAS 的交互式数据探索体验,以及 Google、Google DeepMind 与 MIT FutureTech 基于 ATLAS 的科学家 AI 使用研究。

Q2:科学家每周节省接近 7 小时,是否意味着科研效率提升了同样的比例?

A:不能这样推断。官方数据描述的是受访者报告的时间节省,同时也指出输出验证、物理实验和临床验证存在瓶颈。时间节省只有在后续环节能够消化新增工作,并转化为可靠结果时,才可能体现为完整流程的效率提升。

Q3:Agent 应该优先接入哪些任务?

A:优先选择输入结构稳定、结果容易验证、失败可以回滚的任务,例如资料整理、草稿生成、代码检查和只读诊断建议。涉及权限修改、付款、临床决策、设备控制或对外发布的任务,应先保持只读或人工确认模式。

Q4:LLM 和专业模型应该如何分工?

A:LLM 适合理解问题、规划步骤和整理解释;专业模型或确定性程序负责数值预测、模拟、检测和规则计算。Agent 负责编排,但不能用自然语言解释替代专业工具的原始结果和验证。

Q5:如何在自己的团队复现这类评估?

A:先用脱敏合成任务建立基线,记录端到端耗时、单位成本、验证通过率、人工接管率、返工率和下游队列长度。重复运行并按任务类型拆分,确认收益来自完整流程,而不是只来自某一个模型调用环节。

来源

  1. Google,New insights from Google’s AI & Economy ATLAS,发布日期:2026-09-15,原始 URL:https://blog.google/innovation-and-ai/technology/ai/ai-economy-atlas-september-2026/

本文区分了官方披露的数据与作者的工程判断;调查结果不构成对任何组织、模型或 Agent 系统的性能保证。

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-09-17-google-ai-economy-atlas/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可