Margrop
Articles396
Tags841
Categories7

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 30s timeout 4-bit 量化 6-DoF SLAM AC ACL ACL 切换 ACP AI AI Agent AI Coding Assistant AI Tech AI tutor AI 安全 AI 日记 AI编程助手 AI辅助 AI辅助编程 AMIE AP API API 降价 ARC-AGI-3 ASR ATEM chat 模板 Agent Agent Harness Agent 入侵 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 路由 AgentPlan Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Attention Baseten Blog CC-Switch CI/CD CLI Tools CLI 工具 CLI工具 CPU 推理 CSRF Cache Hit Rate Caddy Categories 404 ChatGPT Claude Code Claude Sonnet ClawLoader Cloudflare Code Interpreter Codex Coding Plan Coding Plan Dashboard ComfyUI Computer Use Context Compression Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron D1 DFIR DIY-MINI Date DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Docker Compose Efficiency Tools Electerm Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Flask GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-Live GPT-Red GPU 加速 GPU 性能分析 Gateway Gemini Gemini 3.5 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub GitHub Actions GitHub PR Google Google AI Google Research Grabette Gripette HA HADashboard HF Security Incident Hailuo Hermes HermesAgent Hexo HomeAssistant Hugging Face Hugo IBM Research IP IPv4 Inference Providers Isaac Lab Java KV cache Kimi Kimi Code Kimi K3 Kubernetes LFM2.5 LLM Router LVM‑Thin LeRobot Linux Liquid AI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Markdown Memory 上限 Meta Microsoft 365 Copilot MiniMax MiniMax H3 Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NewAPI Newton Nginx Node-RED Node.js Nunchaku OAuth 凭据 OOM OlmoEarth On-device AI Open Source Open Viking OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 PPPoE Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RPC RTEB Real-Time Inference Red Teaming Responses API Restart SIGTERM SNAP SOCKS5 SOCKS5 代理 SPED SSH 审计 SSL SVDQuant Scientific Computing Self-Forcing Distillation Session Shell Skill 管理 Sol Subagent Surgical Robotics Synology NAS TTS Terra Think button TimeMachine TutorMoments UI 微调 UML Uptime Kuma VPN VPS VoiceEQ WARP Web WebRTC WebSocket Win11 Windows Workers World Foundation Model activate ad adb adblock agent agentic aligenie aliyun alpine annotation aop authy autofs backup baidupan bash bg-review bitwarden boot brew browser budget control caddy2 cc-switch-cli cdn centos cert certbot charles chat chrome classloader client clone closures cloudflare cmd command commit commoditization conn_id container cron 排错 crontab cross_sync ctyun cyber capability dashboard ddsm demo dependency deploy developer devtools disconnect topic dll dns docker domain download drafter draw drawio dsm dump dylib easytier edge environment hooks exception exit code 1 export fail2ban feign firewall-cmd flow fork free tier frontier hosted model frp frpc frps fuckgfw full-duplex function fuzzy match gateway gcc gfw git github glm-latest golang gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage idea image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iptv ipv6 iso java javascript jetbrains jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s keepalive keepalive ping timeout kernel key kid kms kodi koolproxy koolproxyr kvm lan lastpass launchctl learning lede letsencrypt linux live llama.cpp low-code lvm lxc m3u8 mac macos mariadb markdown maven md5 mdadm memory 上限 microcode mirror modem modules monitor mount mstsc multimodal mysql n2n n5105 nas network newapi nfs no close frame node node-red nodejs nohup notepad++ npm nssm ntp one-api 容器 oop open weights openclaw openfeign openssl openviking os otp ovz p14 packet capture pat pdf pem perf ping pip plugin png powerbutton print pro productive struggle proxy pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina root route router rule rules runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student skill_manage slmgr so socks source spk spring springboot springfox ssh ssl stash string supernode support svg svn swagger sync synology systemctl systemd tap tap-windows tapwindows telecom template terminal tls tmux token totp tvbox txt ubuntu udisk ui undertow uninstall unlocker upgrade url v2ray vLLM vhd viking_search vim vlmcsd vm vmdk web websocket wechat windows with worker wow xiaoya xml yum zai-org/GLM-5.2 zip 三维切片 上下文压缩 个人品牌 中国电信 临时关权限 临时提权 云电脑 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 体检 供应链 值班 健康检查 光猫 免费层 公众号 公网IP 内存 内存优化 内容发布 内网 内网IP 内网渗透 写作 分布式推理 分布式训练 医疗 AI 升级 协作 协作习惯 协议层 协议转换 单平台型异常 博客 博客同步 博客改名 博客运维 卫星影像 反向代理 反诉 变更审计 可靠性 后台 Review 启动 告警 告警优化 周一 周一傍晚 周一焦虑 周三傍晚 周五 周六 周四傍晚 周四晚 周报 周日 周末 回滚 地球观测 地理空间推理 复盘评测 夏令时 多 agent 工具链 多 token 预测 多协议并发 多智能体 多模态 多节点 多节点管理 多语言 多通道并发 大厂人才战 大模型评测 天猫精灵 天翼云 失败模式 字体大小 安全 安全事件 安全意识 安装 定时任务 实战反思 实时语音 客户端 SDK 容器 容器网络 导入 小米 工作感悟 工具审计 工具白名单 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 并发窗口 广告屏蔽 序列号 应用市场 开放 API 开权重 开源权重 开源模型 开源项目 异常 异步任务 异步委派 微信 微信公众号 微信限流 心智成长 心跳 心跳检查 性能优化 总账号数 感悟 成本控制 打工 打工人 打工人日记 扩散模型 技术 抓包 按 provider 优先级 排查 排障思路 推理加速 描述文件 提示词工程 提示词敏感性 故障 故障恢复 故障排查 效率 效率工具 教育数据开源 教育评测 数据 文本编码器 断线重连 旁路由 无服务器 日志排查 日记 时区 时段权限 显卡虚拟化 智能体集成 智能家居 智能音箱 暗黑风格 服务器 服务管理 本地 agent 本地安装 本地接口 机器人仿真 机器人数据采集 权限管理 架构 框架级切片 梯子 模块 模型推理 模型精简 模型路由 残存访问 治理层 流式推理 流程 流程图 浏览器 漫游 激活 火山引擎 火绒 灾难恢复 焦虑 独立仓库 玄学 生活 电信 画图 监控 监控系统 监管 直播源 直觉 磁盘 磁盘故障 稀疏样本 稀疏注意力 立体声 端口 端口冲突 端口扫描 管理 续期 网关 网络 网络风暴 群晖 群晖 NAS 脚本 脚本优化 腾讯 自动化 自动化反思 自动化运维 自动恢复 自动攻击 自动重启 自动重连 自托管 LLM 网关 自部署 苹果 虚拟机 视觉验收 视频生成 视频问诊 订阅额度 认证 证书 评测基准 评测方法学 诉讼 语雀 语音 AI 语音 Agent 质量检查 超时 跨平台 路由 路由器 软件管家 软路由 运维 运维日常 运维监控 进程生命周期 远程接口 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 钉钉 钉钉断开 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 需求变更 飞书

Hitokoto

Archive

Google AMIE 视频问诊离真实部署还有多远?关键不只是看懂画面

Google AMIE 视频问诊离真实部署还有多远?关键不只是看懂画面

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

多模态医疗 AI 进行实时视频问诊

先说结论

Google Research 在 2026 年 8 月 11 日公布了 AMIE 的最新研究:这个基于 Gemini、结合 Project Astra 和多智能体架构的医疗 AI 系统,开始展示实时临床视频问诊能力。它不再只处理文字病史,而是同时理解患者的视觉和听觉线索、引导远程体格检查,并在对话中进行诊断推理。

我的判断是:这是一条重要的多模态 Agent 研究信号,但还不是“AI 医生即将上线”的产品公告。官方材料只说明了模拟问诊研究中,临床评估者对 AMIE 在问诊完整性、诊断准确性、处理方案适当性和沟通质量等方面给出积极评价,也提到患者演员更偏好视频体验而不是文字聊天;它同时明确强调,AMIE 仍是研究系统,距离负责任的真实临床部署还需要更多研究。真正值得工程团队学习的,不是“模型能看视频”这一句,而是多模态感知、主动检查、诊断推理和对话控制被组合成了一条可评估的 Agent 流程

发生了什么

Google Research 与 Google DeepMind 在 Google 官方博客发布《AMIE: Advancing medical AI for video consultations》,发布时间为 2026-08-11,作者署名为 Research Lead Anil Palepu。原始来源:

官方事实可以概括为四点:

  1. AMIE 是 Google 的研究型医疗 AI 系统,本次能力建立在 Gemini 和 Project Astra 之上,并采用多智能体架构;
  2. 系统面向实时视频问诊,能够解释视觉、听觉线索,指导虚拟体格检查,并进行实时诊断推理;
  3. 研究使用模拟问诊,由患者演员参与,并与一组基层医疗医生进行比较评估;
  4. 临床评估者从多个核心能力维度进行判断,患者演员在体验偏好上更倾向视频方式;但系统仍处于研究阶段,不能据此推导出真实医疗场景已经可用。

这里必须把“评估结果积极”和“可以部署”分开。模拟问诊能验证交互流程和部分能力,却不能替代真实患者、真实责任边界、跨人群泛化、医疗监管、隐私保护与长期随访效果。官方页面本身已经给出了这个边界,任何把它改写成“AMIE 已经超过医生”的标题,都是把研究信号夸大成产品结论。

技术细节

1. 从文字问诊到视频中的多模态状态估计

传统文字问诊的输入主要是用户主动描述的症状。视频问诊的输入更复杂:患者说了什么、语气如何、是否咳嗽、姿态是否异常、面部是否出现可观察的不适,都可能影响后续问题。AMIE 的变化不是简单增加一个视觉模型,而是让 Agent 在问诊过程中持续维护一个多模态状态:

1
2
3
4
5
视觉线索 + 听觉线索 + 对话历史

当前临床假设与不确定性

下一步追问 / 虚拟检查 / 风险分流

官方介绍强调,AMIE 可以理解视觉和听觉线索、引导虚拟体格检查,并进行实时诊断推理。工程上最关键的词是“实时”:模型不是把整段视频录完后离线分类,而要在交互中决定下一步做什么。它必须平衡延迟、上下文长度、视觉观察频率和问题顺序,否则“能看见”并不等于“能问对”。

2. 多智能体架构的价值不只是并行

官方将 AMIE 描述为结合 Gemini 与 Project Astra 的多智能体系统。对于 Agent 工程而言,多智能体的价值并不只是把任务拆给几个模型,而是可以让不同角色承担不同的认知职责:一个角色维护问诊对话,一个角色负责视觉观察,一个角色检查临床安全边界,另一个角色把结果汇总成下一步建议。

这种分工有两个收益。第一,观察和表达可以分开,避免负责聊天的模型忘记持续检查画面。第二,评估和生成可以分开,让一个组件提出诊断假设,另一个组件专门寻找反例或缺失信息。代价也很明显:状态同步更难,延迟更高,任何一个子 Agent 的错误都可能污染最终回答。因此,多智能体并不自动等于更可靠,必须有明确的状态协议和可追踪的决策记录。

3. 虚拟体格检查把 Agent 从问答推向行动规划

问诊系统如果只会提问,仍然更像一个高级聊天机器人。AMIE 能够引导虚拟体格检查,意味着它需要把自然语言转换为一组有顺序、有安全边界的动作指令:让患者观察某个现象、调整姿势、完成一个简单动作,再根据反馈决定是否继续。

这是一种典型的 Agent loop:

1
2
3
提出检查动作 → 获得视频 / 语音反馈 → 更新假设
↑ ↓
└──── 安全检查与下一步规划 ←┘

医疗场景对此要求尤其严格。动作不能只追求信息量,还要考虑患者是否理解、是否会造成风险、是否需要立即转人工。也就是说,视频问诊的难点不在于给模型接一个摄像头,而在于把观察、行动、解释和升级处理连成一个受治理的循环。

4. 评估维度比单一准确率更接近真实使用

Google 官方介绍的评估维度包括问病史的完整性、诊断准确性、处理方案是否适当以及沟通质量。这组维度值得注意,因为它没有把医疗 AI 简化为一个“猜疾病”的分类器。

  • 问诊完整性关注模型有没有遗漏关键问题;
  • 诊断准确性关注形成的判断是否与临床事实一致;
  • 处理方案适当性关注建议是否合理、安全,是否需要分流;
  • 沟通质量关注患者是否听得懂、是否愿意继续配合。

一个模型即使诊断猜得准,如果漏掉红旗症状、给出不适当的处理建议,或者无法让患者完成检查,也不能称为合格的问诊 Agent。对其他领域的 Agent 也一样:最终评估不能只看任务完成率,还要看过程是否完整、行动是否安全、沟通是否可用。

对 Agent / 工程的影响

第一,摄像头不是多模态产品的终点

很多团队把多模态升级理解成“把图片或视频传给模型”。AMIE 展示的方向更接近持续感知系统:模型需要知道什么时候看、看什么、观察结果如何改变下一步问题。工程上应当提前设计观察频率、事件触发、状态摘要和不确定性表达,而不是把整段视频无差别塞进上下文。

第二,需要把“升级到人工”作为一等能力

医疗场景不允许 Agent 把每个问题都强行回答到底。一个可靠系统应当明确:哪些信息不足时必须追问,哪些症状组合出现时必须停止自动处理,哪些判断只能交给专业人员。这个原则也适用于客服、财务和安全运维:主动承认不确定性并触发升级,不是失败,而是治理能力

第三,多智能体必须配套可审计状态

当视觉观察、对话、规划和安全检查由不同组件负责时,生产系统至少要记录每一步使用了哪些输入、产生了什么观察、为什么选择下一动作。否则出了问题只能看到最后一句回答,看不到哪个环节把错误假设传了下去。这里的审计不是把内部隐私原样保存,而是保存经过脱敏的决策摘要和版本信息。

第四,视频问诊的评测要覆盖时间维度

静态图片评测无法回答“模型在连续对话中是否忘记了前面的观察”。未来评测至少应包含:不同时间点的视觉理解是否一致、患者动作变化后模型是否及时更新判断、长对话中是否出现上下文漂移、低带宽和高延迟时是否安全降级。视频 Agent 的质量不是一帧一帧的平均分,而是完整轨迹上的稳定性。

我的判断

第一,AMIE 的真正价值在于把“多模态理解”推进成了一个带行动规划和临床评估的 Agent loop,而不是又增加了一项视觉识别能力。第二,模拟问诊结果只能说明研究路径值得继续,不能替代真实部署验证。第三,对普通 Agent 团队最可复用的启发是:把观察、决策、行动、升级和审计一起设计,别只盯着最后的文本答案

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 AMIE: Advancing medical AI for video consultations — Google Blog,Google Research / Google DeepMind,发布于 2026-08-11。页面明确说明 AMIE 是研究系统,并列出实时视频问诊、视觉与听觉线索、虚拟体格检查和模拟问诊评估等信息。

Q2:AMIE 已经可以替代真实医生了吗?

A:不能这样理解。当前公开材料描述的是模拟问诊研究和研究型系统,官方明确表示还需要更多研究,才能讨论负责任的真实临床部署。真实使用还涉及医疗责任、监管、隐私、不同人群泛化和长期效果。

Q3:这和普通的“图片识别 + 聊天”有什么区别?

A:关键差异是连续交互和行动规划。系统不仅要看一次图片,还要根据视觉、听觉和对话状态决定下一步追问或检查,并在不确定时进行分流。工程难点从“识别内容”升级为“管理一条安全的决策轨迹”。

Q4:其他 Agent 团队现在能复用什么?

A:可以复用四层结构:多模态观察、状态更新、动作规划、安全升级。即使业务不是医疗,也可以把它用于远程巡检、客服质检或现场作业辅助。但必须重新定义各场景的红线,不能直接照搬医疗结论。

Q5:最容易踩的坑是什么?

A:把一次积极的模拟评估当成生产可用性证明;只测首帧或单轮回答,不测长时间轨迹;只追求诊断或任务准确率,忽略沟通、拒答和人工升级。视频 Agent 的上线标准应该比普通聊天机器人更严格,而不是因为“看起来更聪明”就放宽标准。


参考资料:

  1. AMIE: Advancing medical AI for video consultations — Google Blog(2026-08-11,主体来源)
  2. Google Research blog(研究项目入口)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话信息

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-12-google-amie-video-consultation/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可