Margrop
Articles243
Tags633
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI Agent AI Coding Assistant AI Tech AI tutor AI 安全 AI 应用 AI 日记 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 Agent Agent Harness Agent Memory Agent 入侵 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter Codex ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-Live GPT-Red GPU 加速 GPU 性能分析 Gateway Gemini Gemini 3.5 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Research Google Sheets Grabette Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo HomeAssistant Hugging Face IBM Research Inference Providers Isaac Lab Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TTS Terra Think button TimeMachine TutorMoments UML Uptime Kuma V4-Pro VPS VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 上下文压缩 上下文工程 交换机 人才争夺 代理 企业 AI 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 向量检索 启动 告警 告警优化 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多智能体 多模态 多模态 Agent 多语言 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安装 定时任务 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 成本优化 成本控制 扩散模型 技术 抓包 按 provider 优先级 排查 推理加速 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 漫游 火绒 电信 画图 监控 监控系统 监管 磁盘 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 续期 网关 网络 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

Google AMIE 视频问诊能做什么?多模态医疗 Agent 离真实部署还有多远

Google AMIE 视频问诊能做什么?多模态医疗 Agent 离真实部署还有多远

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

AMIE 视频问诊与多模态医疗 Agent

先说结论

先说明时间范围:本文不是过去 72 小时内的新发布,而是对 2026 年 8 月 11 日官方资料的一次技术复盘。本轮新闻抓取没有拿到足够可靠、且确实落在过去 72 小时内的官方医疗 AI 新闻,因此不把它伪装成“今天刚发生”。选择这篇材料,是因为它能具体说明多模态 Agent 如何把观察、提问、动作和推理连成闭环。

这件事最值得关注的地方,不是“AI 要不要马上替医生看病”,而是多模态 Agent 的工作方式正在从回答问题,走向持续观察、主动提问、安排动作,再把多个信号合起来判断。但 AMIE 仍是研究系统,文章描述的是模拟问诊和研究评估,距离真实医疗部署还需要更多验证、监管和安全边界。

发生了什么

主体来源是 Google 官方文章 AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities,发布日期为 2026-08-11,作者是 Google Research 的 Anil Palepu。

官方介绍的 AMIE 基于 Gemini 和 Project Astra,并采用多 Agent 架构。它能够在视频问诊中理解视觉与听觉线索,引导虚拟体格检查,并进行实时诊断推理。研究使用了模拟问诊:参与者包括扮演患者的演员,以及一组基层医生;临床评估者从问诊完整度、诊断准确性、处理方案合适程度和沟通质量等方面进行评价。Google 还表示,患者演员对视频体验的偏好高于文字聊天。

这些是官方文章事实。至于它是否能进入普通 Agent、为什么多模态输入会改变工具设计,以及真实部署最难的地方在哪里,下面是我的工程判断。

技术细节

1. 视频问诊不是“把摄像头接给聊天机器人”

普通文字 Agent 的输入像一张张纸条:用户写一句,模型读一句,再回复一句。视频问诊更像医生坐在对面持续观察:除了说了什么,还要注意咳嗽、动作、表情、呼吸节奏和检查过程中的变化。

可以把 AMIE 这类系统理解成一个会同时看几种“传感器”的 Agent:

1
2
3
4
5
声音:患者说了什么、语气和停顿如何
画面:姿态、动作、可见症状和检查过程
对话:已经问过什么、哪些信息还缺失
流程:下一步应该问什么、做什么检查
推理:不同线索组合后支持哪些可能性

小学生也能理解的比喻是:只听一个人讲故事,就像只看一张成绩单;同时看、听、问和观察过程,才像老师真正了解一个学生。多模态的价值不只是信息更多,而是信息之间可以互相验证。

2. 多 Agent 架构更像一个小团队

官方文章提到 AMIE 使用多 Agent 架构,但没有在这篇介绍页中展开所有内部模块。工程上可以把它理解为一个小团队协作:一个成员负责听懂和记录,一个成员安排问诊步骤,一个成员根据症状和检查结果做推理,最后还需要一个角色检查回答是否安全、是否越过边界。

这种拆分比让一个模型从头到尾包办所有事情更容易治理。不同模块可以有不同的权限:观察模块可以读取输入,流程模块可以提出下一步问题,工具模块可以调用检查能力,但真正改变外部状态的动作仍然需要规则和人工确认。

这里的关键不是“Agent 越多越先进”,而是每个模块的责任、输入和输出必须清楚。如果多个模块都能随意下结论,出了问题就很难知道是谁把一个不确定的猜测变成了确定建议。

3. 虚拟体格检查要求 Agent 会引导动作

文字问答主要是问和答;虚拟体格检查还要让对方完成动作,并判断动作是否完成。例如,系统可能需要请参与者把摄像头移近、转动身体、展示某个部位,或者重复一个动作。

这会带来一个新的闭环:

1
2
3
4
5
6
7
8
9
提出简单指令

观察对方是否理解并完成动作

检查画面是否足够清楚

必要时重新指导

把观察结果加入后续推理

这和调用普通工具很像,只不过工具不是数据库或网页,而是摄像头前的人。Agent 不仅要“给出答案”,还要确认上一步真的完成了,否则后面的判断可能建立在一张模糊画面或错误姿势上。

4. 实时诊断推理更看重时间顺序

一次问诊不是把所有信息同时放进模型。患者先说一个症状,医生追问,检查出现新线索,再调整下一步。信息的先后顺序会改变判断,也会决定应该问什么。

因此,系统需要保存的不只是最终文字摘要,还包括:哪些线索何时出现、哪些问题已经问过、哪个观察结果来自哪个动作、哪些结论仍然只是可能性。否则后续模块可能把“正在验证的猜想”误当成“已经确认的事实”。

对一般 Agent 也是一样。一个多模态客服、巡检或会议助手,都需要区分原始观察、模型解释和最终行动。把这三层混在一起,系统就会显得很聪明,却很难审计。

5. 研究评估和真实医疗部署不是一回事

Google 描述的研究使用模拟问诊、患者演员和基层医生,临床评估者从多个能力维度进行评价。这种设计适合比较问诊体验和能力表现,也比只做静态问答更接近真实场景。

但模拟环境仍然不是医院。真实部署还会面对设备差异、网络中断、方言、隐私保护、儿童和老年人、复杂病史、紧急情况,以及模型无法判断时如何及时升级给专业人员。

因此,“评估者更喜欢”或“视频体验更好”不能直接翻译成“可以独立诊断”。它只能说明这条研究路线值得继续研究,不能替代临床试验和责任体系。

对 Agent / 工程的影响

第一,多模态 Agent 的工具不是越多越好,而是要有观察闭环

如果一个 Agent 能看图、听声音、读文字,工具设计就不能只返回一段自然语言。每个观察结果最好带上来源类型、时间点、置信度和是否需要再次确认。

例如,一个巡检 Agent 看到设备指示灯异常,不应该只输出“设备故障”,而应该记录“画面中看到什么、是否清晰、是否持续、下一步需要哪项检查”。医疗只是高风险例子,生产巡检、家庭照护和视频客服也有同样问题。

第二,流程控制要和模型推理分开

一个安全的多模态 Agent 应该由流程层决定哪些步骤可以执行,由模型负责理解和提出建议。流程层可以规定:没有清晰画面就不能继续;关键字段缺失就必须追问;高风险结论必须人工复核;连续几次无法确认就升级给人工。

这就像机场安检:工作人员可以观察和判断,但不能因为“看起来应该没问题”就跳过固定检查。模型越强,越需要把它放在清晰的流程边界里,而不是给它一把万能钥匙。

第三,视频输入会放大隐私和数据治理问题

文字记录已经需要保护,视频和声音包含的身份线索更多。画面中的脸、家庭环境、屏幕内容、地理特征和背景声音,都可能成为敏感信息。

工程上至少要考虑最小化采集、明确保存期限、访问审计、传输加密、脱敏处理和用户撤回。对 Agent 记忆系统来说,视频中的一次短暂观察不能自动变成永久记忆;应该区分临时上下文、经过确认的事实和可以长期保存的偏好。

第四,评测要从“答得像不像”升级为“过程做没做对”

多模态 Agent 的测试集不能只给一段视频然后比较最终回答。更有价值的指标包括:是否问到了关键问题、是否正确引导动作、是否发现画面不清、是否把观察和猜测分开、是否在不确定时升级,以及是否避免执行越权动作。

可以建立一条过程评测链:输入质量、观察准确率、追问覆盖率、检查完成率、结论一致性、升级准确率和最终任务成功率。这样才能发现“最终答案碰巧正确,但中间过程很危险”的系统。

我的判断

AMIE 的视频问诊研究说明,多模态 Agent 的下一步不是简单增加一个摄像头,而是把观察、对话、流程和推理组成一个持续闭环。它对医疗有潜力,对客服、巡检和远程协作也有启发。

我的态度是值得研究,不宜抢跑。在高风险领域,先把来源标记、流程闸门、人工升级、隐私治理和过程评测做扎实,再讨论模型能不能独立完成更多工作。多模态能力真正成熟的标志,不是它能说出多像医生的话,而是它知道什么时候看不清、什么时候不确定,以及什么时候必须把事情交还给人。

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 Google 官方文章 AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities,发布日期为 2026-08-11,作者是 Google Research 的 Anil Palepu。

Q2:AMIE 已经可以替代医生了吗?

A:不能这样理解。Google 明确称 AMIE 仍是研究系统,现有介绍基于模拟问诊和研究评估,真实部署还需要更多研究、临床验证、监管和安全体系。

Q3:它比文字 Agent 多了什么能力?

A:官方介绍它能同时理解视觉与听觉线索,引导虚拟体格检查,并在实时问诊中进行诊断推理。多模态输入让 Agent 可以观察动作和画面,但也带来更高的隐私与误判风险。

Q4:为什么要使用多 Agent 架构?

A:把观察、流程、推理和安全检查拆开,有助于明确责任和权限。它不是天然更安全,仍需要严格定义模块边界、输出格式和人工升级条件。

Q5:普通 Agent 可以借鉴什么?

A:把一次任务拆成观察、追问、动作、验证和升级几个阶段;为每个观察保留来源和置信度;遇到输入不清或结论风险高时,优先复核而不是继续自动执行。


参考资料:

  1. AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities — Google Research(2026-08-11,Google 官方文章)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话标识
封面 seed:2026-08-24-amie-video-consultation-agent(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-24-amie-video-consultation-agent/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可