Margrop
Articles261
Tags676
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 安全 AI 工程 AI 应用 AI 日记 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安装 定时任务 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 按 provider 优先级 排查 推理加速 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

Google AI 复原七十年记忆:生成式影像如何避免把真实故事变成幻觉?

Google AI 复原七十年记忆:生成式影像如何避免把真实故事变成幻觉?

Google AI 复原七十年记忆

先说结论

Google DeepMind 9 月 9 日公开介绍了纪录短片《Love, Rendered》的制作流程:团队为一对结婚七十多年的夫妻,重建一段从未被拍摄下来的年轻时代记忆。技术上,它不是简单地让模型“生成一张年轻照片”,而是把老照片修复、生成式图像和表演捕捉组合起来,再由当事人持续校正楼梯弧度、鞋跟形状等细节。

这件事对 Agent 工程最重要的启示是:生成式 AI 越接近真实人物和真实经历,越不能把模型的视觉连贯性当成事实。可靠流程应该把可确认的原始材料、模型生成的候选画面、人的修正意见和最终剪辑结果分开管理。模型负责扩大创作空间,人负责确认记忆是否被尊重,系统负责留下证据链。

发生了什么

主来源是 Google 官方博客 Recreating a 70-year love story frame by frame,发布日期为 2026-09-09。官方事实包括:纪录片《Love, Rendered》由导演 Liz Garbus 负责,Google DeepMind 与 Primordial Soup 合作完成;故事围绕 Burt 和 Ethelle Shatz 展开,他们结婚超过七十年,其中一段相识经历没有照片或影像记录;制作团队使用图像修复与表演捕捉模型,尝试把过去与现在连接起来。

下面关于“证据层”“人工确认点”和 Agent 工作流的拆解,是我的工程判断,不是 Google 对产品能力的承诺。这个区分很重要:官方文章是在介绍一部具体纪录片的创作过程,不是宣布一个可以自动恢复任何人记忆的通用系统。

这篇文章还披露了一个容易被忽略的事实:Ethelle 不是被动提供素材的人,而是主动参与创作的人。她会指出楼梯的形状、鞋跟的细节,以及哪些画面更符合她记得的过去。换句话说,系统不是从一组照片直接推导出唯一答案,而是在不完整证据上生成候选,再由记忆的当事人不断修正。

技术细节

1. 第一层是图像修复,不是凭空创造过去

制作团队先用生成式模型修复两人的黑白旧照片。官方解释,这些修复后的照片用于帮助后续重建保持人物一致性。工程上,图像修复的作用更像“整理可见证据”:补足划痕、增强细节、恢复色彩,让团队更容易观察发型、服装和面部特征。

但修复结果不应被当作原始照片的同等替代品。缺失区域经过模型补全后,已经包含推断成分。一个严谨的素材系统至少应同时保存原图、修复版本、处理参数和人工标注,并在后续步骤中知道哪些像素来自原始记录,哪些来自模型候选。否则,第一步的猜测可能在后面被误当成历史事实。

2. 第二层是姿态与表演控制

官方介绍的另一部分是表演捕捉。团队从两人现在的动作和微小习惯中提取信息,例如头部倾斜、说话时短暂的停顿,以及眼睛周围的细微变化,再把这些特征映射到年轻时期的形象上。

这个思路与普通的图片换脸不同。它试图保留的是“这个人如何动作”,而不只是“这张脸长什么样”。从技术管线看,可以拆成几个阶段:当前影像采集、姿态与表情特征提取、年轻形象建模、动作映射、画面合成和人工审看。每一步都可能改变观众对人物性格和情绪的理解,因此最终质量不能只用清晰度或逼真度衡量。

3. 两条路线结合,解决的是情感真实性

单独修复老照片,容易得到一组静态、漂亮但缺少动作的画面;单独做性能捕捉,又可能让年轻形象失去与真实历史的联系。官方文章把两种方法结合起来:修复照片帮助确定人物外观,当前的动作特征帮助画面“活起来”。

这里的“真实”不是法医意义上的逐帧还原,而是当事人认为画面保留了过去的情感和生活细节。因此,评价标准不能只由模型或剪辑师单方面决定。对于涉及个人经历的生成内容,最有价值的反馈往往来自当事人本人,以及了解历史背景的人。

4. 这是一条多阶段工作流,不是一条提示词

如果把整个任务交给一个生成模型,系统可能会快速得到一段视觉上连贯的短片,却无法回答每个细节从哪里来。更稳妥的工作流可以表示为:

1
2
3
4
5
6
7
8
9
10
11
12
13
原始照片与口述材料

素材整理与来源标注

图像修复候选

姿态、表情与动作提取

年轻形象与场景重建

当事人逐段审看与修正

剪辑、标注生成内容并导出

其中“当事人逐段审看”不是最后的装饰性确认,而应当在多个中间节点出现。越早发现人物特征和场景记忆不符,返工成本越低,也越不容易让错误细节在后续处理中被放大。

对 Agent / 工程的影响

第一,生成式影像 Agent 需要“证据分层”。原始照片、口述回忆、人工修订、模型生成画面和最终剪辑,不能混在同一个无来源的素材目录里。Agent 可以根据来源强弱组织工作,但不能把生成结果自动提升为事实。界面也应明确区分:输入证据、规则处理、AI 生成、人工确认和未知项。

第二,人物一致性检查要加入人工之外的确定性规则。可以检查素材是否绑定正确的项目、版本和时间段,确认处理链是否保留原始文件,限制生成结果的分辨率与导出范围,并要求每段视频关联来源和审批状态。规则无法判断“这是不是当事人记忆中的鞋跟形状”,但能防止素材错配、版本覆盖和未经批准的导出。

第三,Agent 的记忆层应该保存“为什么改”,而不只是保存“改完了什么”。如果当事人指出某个楼梯方向不对,系统应记录被修改的片段、修改理由、确认人和对应来源。未来重新生成时,Agent 需要找回这条可回溯意见,而不是只读取一段“场景已优化”的摘要。

第四,涉及真人的生成内容必须设置权限和撤回机制。原始照片、家庭影像和口述材料都可能包含高度私密的信息。系统应采用最小化上传、明确授权、分项目隔离和可删除版本;共享或公开前,要再次确认是否出现未授权人物、敏感地点、真实联系方式或容易造成误解的情节。

第五,评测指标要从“像不像”扩展到“有没有越界”。除了画面质量和动作连续性,还应测素材可追溯率、人工修订覆盖率、错误细节拦截率、未经确认内容的导出拦截率、撤回是否生效,以及生成成本和返工次数。对纪实类内容,宁可保留未知,也不要让模型用漂亮画面填满证据空白。

我的判断

《Love, Rendered》展示的不是一个“AI 自动找回过去”的魔法,而是一种更克制的创作范式:模型提供修复、重建和动作映射能力,真实人物保留对记忆的解释权,工程流程负责把每一次生成和修改记录下来。

我支持把这类技术用于创作和纪念,但不支持把生成画面包装成未经说明的历史影像。对 Agent 团队来说,最值得复用的不是某个模型名称,而是“证据—候选—人工确认—可追溯导出”的分层设计。只要系统能清楚说出哪些是真实记录、哪些是推测重建,生成式影像才不会因为逼真而变得不诚实。

Q&A

Q1:来源和发布日期是什么?

A:来源是 Google 官方博客 Recreating a 70-year love story frame by frame,发布日期为 2026-09-09。本文关于《Love, Rendered》、图像修复、表演捕捉和当事人参与校正的事实均来自该文章。

Q2:这是不是把真实记忆完整复原出来了?

A:不是。官方介绍的是一部纪录片中的创作流程,画面包含基于照片、动作和当事人反馈的生成式重建。它可以帮助表达一段经历,但不能证明生成画面的每个细节都曾真实发生。

Q3:为什么要保留原始照片?

A:因为修复和生成都会引入推断。原始照片可以作为不可替代的证据基线,方便后续比较哪些内容来自记录、哪些内容由模型补足,也便于在发现错误时回滚。

Q4:生成式影像 Agent 的最小安全流程是什么?

A:先整理并标注来源,再生成候选画面;每个阶段保留版本和处理理由;由当事人或授权审核者确认;最后导出时明确标识重建内容,并提供撤回和删除路径。

Q5:哪些场景不适合直接使用?

A:法律证据、新闻事实、身份核验、医疗记录和未经授权的私人影像,都不应把生成画面当作原始事实。即使技术效果很逼真,也必须以原始材料和明确授权为前提。

来源

  1. Google DeepMind,Recreating a 70-year love story frame by frame,发布日期:2026-09-09,原始 URL:https://blog.google/innovation-and-ai/technology/ai/love-rendered/

本文性质:基于 2026-09-09 官方发布的 AI Tech 技术解读。
字数自检:正文约 2500 个中文字符(不含 frontmatter)
隐私自检:未写入个人账号、内部网络细节、凭据或会话标识
封面 seed:2026-09-10-google-love-rendered(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-09-10-google-love-rendered/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可