Margrop
Articles281
Tags728
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 推理 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 评测 Agent 路由 Agentic AI Agentic SOC Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention AutoSynthData Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Frontier AI Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-6 GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini 3.8 Gemini 4 Argon Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo Holo4 HomeAssistant Hugging Face IBM Granite IBM Research In-context Learning Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Prompt 缓存 Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Tabular Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open d1 open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 事件响应 交换机 人才争夺 人机协作 代理 代码生成 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 决策模型 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 合成数据 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多模态模型 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安全评测 安全运营 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 强化学习 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数学推理 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型微调 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 表格基础模型 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件工程 软件管家 软路由 边缘 AI 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长任务编排 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 非人类身份 飞书

Hitokoto

Archive

open d1 决策模型:边缘 Agent 能否用 16 毫秒做出可靠判断?

open d1 决策模型:边缘 Agent 能否用 16 毫秒做出可靠判断?

open d1 边缘决策模型与 Agent

先说结论

Liquid AI 在 2026 年 10 月 7 日公开的 open d1 决策模型,最值得关注的地方不是又发布了一个更小的语言模型,而是它把一类 Agent 常做的工作——分类、路由、风险判断和状态选择——从“生成一段文字”改成“一次前向计算直接给出结构化决策”。官方披露的 d1-3B 在 Decision Index 0.2.1 上得到 48.57,并在 Jetson AGX Thor 上以 16 毫秒回答一个问题;d1-omni-600M 则把文本、图像和音频输入放进同一条轻量路线。

我的判断是,这类模型更适合成为 Agent 的快速前置层,而不是替代通用模型。它可以先判断请求属于哪个队列、是否需要升级、图像里是否出现某种状态,只有遇到复杂解释或开放式规划时才调用大模型。这样做有机会降低延迟和成本,但前提是决策问题有清晰标签、可验证边界和持续的误判监控。

发生了什么

主来源是 Hugging Face 官方博客《Multimodal open d1 decision models for the edge》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/LiquidAI/open-d1。文章介绍了两个开放权重模型:d1-3B 和实验性的 d1-omni-600M。

官方事实包括:d1-3B 支持文本和图像,d1-omni-600M 支持文本与图像或文本与音频;d1-3B 在七个公开数据集上取得 82.9 的平均分,d1-omni-600M 为 78.4。官方还报告 d1-3B 在 Jetson AGX Thor、Jetson AGX Orin 和 Jetson Orin Nano 上分别以 16、26 和 50 毫秒完成单个问题,在 Apple M5 Pro 上为 30 毫秒。这里的“问题”是模型定义好的决策请求,不等于开放式聊天回答。

官方还说明,d1-3B 由 LFM2.5-VL-3B 视觉语言模型训练而来,d1-omni-600M 则由 LFM2.5-Encoder-350M 加上视觉和音频编码器构成。与生成模型不同,决策模型不逐 token 生成长文本,而是在一次前向计算中返回命名问题的结果。后文关于 Agent 编排、可靠性和落地方式的内容,属于我的工程判断,不是官方对所有业务的性能承诺。

技术细节

1. 决策模型和生成模型解决的是不同问题

典型生成模型的优势是表达能力强:它可以解释原因、写计划、改写文本,也可以在没有预先定义标签时探索答案。但这类灵活性往往伴随更高延迟、更高输出成本和更难稳定解析的问题。对于“是否需要退款”“应该交给哪个团队”“风险等级属于哪一档”这类任务,真正需要的可能只是一个受约束的结果,而不是一篇长回答。

open d1 的接口思路是为每个问题声明类型、说明和候选标准。例如一个工单状态可以同时询问是否涉及退款、应该交给计费还是技术团队、紧急程度属于哪一档。模型读取同一份文本状态后,一次返回多个命名结果。这样,工程系统拿到的不是需要再从自然语言中猜测的句子,而是更接近程序可以直接消费的结构化决策。

这并不意味着模型输出天然可靠。只要决策仍由神经网络完成,就可能受到输入分布变化、模糊措辞、图像质量、方言、恶意内容和标签偏差影响。结构化接口只是降低了解析风险,不能消除判断风险。

2. 多模态不是“什么都能看”,而是输入形式扩展

d1-3B 的文本和图像能力适合把画面或文档状态纳入快速判断,例如判断某个设备指示灯是否处于异常状态、票据属于哪种类别、截图是否包含某个界面元素。d1-omni-600M 则进一步支持音频输入,可用于语音意图、简单事件分类或边缘设备上的声音触发。

官方公布的七个公开数据集覆盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。d1-3B 在 SQuAD 2.0、PubMedQA、BoolQ 和 XNLI 等项目上表现较强,但在 MASSIVE 意图分类、PAWS-X 等项目上并非每一项都第一。这个细节很重要:平均分可以说明总体能力,不能替代目标业务上的留出测试。

视觉和音频输入还会引入新的失败模式。图片可能模糊、遮挡或含有误导性文字;声音可能有背景噪声、多人重叠或口音差异。Agent 不应把“模型返回了一个类别”理解成“证据已经充分”,还要保留输入质量、置信区间或拒答状态等可审计信息。

3. 边缘延迟改变了 Agent 的编排方式

官方在 Jetson AGX Thor 上报告单问题 16 毫秒、三个问题 20 毫秒;在 Jetson Orin Nano 上分别是 50 和 73 毫秒。这个结果显示,多个小决策可以打包处理,增加的问题数不一定线性增加延迟。GPU 测试中,d1-3B 在 RTX 4090 上单问题为 8 毫秒,在 AMD MI325X 上为 9 毫秒;384 像素图像分别为 17 和 18 毫秒。

对 Agent 来说,这意味着可以把一些高频判断从主推理链路中拆出来。例如先由边缘决策模型判断是否需要上传原始图片、是否触发更强模型、是否进入人工队列,再决定下一步。只有满足特定条件,才把更大的上下文和更昂贵的推理请求送到中心服务。

但延迟数字不能脱离完整链路解读。实际系统还要加上输入预处理、网络传输、设备排队、模型加载、批处理和后续工具动作。设备上的 16 毫秒不等于端到端任务 16 毫秒,也不等于在温度、功耗和长期运行条件下始终保持这个数字。

对 Agent / 工程的影响

第一,模型路由可以增加一个确定性更强的快速层。对于低风险分类、意图识别、初步审核和工具选择,可以先使用决策模型;结果不确定、输入质量不足或动作影响较大时,再升级到通用模型或人工。升级条件要写成程序规则,例如分数低于阈值、多个问题互相矛盾、输入缺失或目标类别不在已验证范围内。

第二,工具调用前的风险闸门值得优先尝试。Agent 准备执行外部动作时,可以先让决策模型判断动作类别、资源范围和是否需要人工确认。但付款、删除、权限修改、生产发布和对外发送等高影响动作,不能只依赖模型判断;程序仍应检查权限、Schema、幂等键、目标状态和回滚路径。

第三,结构化决策要配套拒答和未知项。很多系统只定义“是”和“否”,却没有“无法判断”“输入不完整”“超出训练分布”等结果。没有拒答出口,模型会被迫在错误选项中挑一个,看起来每次都有答案,实际上把不确定性藏了起来。Agent 应把未知项保留下来,而不是自动当成低风险。

第四,边缘部署会放大版本和数据治理问题。设备数量一多,模型版本、量化方式、运行时、标签定义和校准参数就可能不一致。工程团队应记录模型版本、输入模态、决策 Schema、阈值、设备类型和实际结果;涉及个人图像、语音或文档时,只保留完成任务所需的最小脱敏摘要,不要默认把原始内容长期上传或保存。

第五,评测要按真实任务而不是平均分验收。至少准备正常输入、边界输入、噪声输入、对抗输入、缺失字段、设备差异和未知类别,分别统计准确率、拒答率、误升级率、漏升级率、P50/P95 端到端延迟、功耗和每次决策成本。对于路由器,还要看它是否真的减少了大模型调用,以及是否因为错误前置判断导致更多返工。

第六,先从可回滚的合成环境开始。可以构造一批不含敏感信息的文本、图片和音频样例,把目标标签、允许动作和最终状态写成确定性验证规则。模型负责提出决策,程序负责 Schema 和权限判断,回放系统负责比较版本变化。等误判类型和拒答行为稳定后,再逐步接入脱敏的真实分布。

我的判断

open d1 的价值在于提醒 Agent 工程师:并不是所有智能都要通过长文本生成体现。对高频、低延迟、标签清楚的判断,我会优先考虑小型决策模型;对需要解释、规划和跨工具推理的任务,仍然使用通用模型。两者组合起来,才比“所有请求都扔给最大模型”更像一套可控架构。

不过,我不会因为官方的毫秒级数字就直接把它放进高影响自动化。先验证拒答、未知类别、设备差异和长时间运行,再观察它是否降低了端到端成本。如果一个快速模型只是更快地做错事,它不是 Agent 的加速器,而是错误的放大器。

Q&A

Q1:来源、发布日期和原始 URL 是什么?

A:来源是 Hugging Face 官方博客《Multimodal open d1 decision models for the edge》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/LiquidAI/open-d1。文章介绍 d1-3B 和实验性的 d1-omni-600M,以及基准测试和边缘设备延迟。

Q2:d1-3B 是聊天模型吗?

A:它更适合被理解为决策模型。它可以处理文本和图像,并返回预先定义的问题结果,但设计重点不是持续生成长篇对话。需要解释、复杂规划或开放式写作时,仍应使用生成模型。

Q3:官方的 16 毫秒能直接代表 Agent 的响应时间吗?

A:不能。16 毫秒是特定设备、特定模型和单个决策问题的报告值。真实 Agent 还要加上预处理、排队、网络、模型加载、工具调用和后续验证,必须做端到端测量。

Q4:怎样把它放进模型路由?

A:先定义低风险、标签清晰的前置判断,例如意图、队列、输入质量或是否需要升级。决策模型返回结构化结果后,由程序根据阈值、拒答和权限规则选择下一步;不确定或高影响场景直接升级,不要强行自动执行。

Q5:最容易踩的坑是什么?

A:把平均 benchmark 当成业务保证;只定义正向类别、不定义拒答;忽略图像和音频质量;只测模型延迟、不测端到端延迟;以及把模型结果当成权限判断。结构化输出降低了解析成本,但没有替代确定性安全检查。

来源

  1. Hugging Face,Multimodal open d1 decision models for the edge,发布日期:2026-10-07,原始 URL:https://huggingface.co/blog/LiquidAI/open-d1
  2. Liquid AI d1-3B 模型页,入口链接见上述官方文章:https://huggingface.co/LiquidAI/d1-3b
  3. Liquid AI d1-omni-600M 模型页,入口链接见上述官方文章:https://huggingface.co/LiquidAI/d1-omni-600M

本文区分官方事实与作者判断;延迟、准确率、硬件需求和开放范围以官方文章、模型卡及目标环境复现为准。
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-10-08-open-d1-edge-agent-decisions(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-10-08-open-d1-edge-agent-decisions/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可