open d1 决策模型:边缘 Agent 能否用 16 毫秒做出可靠判断?
先说结论
Liquid AI 在 2026 年 10 月 7 日公开的 open d1 决策模型,最值得关注的地方不是又发布了一个更小的语言模型,而是它把一类 Agent 常做的工作——分类、路由、风险判断和状态选择——从“生成一段文字”改成“一次前向计算直接给出结构化决策”。官方披露的 d1-3B 在 Decision Index 0.2.1 上得到 48.57,并在 Jetson AGX Thor 上以 16 毫秒回答一个问题;d1-omni-600M 则把文本、图像和音频输入放进同一条轻量路线。
我的判断是,这类模型更适合成为 Agent 的快速前置层,而不是替代通用模型。它可以先判断请求属于哪个队列、是否需要升级、图像里是否出现某种状态,只有遇到复杂解释或开放式规划时才调用大模型。这样做有机会降低延迟和成本,但前提是决策问题有清晰标签、可验证边界和持续的误判监控。
发生了什么
主来源是 Hugging Face 官方博客《Multimodal open d1 decision models for the edge》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/LiquidAI/open-d1。文章介绍了两个开放权重模型:d1-3B 和实验性的 d1-omni-600M。
官方事实包括:d1-3B 支持文本和图像,d1-omni-600M 支持文本与图像或文本与音频;d1-3B 在七个公开数据集上取得 82.9 的平均分,d1-omni-600M 为 78.4。官方还报告 d1-3B 在 Jetson AGX Thor、Jetson AGX Orin 和 Jetson Orin Nano 上分别以 16、26 和 50 毫秒完成单个问题,在 Apple M5 Pro 上为 30 毫秒。这里的“问题”是模型定义好的决策请求,不等于开放式聊天回答。
官方还说明,d1-3B 由 LFM2.5-VL-3B 视觉语言模型训练而来,d1-omni-600M 则由 LFM2.5-Encoder-350M 加上视觉和音频编码器构成。与生成模型不同,决策模型不逐 token 生成长文本,而是在一次前向计算中返回命名问题的结果。后文关于 Agent 编排、可靠性和落地方式的内容,属于我的工程判断,不是官方对所有业务的性能承诺。
技术细节
1. 决策模型和生成模型解决的是不同问题
典型生成模型的优势是表达能力强:它可以解释原因、写计划、改写文本,也可以在没有预先定义标签时探索答案。但这类灵活性往往伴随更高延迟、更高输出成本和更难稳定解析的问题。对于“是否需要退款”“应该交给哪个团队”“风险等级属于哪一档”这类任务,真正需要的可能只是一个受约束的结果,而不是一篇长回答。
open d1 的接口思路是为每个问题声明类型、说明和候选标准。例如一个工单状态可以同时询问是否涉及退款、应该交给计费还是技术团队、紧急程度属于哪一档。模型读取同一份文本状态后,一次返回多个命名结果。这样,工程系统拿到的不是需要再从自然语言中猜测的句子,而是更接近程序可以直接消费的结构化决策。
这并不意味着模型输出天然可靠。只要决策仍由神经网络完成,就可能受到输入分布变化、模糊措辞、图像质量、方言、恶意内容和标签偏差影响。结构化接口只是降低了解析风险,不能消除判断风险。
2. 多模态不是“什么都能看”,而是输入形式扩展
d1-3B 的文本和图像能力适合把画面或文档状态纳入快速判断,例如判断某个设备指示灯是否处于异常状态、票据属于哪种类别、截图是否包含某个界面元素。d1-omni-600M 则进一步支持音频输入,可用于语音意图、简单事件分类或边缘设备上的声音触发。
官方公布的七个公开数据集覆盖阅读理解、毒性检测、意图分类、医学问答和跨语言理解。d1-3B 在 SQuAD 2.0、PubMedQA、BoolQ 和 XNLI 等项目上表现较强,但在 MASSIVE 意图分类、PAWS-X 等项目上并非每一项都第一。这个细节很重要:平均分可以说明总体能力,不能替代目标业务上的留出测试。
视觉和音频输入还会引入新的失败模式。图片可能模糊、遮挡或含有误导性文字;声音可能有背景噪声、多人重叠或口音差异。Agent 不应把“模型返回了一个类别”理解成“证据已经充分”,还要保留输入质量、置信区间或拒答状态等可审计信息。
3. 边缘延迟改变了 Agent 的编排方式
官方在 Jetson AGX Thor 上报告单问题 16 毫秒、三个问题 20 毫秒;在 Jetson Orin Nano 上分别是 50 和 73 毫秒。这个结果显示,多个小决策可以打包处理,增加的问题数不一定线性增加延迟。GPU 测试中,d1-3B 在 RTX 4090 上单问题为 8 毫秒,在 AMD MI325X 上为 9 毫秒;384 像素图像分别为 17 和 18 毫秒。
对 Agent 来说,这意味着可以把一些高频判断从主推理链路中拆出来。例如先由边缘决策模型判断是否需要上传原始图片、是否触发更强模型、是否进入人工队列,再决定下一步。只有满足特定条件,才把更大的上下文和更昂贵的推理请求送到中心服务。
但延迟数字不能脱离完整链路解读。实际系统还要加上输入预处理、网络传输、设备排队、模型加载、批处理和后续工具动作。设备上的 16 毫秒不等于端到端任务 16 毫秒,也不等于在温度、功耗和长期运行条件下始终保持这个数字。
对 Agent / 工程的影响
第一,模型路由可以增加一个确定性更强的快速层。对于低风险分类、意图识别、初步审核和工具选择,可以先使用决策模型;结果不确定、输入质量不足或动作影响较大时,再升级到通用模型或人工。升级条件要写成程序规则,例如分数低于阈值、多个问题互相矛盾、输入缺失或目标类别不在已验证范围内。
第二,工具调用前的风险闸门值得优先尝试。Agent 准备执行外部动作时,可以先让决策模型判断动作类别、资源范围和是否需要人工确认。但付款、删除、权限修改、生产发布和对外发送等高影响动作,不能只依赖模型判断;程序仍应检查权限、Schema、幂等键、目标状态和回滚路径。
第三,结构化决策要配套拒答和未知项。很多系统只定义“是”和“否”,却没有“无法判断”“输入不完整”“超出训练分布”等结果。没有拒答出口,模型会被迫在错误选项中挑一个,看起来每次都有答案,实际上把不确定性藏了起来。Agent 应把未知项保留下来,而不是自动当成低风险。
第四,边缘部署会放大版本和数据治理问题。设备数量一多,模型版本、量化方式、运行时、标签定义和校准参数就可能不一致。工程团队应记录模型版本、输入模态、决策 Schema、阈值、设备类型和实际结果;涉及个人图像、语音或文档时,只保留完成任务所需的最小脱敏摘要,不要默认把原始内容长期上传或保存。
第五,评测要按真实任务而不是平均分验收。至少准备正常输入、边界输入、噪声输入、对抗输入、缺失字段、设备差异和未知类别,分别统计准确率、拒答率、误升级率、漏升级率、P50/P95 端到端延迟、功耗和每次决策成本。对于路由器,还要看它是否真的减少了大模型调用,以及是否因为错误前置判断导致更多返工。
第六,先从可回滚的合成环境开始。可以构造一批不含敏感信息的文本、图片和音频样例,把目标标签、允许动作和最终状态写成确定性验证规则。模型负责提出决策,程序负责 Schema 和权限判断,回放系统负责比较版本变化。等误判类型和拒答行为稳定后,再逐步接入脱敏的真实分布。
我的判断
open d1 的价值在于提醒 Agent 工程师:并不是所有智能都要通过长文本生成体现。对高频、低延迟、标签清楚的判断,我会优先考虑小型决策模型;对需要解释、规划和跨工具推理的任务,仍然使用通用模型。两者组合起来,才比“所有请求都扔给最大模型”更像一套可控架构。
不过,我不会因为官方的毫秒级数字就直接把它放进高影响自动化。先验证拒答、未知类别、设备差异和长时间运行,再观察它是否降低了端到端成本。如果一个快速模型只是更快地做错事,它不是 Agent 的加速器,而是错误的放大器。
Q&A
Q1:来源、发布日期和原始 URL 是什么?
A:来源是 Hugging Face 官方博客《Multimodal open d1 decision models for the edge》,发布日期为 2026 年 10 月 7 日,原始 URL:https://huggingface.co/blog/LiquidAI/open-d1。文章介绍 d1-3B 和实验性的 d1-omni-600M,以及基准测试和边缘设备延迟。
Q2:d1-3B 是聊天模型吗?
A:它更适合被理解为决策模型。它可以处理文本和图像,并返回预先定义的问题结果,但设计重点不是持续生成长篇对话。需要解释、复杂规划或开放式写作时,仍应使用生成模型。
Q3:官方的 16 毫秒能直接代表 Agent 的响应时间吗?
A:不能。16 毫秒是特定设备、特定模型和单个决策问题的报告值。真实 Agent 还要加上预处理、排队、网络、模型加载、工具调用和后续验证,必须做端到端测量。
Q4:怎样把它放进模型路由?
A:先定义低风险、标签清晰的前置判断,例如意图、队列、输入质量或是否需要升级。决策模型返回结构化结果后,由程序根据阈值、拒答和权限规则选择下一步;不确定或高影响场景直接升级,不要强行自动执行。
Q5:最容易踩的坑是什么?
A:把平均 benchmark 当成业务保证;只定义正向类别、不定义拒答;忽略图像和音频质量;只测模型延迟、不测端到端延迟;以及把模型结果当成权限判断。结构化输出降低了解析成本,但没有替代确定性安全检查。
来源
- Hugging Face,Multimodal open d1 decision models for the edge,发布日期:2026-10-07,原始 URL:https://huggingface.co/blog/LiquidAI/open-d1
- Liquid AI d1-3B 模型页,入口链接见上述官方文章:https://huggingface.co/LiquidAI/d1-3b
- Liquid AI d1-omni-600M 模型页,入口链接见上述官方文章:https://huggingface.co/LiquidAI/d1-omni-600M
本文区分官方事实与作者判断;延迟、准确率、硬件需求和开放范围以官方文章、模型卡及目标环境复现为准。
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-10-08-open-d1-edge-agent-decisions(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech