LFM2.5-VL-3B:3B 视觉模型如何在端侧完成屏幕理解与工具调用
笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师
先说结论
Liquid AI 在 Hugging Face 官方博客发布了 LFM2.5-VL-3B:一个约 3.1B 参数、面向端侧和实时应用的视觉语言模型。它的重点不是把模型做得更大,而是把屏幕与文档理解、目标定位、多图输入、函数调用和本地推理速度放进同一套小模型能力里。官方给出的结果显示,它在不少真实图像任务上领先同尺寸模型;在端侧测试中,M5 Max 约 228 tokens/s,模型占用约 3GB 内存,还宣称可以在手机上运行。
我的判断是:LFM2.5-VL-3B 更值得被看成一个“端侧 Agent 感知组件”,而不是通用大模型的替代品。它适合做屏幕观察、文档抽取、目标定位和轻量工具调用,把数据留在设备附近;但官方 benchmark 仍是厂商自测,尤其是工具调用和 OCR 场景,接入生产前必须用自己的界面、语言和失败样本重新验证。
发生了什么
Liquid AI 团队在 Hugging Face 官方博客发布《LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge》,页面发布日期为 2026-08-12。原始来源:
- LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge — Hugging Face Blog
- LFM2.5-VL-3B 模型页面 — Hugging Face
官方材料给出的主要变化有四项:
- 更强的屏幕和 UI 理解,可以处理不同设备上的数字界面;
- 更强的 grounding,也就是根据自然语言查询定位图像中的对象;
- 更好的多图输入能力;
- 文本和视觉文本场景下的函数调用能力明显增强。
它采用 SigLIP2 400M NaFlex 视觉编码器,并连接到 LFM2.5-2.6B 文本模型的预训练骨干。官方称预训练使用约 34T tokens,视觉数据量约为上一代的四倍,数据覆盖图像描述、OCR、目标定位和指令跟随。为了支持非拉丁文字,词表扩展到 128K;后训练包括监督微调、知识蒸馏、Antidoom training 以及多奖励强化学习。
这些是官方事实。我的解读是:模型团队正在把“小模型能不能看懂图片”推进为“设备上的 Agent 能不能看懂当前界面并采取下一步动作”。这两者差别很大,后者要求模型不仅识别内容,还要输出稳定、可验证的结构化决策。
技术细节
1. 屏幕理解让视觉模型接近 Agent 的观察层
普通图像问答通常回答“图里有什么”。屏幕理解则要回答“当前界面是什么状态、哪个控件对应目标、下一步应该操作哪里”。这类任务更接近 Agent 的观察层:
1 | |
LFM2.5-VL-3B 的官方结果覆盖 ScreenSpot-v2 的桌面、移动端和网页场景,分数分别为 78.7、81.2 和 82.2。这个结果说明它有能力处理界面定位任务,但不能直接等价于“可以安全操作所有软件”。真实界面会出现主题变化、缩放、遮挡、动态弹窗、语言切换和权限提示,模型需要在这些干扰下保持定位稳定。
对于 Agent 工程,最合理的接法不是让视觉模型直接点击,而是让它输出“目标控件 + 位置 + 置信度 + 观察依据”,再由执行器确认页面状态、动作类型和权限。视觉模型负责看,执行器负责做,二者要有明确边界。
2. Grounding 让回答从描述走向定位
官方博客把 grounding 列为主要改进。它的意义是,用户不只问“这张图里有什么”,还可以问“把那个红色按钮找出来”或“定位图中的某个对象”。模型需要把自然语言和图像空间中的区域对应起来。
官方列出的 RefCOCO 平均成绩为 87.9,明显高于上一代同尺寸模型的 57.1。这个数字值得关注,但也要注意评测集和实际应用之间的距离。工业现场、移动端截图和复杂网页里的对象可能很小、被遮挡或有多个相似目标。因此,生产系统最好要求模型同时返回边界框或坐标、对象描述和不确定性,再由视觉后处理确认坐标是否落在可操作区域。
3. OCR 与多图输入扩大了端侧场景
模型覆盖文档、图表和屏幕内容理解。官方报告的 DocVQA 分数为 91.1,TextVQA 为 84.3,说明它不仅能看整体画面,也能从文档和图像中读取信息。多图输入则适合比较前后状态、读取多页文档或把参考图与当前界面放在一起分析。
但 OCR 分数不能替代业务验收。真正容易出错的往往是低清小字、混合语言、日期和数字、表格列对齐以及相似字符。接入时应该准备一组真实截图,专门覆盖缩放、压缩、暗色模式和非拉丁文字,而不是只测官方示例图。
4. 工具调用是从“看懂”到“能行动”的关键一步
LFM2.5-VL-3B 强调文本和视觉文本场景下的 function calling。官方给出的 BFCL V4 分数为 32.5,ToolSandbox 为 59.5;相比上一代模型分别有明显提升。这个方向很重要,因为端侧 Agent 的价值不止是描述屏幕,还要把观察结果转成搜索、提醒、文件处理或其他工具的参数。
不过,工具调用分数并不代表可以无保护地执行动作。视觉模型可能看错按钮、混淆参数,也可能在界面发生变化后继续沿用旧观察。可靠的工具调用链至少应当包含:
- 视觉模型输出结构化调用意图;
- 参数校验器检查类型、范围和权限;
- 执行前重新读取当前状态;
- 高风险动作需要人工确认;
- 执行后再次观察结果,确认页面确实发生了预期变化。
也就是说,模型的函数调用只是计划的一部分,不能跳过执行前后的安全闭环。
5. 小模型的价值最终体现在延迟和数据路径
官方称 LFM2.5-VL-3B 支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等生态。在端侧测试中,M5 Max 约 228 tokens/s,Ryzen AI Max+ 395 约 116 tokens/s,模型约占 3GB 内存;在一款手机上也达到约 20 tokens/s。GPU 高并发测试中,官方称其输出吞吐约 11K tokens/s。
这些数字的价值在于说明模型有较宽的部署选择:开发机、边缘设备和服务端都可以使用相近的模型能力。但端到端体验不能只看生成速度。图片预处理、视觉编码、设备温度、内存带宽、上下文长度、工具执行和网络传输都可能成为瓶颈。端侧部署尤其要测持续运行后的降频、内存回收和电量消耗。
对 Agent / 工程的影响
第一,端侧视觉模型适合承担“观察”,不宜独自承担“授权”
把视觉模型放在设备上,可以减少截图、文档和界面内容上传到远端的需要,也能降低交互延迟。但本地运行不等于天然安全。模型仍可能误识别敏感内容或生成错误动作,授权和审计仍需要独立组件负责。
第二,屏幕 Agent 的评测要从静态识别扩展到连续轨迹
单张截图能测识别,不能测 Agent。真正上线前要测试:页面变化后模型是否重新观察,点击后是否确认结果,弹窗遮挡时是否拒绝操作,网络断开时是否安全停住,连续多步后是否把旧截图当成当前状态。视觉 Agent 的质量是整条轨迹的稳定性,不是一张截图的准确率。
第三,小模型可以把大模型从低价值视觉工作中解放出来
在一个复杂 Agent 栈里,端侧模型可以先做截图分类、OCR、目标定位和简单工具参数提取,只有遇到歧义或高风险决策时才升级到更大的远端模型。这样做能减少上传数据、降低调用成本,也能把延迟敏感的观察环节放在本地。
第四,函数调用必须有“再观察”步骤
视觉输入天然容易过时。页面一旦变化,模型刚刚生成的坐标可能就不再有效。因此,任何改变外部状态的动作都应该采用“观察—计划—校验—执行—再观察”的循环,而不是让模型一次生成多个未经确认的点击动作。
我的判断
LFM2.5-VL-3B 的真正卖点不是“3B 也能看图”,而是它把屏幕理解、目标定位、文档 OCR、多图输入和工具调用组合成了一个端侧 Agent 可以使用的感知层。对需要本地处理、低延迟和高并发的场景,它值得做一次真实设备基准;对复杂推理和高风险自动化,它更适合作为前置观察器,而不是最终决策者。
官方 benchmark 证明了方向可行,但没有替工程团队完成上线验收。我的建议是先做一个小规模测试:选两类真实界面、两种语言、三档图像质量,分别测观察延迟、定位准确率、工具参数正确率和拒绝率。只要模型在错误时能稳定停下来,它的价值往往比“偶尔答对一个漂亮示例”更大。
Q&A
Q1:来源和发布日期是什么?
A:主体来源是 Liquid AI 团队在 Hugging Face 发布的《LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge》,发布日期为 2026-08-12。原始 URL 是 huggingface.co/blog/LiquidAI/lfm2-5-vl-3b,模型页面是 LiquidAI/LFM2.5-VL-3B。
Q2:它适合替代大型视觉模型吗?
A:不适合直接这样理解。它更适合端侧观察、文档处理、屏幕定位和轻量工具调用;复杂推理、长上下文和高风险决策仍需要更强模型或人工确认。
Q3:最值得先测试的能力是什么?
A:如果做 Agent,优先测试屏幕定位和工具调用的组合:给模型真实截图,让它返回结构化目标和参数,再由独立校验器确认,最后测执行后的再观察结果。不要只测图像描述。
Q4:官方速度能直接当作生产性能吗?
A:不能。官方数字来自特定硬件、软件栈和测试条件。生产环境还要加上图像预处理、上下文准备、工具调用、内存压力和持续运行后的设备状态,重新测端到端延迟。
Q5:端侧运行是否意味着不需要安全控制?
A:恰恰相反。数据不出设备可以降低传输风险,但视觉误判和工具误操作仍然存在。权限、参数校验、执行前确认、执行后复核和审计都不能省。
参考资料:
- LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge — Hugging Face Blog(2026-08-12,主体来源)
- LiquidAI/LFM2.5-VL-3B — Hugging Face(模型入口)
字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话标识