Margrop
Articles271
Tags700
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件工程 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

LFM2.5-VL-3B:3B 视觉模型如何在端侧完成屏幕理解与工具调用

LFM2.5-VL-3B:3B 视觉模型如何在端侧完成屏幕理解与工具调用

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

LFM2.5-VL-3B 面向端侧的视觉语言模型

先说结论

Liquid AI 在 Hugging Face 官方博客发布了 LFM2.5-VL-3B:一个约 3.1B 参数、面向端侧和实时应用的视觉语言模型。它的重点不是把模型做得更大,而是把屏幕与文档理解、目标定位、多图输入、函数调用和本地推理速度放进同一套小模型能力里。官方给出的结果显示,它在不少真实图像任务上领先同尺寸模型;在端侧测试中,M5 Max 约 228 tokens/s,模型占用约 3GB 内存,还宣称可以在手机上运行。

我的判断是:LFM2.5-VL-3B 更值得被看成一个“端侧 Agent 感知组件”,而不是通用大模型的替代品。它适合做屏幕观察、文档抽取、目标定位和轻量工具调用,把数据留在设备附近;但官方 benchmark 仍是厂商自测,尤其是工具调用和 OCR 场景,接入生产前必须用自己的界面、语言和失败样本重新验证。

发生了什么

Liquid AI 团队在 Hugging Face 官方博客发布《LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge》,页面发布日期为 2026-08-12。原始来源:

官方材料给出的主要变化有四项:

  1. 更强的屏幕和 UI 理解,可以处理不同设备上的数字界面;
  2. 更强的 grounding,也就是根据自然语言查询定位图像中的对象;
  3. 更好的多图输入能力;
  4. 文本和视觉文本场景下的函数调用能力明显增强。

它采用 SigLIP2 400M NaFlex 视觉编码器,并连接到 LFM2.5-2.6B 文本模型的预训练骨干。官方称预训练使用约 34T tokens,视觉数据量约为上一代的四倍,数据覆盖图像描述、OCR、目标定位和指令跟随。为了支持非拉丁文字,词表扩展到 128K;后训练包括监督微调、知识蒸馏、Antidoom training 以及多奖励强化学习。

这些是官方事实。我的解读是:模型团队正在把“小模型能不能看懂图片”推进为“设备上的 Agent 能不能看懂当前界面并采取下一步动作”。这两者差别很大,后者要求模型不仅识别内容,还要输出稳定、可验证的结构化决策。

技术细节

1. 屏幕理解让视觉模型接近 Agent 的观察层

普通图像问答通常回答“图里有什么”。屏幕理解则要回答“当前界面是什么状态、哪个控件对应目标、下一步应该操作哪里”。这类任务更接近 Agent 的观察层:

1
2
3
4
5
6
7
屏幕或文档
↓
识别布局、文字、控件和目标对象
↓
输出位置、状态或结构化动作候选
↓
交给工具执行层做安全校验

LFM2.5-VL-3B 的官方结果覆盖 ScreenSpot-v2 的桌面、移动端和网页场景,分数分别为 78.7、81.2 和 82.2。这个结果说明它有能力处理界面定位任务,但不能直接等价于“可以安全操作所有软件”。真实界面会出现主题变化、缩放、遮挡、动态弹窗、语言切换和权限提示,模型需要在这些干扰下保持定位稳定。

对于 Agent 工程,最合理的接法不是让视觉模型直接点击,而是让它输出“目标控件 + 位置 + 置信度 + 观察依据”,再由执行器确认页面状态、动作类型和权限。视觉模型负责看,执行器负责做,二者要有明确边界。

2. Grounding 让回答从描述走向定位

官方博客把 grounding 列为主要改进。它的意义是,用户不只问“这张图里有什么”,还可以问“把那个红色按钮找出来”或“定位图中的某个对象”。模型需要把自然语言和图像空间中的区域对应起来。

官方列出的 RefCOCO 平均成绩为 87.9,明显高于上一代同尺寸模型的 57.1。这个数字值得关注,但也要注意评测集和实际应用之间的距离。工业现场、移动端截图和复杂网页里的对象可能很小、被遮挡或有多个相似目标。因此,生产系统最好要求模型同时返回边界框或坐标、对象描述和不确定性,再由视觉后处理确认坐标是否落在可操作区域。

3. OCR 与多图输入扩大了端侧场景

模型覆盖文档、图表和屏幕内容理解。官方报告的 DocVQA 分数为 91.1,TextVQA 为 84.3,说明它不仅能看整体画面,也能从文档和图像中读取信息。多图输入则适合比较前后状态、读取多页文档或把参考图与当前界面放在一起分析。

但 OCR 分数不能替代业务验收。真正容易出错的往往是低清小字、混合语言、日期和数字、表格列对齐以及相似字符。接入时应该准备一组真实截图,专门覆盖缩放、压缩、暗色模式和非拉丁文字,而不是只测官方示例图。

4. 工具调用是从“看懂”到“能行动”的关键一步

LFM2.5-VL-3B 强调文本和视觉文本场景下的 function calling。官方给出的 BFCL V4 分数为 32.5,ToolSandbox 为 59.5;相比上一代模型分别有明显提升。这个方向很重要,因为端侧 Agent 的价值不止是描述屏幕,还要把观察结果转成搜索、提醒、文件处理或其他工具的参数。

不过,工具调用分数并不代表可以无保护地执行动作。视觉模型可能看错按钮、混淆参数,也可能在界面发生变化后继续沿用旧观察。可靠的工具调用链至少应当包含:

  • 视觉模型输出结构化调用意图;
  • 参数校验器检查类型、范围和权限;
  • 执行前重新读取当前状态;
  • 高风险动作需要人工确认;
  • 执行后再次观察结果,确认页面确实发生了预期变化。

也就是说,模型的函数调用只是计划的一部分,不能跳过执行前后的安全闭环。

5. 小模型的价值最终体现在延迟和数据路径

官方称 LFM2.5-VL-3B 支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等生态。在端侧测试中,M5 Max 约 228 tokens/s,Ryzen AI Max+ 395 约 116 tokens/s,模型约占 3GB 内存;在一款手机上也达到约 20 tokens/s。GPU 高并发测试中,官方称其输出吞吐约 11K tokens/s。

这些数字的价值在于说明模型有较宽的部署选择:开发机、边缘设备和服务端都可以使用相近的模型能力。但端到端体验不能只看生成速度。图片预处理、视觉编码、设备温度、内存带宽、上下文长度、工具执行和网络传输都可能成为瓶颈。端侧部署尤其要测持续运行后的降频、内存回收和电量消耗。

对 Agent / 工程的影响

第一,端侧视觉模型适合承担“观察”,不宜独自承担“授权”

把视觉模型放在设备上,可以减少截图、文档和界面内容上传到远端的需要,也能降低交互延迟。但本地运行不等于天然安全。模型仍可能误识别敏感内容或生成错误动作,授权和审计仍需要独立组件负责。

第二,屏幕 Agent 的评测要从静态识别扩展到连续轨迹

单张截图能测识别,不能测 Agent。真正上线前要测试:页面变化后模型是否重新观察,点击后是否确认结果,弹窗遮挡时是否拒绝操作,网络断开时是否安全停住,连续多步后是否把旧截图当成当前状态。视觉 Agent 的质量是整条轨迹的稳定性,不是一张截图的准确率。

第三,小模型可以把大模型从低价值视觉工作中解放出来

在一个复杂 Agent 栈里,端侧模型可以先做截图分类、OCR、目标定位和简单工具参数提取,只有遇到歧义或高风险决策时才升级到更大的远端模型。这样做能减少上传数据、降低调用成本,也能把延迟敏感的观察环节放在本地。

第四,函数调用必须有“再观察”步骤

视觉输入天然容易过时。页面一旦变化,模型刚刚生成的坐标可能就不再有效。因此,任何改变外部状态的动作都应该采用“观察—计划—校验—执行—再观察”的循环,而不是让模型一次生成多个未经确认的点击动作。

我的判断

LFM2.5-VL-3B 的真正卖点不是“3B 也能看图”,而是它把屏幕理解、目标定位、文档 OCR、多图输入和工具调用组合成了一个端侧 Agent 可以使用的感知层。对需要本地处理、低延迟和高并发的场景,它值得做一次真实设备基准;对复杂推理和高风险自动化,它更适合作为前置观察器,而不是最终决策者。

官方 benchmark 证明了方向可行,但没有替工程团队完成上线验收。我的建议是先做一个小规模测试:选两类真实界面、两种语言、三档图像质量,分别测观察延迟、定位准确率、工具参数正确率和拒绝率。只要模型在错误时能稳定停下来,它的价值往往比“偶尔答对一个漂亮示例”更大。

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 Liquid AI 团队在 Hugging Face 发布的《LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge》,发布日期为 2026-08-12。原始 URL 是 huggingface.co/blog/LiquidAI/lfm2-5-vl-3b,模型页面是 LiquidAI/LFM2.5-VL-3B。

Q2:它适合替代大型视觉模型吗?

A:不适合直接这样理解。它更适合端侧观察、文档处理、屏幕定位和轻量工具调用;复杂推理、长上下文和高风险决策仍需要更强模型或人工确认。

Q3:最值得先测试的能力是什么?

A:如果做 Agent,优先测试屏幕定位和工具调用的组合:给模型真实截图,让它返回结构化目标和参数,再由独立校验器确认,最后测执行后的再观察结果。不要只测图像描述。

Q4:官方速度能直接当作生产性能吗?

A:不能。官方数字来自特定硬件、软件栈和测试条件。生产环境还要加上图像预处理、上下文准备、工具调用、内存压力和持续运行后的设备状态,重新测端到端延迟。

Q5:端侧运行是否意味着不需要安全控制?

A:恰恰相反。数据不出设备可以降低传输风险,但视觉误判和工具误操作仍然存在。权限、参数校验、执行前确认、执行后复核和审计都不能省。


参考资料:

  1. LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge — Hugging Face Blog(2026-08-12,主体来源)
  2. LiquidAI/LFM2.5-VL-3B — Hugging Face(模型入口)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话标识

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-13-lfm25-vl-edge-agent/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可