Margrop
Articles398
Tags849
Categories7

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 30s timeout 4-bit 量化 6-DoF SLAM AC ACL ACL 切换 ACP AI AI Agent AI Coding Assistant AI Tech AI tutor AI 安全 AI 日记 AI编程助手 AI辅助 AI辅助编程 AMIE AP API API 降价 ARC-AGI-3 ASR ATEM chat 模板 Agent Agent Harness Agent 入侵 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 路由 AgentPlan Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Attention Baseten Blog CC-Switch CI/CD CLI Tools CLI 工具 CLI工具 CPU 推理 CSRF Cache Hit Rate Caddy Categories 404 ChatGPT Claude Code Claude Sonnet ClawLoader Cloudflare Code Interpreter Codex Coding Plan Coding Plan Dashboard ComfyUI Computer Use Context Compression Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron D1 DFIR DIY-MINI Date DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Docker Compose Efficiency Tools Electerm Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Flask GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-Live GPT-Red GPU 加速 GPU 性能分析 Gateway Gemini Gemini 3.5 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub GitHub Actions GitHub PR Google Google AI Google Research Grabette Gripette HA HADashboard HF Security Incident Hailuo Hermes HermesAgent Hexo HomeAssistant Hugging Face Hugo IBM Research IP IPv4 Inference Providers Isaac Lab Java KV cache Kimi Kimi Code Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Markdown Memory 上限 Meta Microsoft 365 Copilot MiniMax MiniMax H3 Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NewAPI Newton Nginx Node-RED Node.js Nunchaku OAuth 凭据 OCR OOM OlmoEarth On-device AI Open Source Open Viking OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 PPPoE Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RPC RTEB Real-Time Inference Red Teaming Responses API Restart SIGTERM SNAP SOCKS5 SOCKS5 代理 SPED SSH 审计 SSL SVDQuant Scientific Computing Self-Forcing Distillation Session Shell Skill 管理 Sol Subagent Surgical Robotics Synology NAS TTS Terra Think button TimeMachine TutorMoments UI 微调 UML Uptime Kuma VPN VPS VoiceEQ WARP Web WebRTC WebSocket Win11 Windows Workers World Foundation Model activate ad adb adblock agent agentic aligenie aliyun alpine annotation aop authy autofs backup baidupan bash bg-review bitwarden boot brew browser budget control caddy2 cc-switch-cli cdn centos cert certbot charles chat chrome classloader client clone closures cloudflare cmd command commit commoditization conn_id container cron 排错 crontab cross_sync ctyun cyber capability dashboard ddsm demo dependency deploy developer devtools disconnect topic dll dns docker domain download drafter draw drawio dsm dump dylib easytier edge environment hooks exception exit code 1 export fail2ban feign firewall-cmd flow fork free tier frontier hosted model frp frpc frps fuckgfw full-duplex function fuzzy match gateway gcc gfw git github glm-latest golang gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage idea image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iptv ipv6 iso java javascript jetbrains jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s keepalive keepalive ping timeout kernel key kid kms kodi koolproxy koolproxyr kvm lan lastpass launchctl learning lede letsencrypt linux live llama.cpp low-code lvm lxc m3u8 mac macos mariadb markdown maven md5 mdadm memory 上限 microcode mirror modem modules monitor mount mstsc multimodal mysql n2n n5105 nas network newapi nfs no close frame node node-red nodejs nohup notepad++ npm nssm ntp one-api 容器 oop open weights openclaw openfeign openssl openviking os otp ovz p14 packet capture pat pdf pem perf ping pip plugin png powerbutton print pro productive struggle proxy pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina root route router rule rules runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student skill_manage slmgr so socks source spk spring springboot springfox ssh ssl stash string supernode support svg svn swagger sync synology systemctl systemd tap tap-windows tapwindows telecom template terminal tls tmux token totp tvbox txt ubuntu udisk ui undertow uninstall unlocker upgrade url v2ray vLLM vhd viking_search vim vlmcsd vm vmdk web websocket wechat windows with worker wow xiaoya xml yum zai-org/GLM-5.2 zip 三维切片 上下文压缩 个人品牌 中国电信 临时关权限 临时提权 云电脑 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 体检 供应链 值班 健康检查 光猫 免费层 公众号 公网IP 内存 内存优化 内容发布 内网 内网IP 内网渗透 写作 分布式推理 分布式训练 医疗 AI 升级 协作 协作习惯 协议层 协议转换 单平台型异常 博客 博客同步 博客改名 博客运维 卫星影像 反向代理 反诉 变更审计 可靠性 后台 Review 启动 告警 告警优化 周一 周一傍晚 周一焦虑 周三傍晚 周五 周六 周四傍晚 周四晚 周报 周日 周末 回滚 地球观测 地理空间推理 复盘评测 夏令时 多 agent 工具链 多 token 预测 多协议并发 多智能体 多模态 多节点 多节点管理 多语言 多通道并发 大厂人才战 大模型评测 天猫精灵 天翼云 失败模式 字体大小 安全 安全事件 安全意识 安装 定时任务 实战反思 实时语音 客户端 SDK 容器 容器网络 导入 小米 屏幕理解 工作感悟 工具审计 工具白名单 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 并发窗口 广告屏蔽 序列号 应用市场 开放 API 开权重 开源权重 开源模型 开源项目 异常 异步任务 异步委派 微信 微信公众号 微信限流 心智成长 心跳 心跳检查 性能优化 总账号数 感悟 成本控制 打工 打工人 打工人日记 扩散模型 技术 抓包 按 provider 优先级 排查 排障思路 推理加速 描述文件 提示词工程 提示词敏感性 故障 故障归因 故障恢复 故障排查 效率 效率工具 教育数据开源 教育评测 数据 文本编码器 断线重连 旁路由 无服务器 日志分析 日志排查 日记 时区 时段权限 显卡虚拟化 智能体集成 智能家居 智能音箱 暗黑风格 服务器 服务管理 本地 agent 本地安装 本地接口 机器人仿真 机器人数据采集 权限管理 架构 框架级切片 梯子 模块 模型推理 模型精简 模型路由 残存访问 治理层 流式推理 流程 流程图 浏览器 漫游 激活 火山引擎 火绒 灾难恢复 焦虑 独立仓库 玄学 生活 电信 画图 监控 监控系统 监管 直播源 直觉 磁盘 磁盘故障 稀疏样本 稀疏注意力 立体声 端侧 AI 端口 端口冲突 端口扫描 管理 续期 网关 网络 网络风暴 群晖 群晖 NAS 脚本 脚本优化 腾讯 自动化 自动化反思 自动化运维 自动恢复 自动攻击 自动重启 自动重连 自托管 LLM 网关 自部署 苹果 虚拟机 视觉语言模型 视觉验收 视频生成 视频问诊 订阅额度 认证 证书 评测基准 评测方法学 诉讼 语雀 语音 AI 语音 Agent 质量检查 超时 跨平台 路由 路由器 软件管家 软路由 运维 运维日常 运维监控 进程生命周期 远程接口 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 钉钉 钉钉断开 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 需求变更 飞书

Hitokoto

Archive

LFM2.5-VL-3B:3B 视觉模型如何在端侧完成屏幕理解与工具调用

LFM2.5-VL-3B:3B 视觉模型如何在端侧完成屏幕理解与工具调用

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

LFM2.5-VL-3B 面向端侧的视觉语言模型

先说结论

Liquid AI 在 Hugging Face 官方博客发布了 LFM2.5-VL-3B:一个约 3.1B 参数、面向端侧和实时应用的视觉语言模型。它的重点不是把模型做得更大,而是把屏幕与文档理解、目标定位、多图输入、函数调用和本地推理速度放进同一套小模型能力里。官方给出的结果显示,它在不少真实图像任务上领先同尺寸模型;在端侧测试中,M5 Max 约 228 tokens/s,模型占用约 3GB 内存,还宣称可以在手机上运行。

我的判断是:LFM2.5-VL-3B 更值得被看成一个“端侧 Agent 感知组件”,而不是通用大模型的替代品。它适合做屏幕观察、文档抽取、目标定位和轻量工具调用,把数据留在设备附近;但官方 benchmark 仍是厂商自测,尤其是工具调用和 OCR 场景,接入生产前必须用自己的界面、语言和失败样本重新验证。

发生了什么

Liquid AI 团队在 Hugging Face 官方博客发布《LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge》,页面发布日期为 2026-08-12。原始来源:

官方材料给出的主要变化有四项:

  1. 更强的屏幕和 UI 理解,可以处理不同设备上的数字界面;
  2. 更强的 grounding,也就是根据自然语言查询定位图像中的对象;
  3. 更好的多图输入能力;
  4. 文本和视觉文本场景下的函数调用能力明显增强。

它采用 SigLIP2 400M NaFlex 视觉编码器,并连接到 LFM2.5-2.6B 文本模型的预训练骨干。官方称预训练使用约 34T tokens,视觉数据量约为上一代的四倍,数据覆盖图像描述、OCR、目标定位和指令跟随。为了支持非拉丁文字,词表扩展到 128K;后训练包括监督微调、知识蒸馏、Antidoom training 以及多奖励强化学习。

这些是官方事实。我的解读是:模型团队正在把“小模型能不能看懂图片”推进为“设备上的 Agent 能不能看懂当前界面并采取下一步动作”。这两者差别很大,后者要求模型不仅识别内容,还要输出稳定、可验证的结构化决策。

技术细节

1. 屏幕理解让视觉模型接近 Agent 的观察层

普通图像问答通常回答“图里有什么”。屏幕理解则要回答“当前界面是什么状态、哪个控件对应目标、下一步应该操作哪里”。这类任务更接近 Agent 的观察层:

1
2
3
4
5
6
7
屏幕或文档

识别布局、文字、控件和目标对象

输出位置、状态或结构化动作候选

交给工具执行层做安全校验

LFM2.5-VL-3B 的官方结果覆盖 ScreenSpot-v2 的桌面、移动端和网页场景,分数分别为 78.7、81.2 和 82.2。这个结果说明它有能力处理界面定位任务,但不能直接等价于“可以安全操作所有软件”。真实界面会出现主题变化、缩放、遮挡、动态弹窗、语言切换和权限提示,模型需要在这些干扰下保持定位稳定。

对于 Agent 工程,最合理的接法不是让视觉模型直接点击,而是让它输出“目标控件 + 位置 + 置信度 + 观察依据”,再由执行器确认页面状态、动作类型和权限。视觉模型负责看,执行器负责做,二者要有明确边界。

2. Grounding 让回答从描述走向定位

官方博客把 grounding 列为主要改进。它的意义是,用户不只问“这张图里有什么”,还可以问“把那个红色按钮找出来”或“定位图中的某个对象”。模型需要把自然语言和图像空间中的区域对应起来。

官方列出的 RefCOCO 平均成绩为 87.9,明显高于上一代同尺寸模型的 57.1。这个数字值得关注,但也要注意评测集和实际应用之间的距离。工业现场、移动端截图和复杂网页里的对象可能很小、被遮挡或有多个相似目标。因此,生产系统最好要求模型同时返回边界框或坐标、对象描述和不确定性,再由视觉后处理确认坐标是否落在可操作区域。

3. OCR 与多图输入扩大了端侧场景

模型覆盖文档、图表和屏幕内容理解。官方报告的 DocVQA 分数为 91.1,TextVQA 为 84.3,说明它不仅能看整体画面,也能从文档和图像中读取信息。多图输入则适合比较前后状态、读取多页文档或把参考图与当前界面放在一起分析。

但 OCR 分数不能替代业务验收。真正容易出错的往往是低清小字、混合语言、日期和数字、表格列对齐以及相似字符。接入时应该准备一组真实截图,专门覆盖缩放、压缩、暗色模式和非拉丁文字,而不是只测官方示例图。

4. 工具调用是从“看懂”到“能行动”的关键一步

LFM2.5-VL-3B 强调文本和视觉文本场景下的 function calling。官方给出的 BFCL V4 分数为 32.5,ToolSandbox 为 59.5;相比上一代模型分别有明显提升。这个方向很重要,因为端侧 Agent 的价值不止是描述屏幕,还要把观察结果转成搜索、提醒、文件处理或其他工具的参数。

不过,工具调用分数并不代表可以无保护地执行动作。视觉模型可能看错按钮、混淆参数,也可能在界面发生变化后继续沿用旧观察。可靠的工具调用链至少应当包含:

  • 视觉模型输出结构化调用意图;
  • 参数校验器检查类型、范围和权限;
  • 执行前重新读取当前状态;
  • 高风险动作需要人工确认;
  • 执行后再次观察结果,确认页面确实发生了预期变化。

也就是说,模型的函数调用只是计划的一部分,不能跳过执行前后的安全闭环。

5. 小模型的价值最终体现在延迟和数据路径

官方称 LFM2.5-VL-3B 支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等生态。在端侧测试中,M5 Max 约 228 tokens/s,Ryzen AI Max+ 395 约 116 tokens/s,模型约占 3GB 内存;在一款手机上也达到约 20 tokens/s。GPU 高并发测试中,官方称其输出吞吐约 11K tokens/s。

这些数字的价值在于说明模型有较宽的部署选择:开发机、边缘设备和服务端都可以使用相近的模型能力。但端到端体验不能只看生成速度。图片预处理、视觉编码、设备温度、内存带宽、上下文长度、工具执行和网络传输都可能成为瓶颈。端侧部署尤其要测持续运行后的降频、内存回收和电量消耗。

对 Agent / 工程的影响

第一,端侧视觉模型适合承担“观察”,不宜独自承担“授权”

把视觉模型放在设备上,可以减少截图、文档和界面内容上传到远端的需要,也能降低交互延迟。但本地运行不等于天然安全。模型仍可能误识别敏感内容或生成错误动作,授权和审计仍需要独立组件负责。

第二,屏幕 Agent 的评测要从静态识别扩展到连续轨迹

单张截图能测识别,不能测 Agent。真正上线前要测试:页面变化后模型是否重新观察,点击后是否确认结果,弹窗遮挡时是否拒绝操作,网络断开时是否安全停住,连续多步后是否把旧截图当成当前状态。视觉 Agent 的质量是整条轨迹的稳定性,不是一张截图的准确率。

第三,小模型可以把大模型从低价值视觉工作中解放出来

在一个复杂 Agent 栈里,端侧模型可以先做截图分类、OCR、目标定位和简单工具参数提取,只有遇到歧义或高风险决策时才升级到更大的远端模型。这样做能减少上传数据、降低调用成本,也能把延迟敏感的观察环节放在本地。

第四,函数调用必须有“再观察”步骤

视觉输入天然容易过时。页面一旦变化,模型刚刚生成的坐标可能就不再有效。因此,任何改变外部状态的动作都应该采用“观察—计划—校验—执行—再观察”的循环,而不是让模型一次生成多个未经确认的点击动作。

我的判断

LFM2.5-VL-3B 的真正卖点不是“3B 也能看图”,而是它把屏幕理解、目标定位、文档 OCR、多图输入和工具调用组合成了一个端侧 Agent 可以使用的感知层。对需要本地处理、低延迟和高并发的场景,它值得做一次真实设备基准;对复杂推理和高风险自动化,它更适合作为前置观察器,而不是最终决策者。

官方 benchmark 证明了方向可行,但没有替工程团队完成上线验收。我的建议是先做一个小规模测试:选两类真实界面、两种语言、三档图像质量,分别测观察延迟、定位准确率、工具参数正确率和拒绝率。只要模型在错误时能稳定停下来,它的价值往往比“偶尔答对一个漂亮示例”更大。

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 Liquid AI 团队在 Hugging Face 发布的《LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge》,发布日期为 2026-08-12。原始 URL 是 huggingface.co/blog/LiquidAI/lfm2-5-vl-3b,模型页面是 LiquidAI/LFM2.5-VL-3B

Q2:它适合替代大型视觉模型吗?

A:不适合直接这样理解。它更适合端侧观察、文档处理、屏幕定位和轻量工具调用;复杂推理、长上下文和高风险决策仍需要更强模型或人工确认。

Q3:最值得先测试的能力是什么?

A:如果做 Agent,优先测试屏幕定位和工具调用的组合:给模型真实截图,让它返回结构化目标和参数,再由独立校验器确认,最后测执行后的再观察结果。不要只测图像描述。

Q4:官方速度能直接当作生产性能吗?

A:不能。官方数字来自特定硬件、软件栈和测试条件。生产环境还要加上图像预处理、上下文准备、工具调用、内存压力和持续运行后的设备状态,重新测端到端延迟。

Q5:端侧运行是否意味着不需要安全控制?

A:恰恰相反。数据不出设备可以降低传输风险,但视觉误判和工具误操作仍然存在。权限、参数校验、执行前确认、执行后复核和审计都不能省。


参考资料:

  1. LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge — Hugging Face Blog(2026-08-12,主体来源)
  2. LiquidAI/LFM2.5-VL-3B — Hugging Face(模型入口)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话标识

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-13-lfm25-vl-edge-agent/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可