Margrop
Articles272
Tags702
Categories6

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 4-bit 量化 6-DoF SLAM AC ACP AI & Economy ATLAS AI Agent AI Coding Assistant AI Tech AI Workflow AI tutor AI 基础设施 AI 安全 AI 工程 AI 应用 AI 日记 AI 生产力 AI编程助手 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 AUTOMATIC1111 Agent Agent Harness Agent Memory Agent 入侵 Agent 可靠性 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 训练 Agent 记忆 Agent 评测 Agent 路由 Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Async GRPO Attention Baseten Benchmark CC-Switch CI/CD CLI Tools CLI工具 CPU 推理 Cache Hit Rate Caddy ChatGPT Claude Code Claude Sonnet ClawLoader Code Interpreter CodeMender Codex Coding Agent ComfyUI Computer Use Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron Cybersecurity DFIR DSpark Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Efficiency Tools Embedding English Evaluation Cards FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Function Calling Funes GGUF GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-5.6 Sol GPT-Live GPT-Live-1 GPT-Red GPU 加速 GPU 性能分析 GRPO Gateway Gemini Gemini 3.5 Flash Gemini 3.7 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub Actions Google Google AI Google Beam Google Data Commons Google DeepMind Google Research Google Sheets Grabette Gradio Gradio Workflow Gripette HA HADashboard HF Security Incident Hailuo Hermes Hexo Holo4 HomeAssistant Hugging Face IBM Granite IBM Research Inference Providers Isaac Lab JSON Output Java KV cache Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LLM 安全 LLM 工程 LLM 评测 LVM‑Thin Late Interaction LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Meta Microsoft 365 Copilot MiniMax Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Multi-Vector Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NeoMME Newton Nginx Node.js Nunchaku OCR OOM OlmoEarth On-device AI Open Source OpenAI OpenAI Codex OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3 Qwen3-VL Qwen3.6 RAG RPC RTEB Real-Time Inference Red Teaming Responses API SNAP SOCKS5 SPED SVDQuant Schema Scientific Computing Self-Forcing Distillation Sentence Transformers Session Sheets canvas Shell Sol Storage Buckets Strands Agents Subagent Surgical Robotics TRL TTS Terra Think button TimeMachine Tokenizer Transformers TutorMoments UML Uptime Kuma V4-Pro VPS Voice Agent VoiceEQ WARP WebRTC WebSocket Windows World Foundation Model agent agentic aligenie aliyun annotation aop autofs backup bash bitwarden boot brew browser budget control centos cert certbot charles chat chrome classloader client clone closures cloudflare command commit commoditization container crontab cyber capability demo dependency deploy developer devtools dll dns docker domain download drafter draw drawio dsm dump dylib environment hooks exception fail2ban feign firewall-cmd flow free tier frontier hosted model frp frpc frps fuckgfw full-duplex function gfw git github gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iso java javascript jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s kernel key kvm lastpass launchctl learning letsencrypt linux llama.cpp low-code lvm mac mariadb markdown maven md5 microcode mirror modules monitor mount mstsc multimodal mysql n5105 network nfs node node-red nodejs nohup notepad++ npm nssm ntp oop open weights openfeign openssl os ovz packet capture pdf pem perf pip plugin png powerbutton print pro productive struggle pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina router runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student so speculative decoding spk spring springboot springfox ssh ssl stash string support svg svn swagger sync synology systemctl systemd template terminal txt ubuntu ui undertow unlocker upgrade vLLM vhd vim vm vmdk web windows with worker xml yum zai-org/GLM-5.2 zip 一致性评测 上下文压缩 上下文工程 交换机 人才争夺 人机协作 代理 企业 AI 企业自动化 优化 低延迟 供应链 健康检查 光猫 免费层 内存 内存优化 内网渗透 分布式推理 分布式训练 医疗 AI 升级 卫星影像 反向代理 反诉 可复现性 向量检索 启动 告警 告警优化 图像生成 地球观测 地理空间推理 复盘评测 夏令时 多 token 预测 多向量检索 多智能体 多模型编排 多模态 多模态 AI 多模态 API 多模态 Agent 多模态交互 多模态检索 多语言 多语言 AI 大厂人才战 大模型评测 天猫精灵 安全 安全事件 安全对齐 安装 定时任务 实时协作 实时语音 客户端 SDK 容器 导入 小米 屏幕理解 工作流编排 工具审计 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 应用市场 延迟优化 开权重 开源权重 开源模型 异常 异步任务 异步委派 微信 心跳 性能优化 性能捕捉 成本优化 成本控制 扩散模型 技术 抓包 拒答校准 按 provider 优先级 排查 推测解码 推理加速 推理成本 推理速度 推理预算 描述文件 提示词敏感性 故障排查 效率工具 教育数据开源 教育评测 数据工作流 数据治理 数据流 数据集偏差 文本编码器 旁路由 日志分析 日记 时区 显卡虚拟化 智能家居 智能音箱 服务管理 本地 agent 本地推理 机器人仿真 机器人学习 机器人数据采集 架构 模块 模型推理 模型评测 模型路由 残存访问 流式推理 流程 流程图 浏览器 混合专家 漫游 火绒 生成式影像 电信 画图 监控 监控系统 监管 知识蒸馏 磁盘 科研自动化 稀疏注意力 立体声 端侧 AI 端侧推理 端口 端口冲突 端口扫描 结构化输出 续期 网关 网络 网络安全 网络风暴 群晖 脚本 脚本优化 腾讯 自动化 自动恢复 自动攻击 自部署 苹果 虚拟机 视觉语言模型 视频生成 视频问诊 认证 证书 评测 评测基准 评测方法学 诉讼 语音 AI 语音 Agent 语音识别 超时 路由 路由器 软件工程 软件管家 软路由 运维 运维监控 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 量化 量子计算 钉钉 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 飞书

Hitokoto

Archive

Holo4 计算机操作 Agent:能否用更低成本完成跨界面任务?

Holo4 计算机操作 Agent:能否用更低成本完成跨界面任务?

Holo4 计算机操作 Agent

先说结论

Hcompany 今天发布的 Holo4,不只是又一个会点击按钮的计算机操作模型。它的核心主张是:同一个 Agent 可以根据任务,在图形界面、代码、MCP 和 API 之间切换,而不是把每种接口绑定到不同模型。Holo4 提供 27B dense 和 35B-A3B MoE 两种规模,并公开了模型权重、轨迹数据和若干评测结果。

我的判断是:Holo4 最值得关注的不是某个 benchmark 分数,而是“跨接口执行 + 可回放轨迹 + 成本曲线”这一整套工程交付方式。它适合拿来做低风险、可验证的桌面和业务流程自动化实验;但目前的分数、成本和对比结果仍带有发布方自己的 harness 与运行条件,不能直接当成生产成功率,更不能因为 Agent 会操作界面就放开不可逆权限。

发生了什么

主来源是 Hugging Face 官方博客《Holo4: powering generalist computer-use agents》,发布日期为 2026-09-28,原始 URL:https://huggingface.co/blog/Hcompany/holo4。

官方事实包括:Holo4 有 Holo4-27B 和 Holo4-35B-A3B 两个版本,同时发布更新后的 Holotron4 Nano;模型可以通过 GUI、代码、MCP 和 API 与软件交互;官方提供 FP16、FP8、NVFP4 和 4-bit GGUF 权重,也提供 H Models API、轨迹查看器和轨迹数据集。Hcompany 表示,模型通过监督学习和强化学习,在大量环境与任务上训练,其中一部分任务来自 Agentic Task Factory。

官方文章还披露了具体结果。在 OSWorld 2.0 上,Holo4 27B 的分数为 61.7%,文章列出的 Opus 5.5 为 81.8%;Holo4 35B-A3B 的分数为 30.9%。在作者给出的比较图中,Holo4 试图用更少参数和更低单任务成本,接近更大的闭源模型。官方同时说明,不同模型的发布版本、harness 和任务子集可能不同,部分参考数据来自模型卡、排行榜或其他发布材料。

以上是官方事实。我的判断是,Holo4 的主要产品信号不是“已经超过前沿模型”,而是它把评测过程、单任务成本和过程轨迹一起公开,让读者有机会检查 Agent 究竟做了什么。

技术细节

1. 一个模型覆盖四类接口,减少路由割裂

传统计算机操作 Agent 往往围绕单一接口训练:有的只看屏幕和鼠标,有的只会调用工具,有的擅长写代码但不会处理图形界面。现实中的业务任务却经常跨越多个边界:先在网页里查资料,再写一段脚本整理数据,然后调用 API 更新状态,最后回到界面确认结果。

Holo4 的设计目标是让同一个模型在这些接口之间选择。技术上,这意味着训练数据和执行 harness 不能只记录最终答案,还要覆盖不同环境中的观察、动作、工具回执和失败恢复。模型要判断什么时候点击、什么时候写代码、什么时候调用结构化工具,接口选择本身就成了规划的一部分。

这条路线的好处是减少“先判断该用哪个专用 Agent,再把任务转交出去”的额外编排;代价是模型必须同时学习视觉定位、文本规划、代码执行和工具参数。工程上不能只看单项 GUI 分数,还要测跨接口切换是否会导致上下文丢失、权限误用或状态重复提交。

2. Holo4 把轨迹作为可审计的评测证据

官方公开了 benchmark 背后的轨迹查看器和数据集,并强调可以回放每一步。对计算机操作 Agent 来说,这比只给一个成功率更有价值。一个任务最终成功,可能是第一次就完成,也可能是经历了多次错误点击、脚本失败、页面刷新和重试后才完成;两者的稳定性和成本完全不同。

理想的轨迹记录至少应包括任务状态、观察到的界面或工具结果、动作类型、调用耗时、失败类别、重试次数、回滚情况和最终判定。原始屏幕内容或代码如果包含敏感信息,可以提供脱敏轨迹、统计摘要和抽样复核,而不是无条件公开全部输入。

对生产 Agent,这种轨迹还有回归价值。模型升级后,如果成功率下降,工程师可以区分是视觉定位变差、工具参数错误、环境超时,还是模型在长流程中丢失目标。没有过程证据,团队只能从最后一句错误提示猜原因。

3. 评测分数必须和成本、任务子集一起看

Holo4 官方给出的 OSWorld 2.0 结果是 27B 版本 61.7%,35B-A3B 版本 30.9%,同时文章把分数与每任务成本放在一起比较。这个表达方式比单独报一个排行榜名次更接近工程决策:企业真正关心的是,在可接受的时间和预算内,Agent 能否稳定完成目标。

但这里也有几个边界。首先,计算机操作 benchmark 的任务版本、子集、部分得分规则和 harness 会影响结果;其次,成本估算可能依据输入输出 token、服务价格和作者自己的运行次数;再次,某些闭源模型的参考分数来自不同时间或不同设置。因而,图表适合做方向判断,不适合当作严格的同条件对照实验。

上线前应把任务分成首次成功、重试后成功、人工接管和不可恢复失败四类,并分别记录 P50/P95 完成时间、工具调用数量、模型调用成本和错误动作率。只有把这些维度放在一起,低成本才不会变成“便宜但需要人不断擦屁股”。

4. Agentic Task Factory 的关键是可验证任务生成

Hcompany 表示,其 Agentic Task Factory 已生成约 10,000 个覆盖网页应用、MCP 服务和桌面环境的任务,其中还包括同一状态同时暴露 GUI 与 MCP 的混合环境。这个思路值得工程团队借鉴:任务不是只写一句自然语言提示,而是要有环境、初始状态、目标状态和可判定的验收条件。

对 Agent 评测来说,自动生成任务并不等于自动得到可靠结论。任务生成器仍需防止目标模糊、状态不可重复、外部依赖波动和判定器误报。更稳的做法是为每个任务保存初始状态快照、动作权限、成功条件、失败条件和清理脚本,并使用合成数据覆盖正常流程、缺字段、页面变化、工具超时、重复提交和权限拒绝。

对 Agent / 工程的影响

第一,业务自动化可以从“界面录制脚本”升级为“多接口可回退 Agent”。当页面结构稳定时使用 API 或 MCP,缺少结构化接口时再使用 GUI;当代码能更可靠地完成计算时,让 Agent 写脚本而不是连续点击。接口选择应由确定性策略、权限和成本共同约束,而不是完全交给模型自由决定。

第二,评测要从最终成功扩展到动作安全。除了任务完成率,还要检查错误点击率、越权调用率、重复提交率、敏感字段暴露、人工接管率、撤销成功率和恢复时间。尤其是付款、删除、权限调整、对外发送和生产发布等动作,必须配置独立的确认点,模型不能凭自然语言自行放行。

第三,跨接口 Agent 需要统一的状态合同。GUI 看到的页面状态、脚本读取的文件状态、MCP 返回的结构化结果和 API 的服务端状态,必须映射到同一个任务状态机。每次动作都应有幂等键、前置条件、回执和失败后的清理逻辑,否则 Agent 在重试时可能重复创建任务或覆盖已有结果。

第四,优先使用合成环境和公开轨迹做回放。先让 Agent 在不含私人信息的桌面、网页和工具环境里完成低风险任务,检查它是否能识别未知、正确处理超时并在失败后停住。不要一开始就让它操作真实账号或长期保留完整屏幕录制;模型能看见界面,不代表它有权执行界面上的所有动作。

第五,模型文件和运行时也要纳入供应链治理。Holo4 提供多种权重格式,部署前应锁定来源、哈希、许可证、推理后端和量化级别。不同硬件、量化和服务接口可能导致行为变化,不能把“模型能加载”当成“Agent 已通过验收”。

我的判断

Holo4 的方向是对的:真正有用的计算机操作 Agent,不能只会点击,也不能只会调用 API,而要能在不同接口之间选择,并让过程可以回放。我会把它当作跨界面自动化的候选基线,先在合成环境和低风险流程中验证;不会把官方 OSWorld 分数直接换算成生产成功率。

这篇发布最值得行业学习的还有评测表达方式:把分数、成本、任务子集和轨迹放在一起。未来 Agent 的竞争不应只是“谁的平均分更高”,还应回答“每次成功花了多少、失败如何恢复、证据能不能复核”。

Q&A

Q1:来源、发布日期和原始 URL 是什么?

A:来源是 Hugging Face 官方博客《Holo4: powering generalist computer-use agents》,发布日期为 2026-09-28,原始 URL:https://huggingface.co/blog/Hcompany/holo4。文章介绍 Holo4 模型、训练方法、跨接口能力、评测、成本和轨迹发布计划。

Q2:Holo4 是不是只用于 GUI 操作?

A:不是。官方定位是通用计算机操作 Agent,可使用 GUI、代码、MCP 和 API。实际任务能否稳定跨接口切换,还需要在目标环境和自己的 harness 中复测。

Q3:OSWorld 2.0 的 61.7% 能代表生产成功率吗?

A:不能。它是在特定 benchmark 版本、任务子集、模型设置和执行 harness 下得到的结果。生产系统还要考虑权限、数据、页面变化、并发、网络、人工接管和失败恢复。

Q4:最小验证方案是什么?

A:准备不含真实数据的网页、桌面和工具环境,选取可回滚任务,分别测试 GUI、代码和结构化工具路径。记录首次成功、重试后成功、人工接管、耗时、调用成本、错误动作和回滚结果,再与固定基线比较。

Q5:哪些场景暂时不适合直接使用?

A:付款、删除数据、权限变更、正式发布、对外承诺和其他不可逆操作不适合直接交给模型。可以让 Agent 先生成候选动作和执行计划,最终动作由程序校验并要求明确人工确认。

来源

  1. Hcompany,Holo4: powering generalist computer-use agents,发布日期:2026-09-28,发布平台:Hugging Face,原始 URL:https://huggingface.co/blog/Hcompany/holo4

本文区分官方事实与作者判断;Holo4 的分数、成本和对比结果对应官方披露的模型、任务、运行条件与参考资料,不构成其他环境的性能保证。
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-09-28-holo4-computer-use-agent(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-09-28-holo4-computer-use-agent/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可