Holo4 计算机操作 Agent:能否用更低成本完成跨界面任务?
先说结论
Hcompany 今天发布的 Holo4,不只是又一个会点击按钮的计算机操作模型。它的核心主张是:同一个 Agent 可以根据任务,在图形界面、代码、MCP 和 API 之间切换,而不是把每种接口绑定到不同模型。Holo4 提供 27B dense 和 35B-A3B MoE 两种规模,并公开了模型权重、轨迹数据和若干评测结果。
我的判断是:Holo4 最值得关注的不是某个 benchmark 分数,而是“跨接口执行 + 可回放轨迹 + 成本曲线”这一整套工程交付方式。它适合拿来做低风险、可验证的桌面和业务流程自动化实验;但目前的分数、成本和对比结果仍带有发布方自己的 harness 与运行条件,不能直接当成生产成功率,更不能因为 Agent 会操作界面就放开不可逆权限。
发生了什么
主来源是 Hugging Face 官方博客《Holo4: powering generalist computer-use agents》,发布日期为 2026-09-28,原始 URL:https://huggingface.co/blog/Hcompany/holo4。
官方事实包括:Holo4 有 Holo4-27B 和 Holo4-35B-A3B 两个版本,同时发布更新后的 Holotron4 Nano;模型可以通过 GUI、代码、MCP 和 API 与软件交互;官方提供 FP16、FP8、NVFP4 和 4-bit GGUF 权重,也提供 H Models API、轨迹查看器和轨迹数据集。Hcompany 表示,模型通过监督学习和强化学习,在大量环境与任务上训练,其中一部分任务来自 Agentic Task Factory。
官方文章还披露了具体结果。在 OSWorld 2.0 上,Holo4 27B 的分数为 61.7%,文章列出的 Opus 5.5 为 81.8%;Holo4 35B-A3B 的分数为 30.9%。在作者给出的比较图中,Holo4 试图用更少参数和更低单任务成本,接近更大的闭源模型。官方同时说明,不同模型的发布版本、harness 和任务子集可能不同,部分参考数据来自模型卡、排行榜或其他发布材料。
以上是官方事实。我的判断是,Holo4 的主要产品信号不是“已经超过前沿模型”,而是它把评测过程、单任务成本和过程轨迹一起公开,让读者有机会检查 Agent 究竟做了什么。
技术细节
1. 一个模型覆盖四类接口,减少路由割裂
传统计算机操作 Agent 往往围绕单一接口训练:有的只看屏幕和鼠标,有的只会调用工具,有的擅长写代码但不会处理图形界面。现实中的业务任务却经常跨越多个边界:先在网页里查资料,再写一段脚本整理数据,然后调用 API 更新状态,最后回到界面确认结果。
Holo4 的设计目标是让同一个模型在这些接口之间选择。技术上,这意味着训练数据和执行 harness 不能只记录最终答案,还要覆盖不同环境中的观察、动作、工具回执和失败恢复。模型要判断什么时候点击、什么时候写代码、什么时候调用结构化工具,接口选择本身就成了规划的一部分。
这条路线的好处是减少“先判断该用哪个专用 Agent,再把任务转交出去”的额外编排;代价是模型必须同时学习视觉定位、文本规划、代码执行和工具参数。工程上不能只看单项 GUI 分数,还要测跨接口切换是否会导致上下文丢失、权限误用或状态重复提交。
2. Holo4 把轨迹作为可审计的评测证据
官方公开了 benchmark 背后的轨迹查看器和数据集,并强调可以回放每一步。对计算机操作 Agent 来说,这比只给一个成功率更有价值。一个任务最终成功,可能是第一次就完成,也可能是经历了多次错误点击、脚本失败、页面刷新和重试后才完成;两者的稳定性和成本完全不同。
理想的轨迹记录至少应包括任务状态、观察到的界面或工具结果、动作类型、调用耗时、失败类别、重试次数、回滚情况和最终判定。原始屏幕内容或代码如果包含敏感信息,可以提供脱敏轨迹、统计摘要和抽样复核,而不是无条件公开全部输入。
对生产 Agent,这种轨迹还有回归价值。模型升级后,如果成功率下降,工程师可以区分是视觉定位变差、工具参数错误、环境超时,还是模型在长流程中丢失目标。没有过程证据,团队只能从最后一句错误提示猜原因。
3. 评测分数必须和成本、任务子集一起看
Holo4 官方给出的 OSWorld 2.0 结果是 27B 版本 61.7%,35B-A3B 版本 30.9%,同时文章把分数与每任务成本放在一起比较。这个表达方式比单独报一个排行榜名次更接近工程决策:企业真正关心的是,在可接受的时间和预算内,Agent 能否稳定完成目标。
但这里也有几个边界。首先,计算机操作 benchmark 的任务版本、子集、部分得分规则和 harness 会影响结果;其次,成本估算可能依据输入输出 token、服务价格和作者自己的运行次数;再次,某些闭源模型的参考分数来自不同时间或不同设置。因而,图表适合做方向判断,不适合当作严格的同条件对照实验。
上线前应把任务分成首次成功、重试后成功、人工接管和不可恢复失败四类,并分别记录 P50/P95 完成时间、工具调用数量、模型调用成本和错误动作率。只有把这些维度放在一起,低成本才不会变成“便宜但需要人不断擦屁股”。
4. Agentic Task Factory 的关键是可验证任务生成
Hcompany 表示,其 Agentic Task Factory 已生成约 10,000 个覆盖网页应用、MCP 服务和桌面环境的任务,其中还包括同一状态同时暴露 GUI 与 MCP 的混合环境。这个思路值得工程团队借鉴:任务不是只写一句自然语言提示,而是要有环境、初始状态、目标状态和可判定的验收条件。
对 Agent 评测来说,自动生成任务并不等于自动得到可靠结论。任务生成器仍需防止目标模糊、状态不可重复、外部依赖波动和判定器误报。更稳的做法是为每个任务保存初始状态快照、动作权限、成功条件、失败条件和清理脚本,并使用合成数据覆盖正常流程、缺字段、页面变化、工具超时、重复提交和权限拒绝。
对 Agent / 工程的影响
第一,业务自动化可以从“界面录制脚本”升级为“多接口可回退 Agent”。当页面结构稳定时使用 API 或 MCP,缺少结构化接口时再使用 GUI;当代码能更可靠地完成计算时,让 Agent 写脚本而不是连续点击。接口选择应由确定性策略、权限和成本共同约束,而不是完全交给模型自由决定。
第二,评测要从最终成功扩展到动作安全。除了任务完成率,还要检查错误点击率、越权调用率、重复提交率、敏感字段暴露、人工接管率、撤销成功率和恢复时间。尤其是付款、删除、权限调整、对外发送和生产发布等动作,必须配置独立的确认点,模型不能凭自然语言自行放行。
第三,跨接口 Agent 需要统一的状态合同。GUI 看到的页面状态、脚本读取的文件状态、MCP 返回的结构化结果和 API 的服务端状态,必须映射到同一个任务状态机。每次动作都应有幂等键、前置条件、回执和失败后的清理逻辑,否则 Agent 在重试时可能重复创建任务或覆盖已有结果。
第四,优先使用合成环境和公开轨迹做回放。先让 Agent 在不含私人信息的桌面、网页和工具环境里完成低风险任务,检查它是否能识别未知、正确处理超时并在失败后停住。不要一开始就让它操作真实账号或长期保留完整屏幕录制;模型能看见界面,不代表它有权执行界面上的所有动作。
第五,模型文件和运行时也要纳入供应链治理。Holo4 提供多种权重格式,部署前应锁定来源、哈希、许可证、推理后端和量化级别。不同硬件、量化和服务接口可能导致行为变化,不能把“模型能加载”当成“Agent 已通过验收”。
我的判断
Holo4 的方向是对的:真正有用的计算机操作 Agent,不能只会点击,也不能只会调用 API,而要能在不同接口之间选择,并让过程可以回放。我会把它当作跨界面自动化的候选基线,先在合成环境和低风险流程中验证;不会把官方 OSWorld 分数直接换算成生产成功率。
这篇发布最值得行业学习的还有评测表达方式:把分数、成本、任务子集和轨迹放在一起。未来 Agent 的竞争不应只是“谁的平均分更高”,还应回答“每次成功花了多少、失败如何恢复、证据能不能复核”。
Q&A
Q1:来源、发布日期和原始 URL 是什么?
A:来源是 Hugging Face 官方博客《Holo4: powering generalist computer-use agents》,发布日期为 2026-09-28,原始 URL:https://huggingface.co/blog/Hcompany/holo4。文章介绍 Holo4 模型、训练方法、跨接口能力、评测、成本和轨迹发布计划。
Q2:Holo4 是不是只用于 GUI 操作?
A:不是。官方定位是通用计算机操作 Agent,可使用 GUI、代码、MCP 和 API。实际任务能否稳定跨接口切换,还需要在目标环境和自己的 harness 中复测。
Q3:OSWorld 2.0 的 61.7% 能代表生产成功率吗?
A:不能。它是在特定 benchmark 版本、任务子集、模型设置和执行 harness 下得到的结果。生产系统还要考虑权限、数据、页面变化、并发、网络、人工接管和失败恢复。
Q4:最小验证方案是什么?
A:准备不含真实数据的网页、桌面和工具环境,选取可回滚任务,分别测试 GUI、代码和结构化工具路径。记录首次成功、重试后成功、人工接管、耗时、调用成本、错误动作和回滚结果,再与固定基线比较。
Q5:哪些场景暂时不适合直接使用?
A:付款、删除数据、权限变更、正式发布、对外承诺和其他不可逆操作不适合直接交给模型。可以让 Agent 先生成候选动作和执行计划,最终动作由程序校验并要求明确人工确认。
来源
- Hcompany,Holo4: powering generalist computer-use agents,发布日期:2026-09-28,发布平台:Hugging Face,原始 URL:https://huggingface.co/blog/Hcompany/holo4
本文区分官方事实与作者判断;Holo4 的分数、成本和对比结果对应官方披露的模型、任务、运行条件与参考资料,不构成其他环境的性能保证。
隐私自检:未写入姓名、账号、用户输入、内部网络细节、凭据或会话标识
封面 seed:2026-09-28-holo4-computer-use-agent(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech