返回博客
·AI工具

让 AI 替你点鼠标:H Company 开源 Holo4,「操作电脑」智能体跑出 85.2%

H Company 开源了 Holo4 系列,其中 27B 版本在 OSWorld 上达到 85.2%,每任务成本仅 0.08 美元——「会用电脑」正在从演示变成产品。

#AI智能体#Computer Use#开源#自动化

# 让 AI 替你点鼠标:H Company 开源 Holo4,「操作电脑」智能体跑出 85.2%

9 月 28 日,H Company 开源了两个 **Holo4** 模型,定位是「**会操作电脑的智能体**」:能看屏幕、点鼠标、敲键盘、写代码,还能调用 MCP 或 API 工具。其中较大的版本在自家的测试里成绩更好,但**不能商用**;较小的一版则是 **Apache 2.0** 许可,可以放心拿来用。

一、它到底能干什么

Holo4 属于现在最热的一类模型:**Computer Use(电脑操作)**。区别于「聊天机器人」,它的输出不是文字,而是**动作**:

  • 看懂屏幕上的界面元素;
  • 在正确的位置点击、输入;
  • 根据反馈判断下一步,必要时自我纠正;
  • 调用外部工具或接口完成任务。
  • 社区给出的实测数据是:**Holo4-27B 在 OSWorld 上达到 85.2%,每个任务成本约 0.08 美元**。OSWorld 是一个衡量「模型能否在真实操作系统环境里完成任务」的基准,85% 左右已经是很能打的水准。

    二、为什么「电脑操作」这么难

    看起来就是「点几下」,做起来却极难:

  • 界面没有标准:每个网站、每个软件的布局都不一样,模型得靠视觉去理解,而不是读 API;
  • 一步错、步步错:点错按钮就可能触发不可逆操作,容错窗口很窄;
  • 要长时间保持状态:一个任务可能几十步,中途不能「忘了自己做到哪」;
  • 安全边界难以划定:能点鼠标,意味着也能误删文件、误发消息。
  • 所以这类模型的推出,往往伴随着一整套**沙箱、权限与审计**的工程配套——否则能力越强,风险越大。

    三、开源的意义

    Holo4 选择开源(至少小版本),对想要试水自动化的人来说是个好消息:**以前「让 AI 操作电脑」只能靠闭源 API,现在有了可本地部署的选项**。结合 9 月下旬那一波「小模型 + 决策模型」的发布潮,一个清晰的图景正在成形:

  • 大模型负责「想」(规划、推理);
  • 小模型 / 专用模型负责「做」(决策、路由、动作);
  • 沙箱与权限负责「兜底」。
  • 小结

    Holo4 的意义不在于某一个跑分,而在于它把「**会用电脑的智能体**」从实验室演示,推向了**可下载、可部署、可按任务计价**的产品形态。接下来的问题不再是「AI 能不能操作电脑」,而是「**你愿意把多少操作权限交给它**」。