据 Hugging Face 博客 2026 年 9 月 28 日消息,H 公司发布 Holo4 系列代理模型,包括 27B 密集模型和 35B-A3B 混合专家模型,两个版本均已在 H Models API 上线,同时推出 Holotron 3 的更新版本 Holotron4 Nano。该系列面向通用计算机使用代理,可在多种软件接口中执行任务。
Holo4 通过任何可用接口与软件交互,包括图形用户界面、代码、MCP 和 API。它能够点击和输入屏幕,编写并运行自己的代码,也可以调用 MCP 或 API 工具,并依据任务选择合适方式。H 公司称,多数代理模型只针对单一接口训练:专注图形界面的模型离开屏幕便无法工作,偏好工具调用的模型则无法操作没有 API 的应用。Holo4 在桌面、网页、Android、代码沙箱和业务 API 上运行,各平台使用同一模型,调用方式也相同。
Holo4 基于此前模型开发,通过监督学习和强化学习在大量环境与任务上训练,其中包括由 Agentic Task Factory 生成的环境和任务。H 公司表示,该模型在学术基准上得分较好,但设计目标是真实商业工作流,并在专业软件任务中进行展示。
在公开基准方面,Holo4 在 OSWorld 2.0 上的表现是:Holo4 27B 得分 61.7%,Holo4 35B-A3B 得分 30.9%;同一基准中 Opus 5.5 得分为 81.8%。H 公司称,Holo4 在长工作流上仅落后于最强的闭源模型,但参数量少得多,成本也更低。在桌面控制的 OSWorld 2.0 和 API 使用的 AutomationBench 上,Holo4 以更低单任务成本与前沿模型竞争。
H 公司公开了公开基准得分背后的全部轨迹,用户可在 trajectories.hcompany.ai 回放每一步,或从 Hugging Face 下载。关于成本表现,博客说明 OSWorld 2.0 的成本由每次代理运行的输入和输出 token 估算,Holo4 按 H Models API 单次运行价格计算,Qwen3.8 27B 和 Qwen3.6 35B-A3B 使用阿里云公开价格及内部测试框架数据;OpenAI 发布数据提供 GPT 和 Opus 的投入扫描,其他闭源和开放权重模型使用 OSWorld 2.0 官方排行榜。AutomationBench 方面,Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B 的得分与成本来自 AutomationBench v1.0.6 内部测试框架,其他模型使用 AutomationBench README 的公开集分数和官方排行榜的每任务成本,后者运行于私有集。H 公司称将在私有集评估后报告 Holo4 成绩。不同发布版本、测试框架和任务子集存在差异。
在专业软件示例中,H 公司用 FreeCAD 建模任务比较 Holo4 27B 与其基座模型 Qwen3.8 27B,二者使用相同提示和测试框架。埃菲尔铁塔建模任务中,Holo4 27B 消耗 84 次调用、130 万 token,Qwen3.8 27B 消耗 60 次调用、100 万 token。博客还列出 H 公司标志建模示例。