H公司于9月29日发布Holo4系列通用电脑操作模型,一套权重可完成屏幕点击与输入、代码编写以及MCP或API工具调用。该系列包含27B稠密版与35B-A3B混合专家版(激活参数3B)两个规模,二者在H Models API上均提供256K上下文。其中35B-A3B以Apache 2.0协议开放权重供商业自托管,27B权重采用CC BY-NC 4.0协议,商业使用需经由H Models API。
据H公司介绍,Holo4是面向电脑操作的视觉语言模型。27B版基于Qwen3.8-27B微调,35B-A3B版构建于Qwen3.6-35B-A3B之上。两者均搭配H公司开源的hai-agents框架使用,该框架将截图与工具执行结果发送给模型,再执行模型要求的点击、输入、代码运行和工具调用。H公司称此举针对一个已知缺口:纯图形界面代理在没有屏幕时失效,工具调用代理在应用缺少API时停滞。Holo4可运行于桌面、网页、安卓、代码沙箱和企业API环境,在不同平台上以同一模型、同一调用方式工作。
H公司公布的基准测试表显示,Holo4 27B在OSWorld上得分85.2%,单任务成本0.08美元;其基础模型Qwen3.8 27B得分为84.3%,单任务成本0.22美元。在AndroidWorld上,Holo4 27B达到85.1%。长流程任务上仍有差距:在OSWorld 2.0上,Holo4 27B得分61.7%,单任务成本1.22美元;按H公司数据,Claude Opus 5.5得分81.8%,单任务成本8.48美元。在AutomationBench上,Holo4 27B得分45.4%,单任务成本0.05美元。H公司同时说明,前沿模型的分数来自不同的框架和投入级别;此外AutomationBench的600个公开任务中有480个落在H公司采集训练数据所用的划分中,在120个留出任务上,Holo4 27B得分为49.3%。H公司表示已在trajectories.hcompany.ai和Hugging Face上公开全部轨迹。
在构建方法上,H公司通过内部流水线从文档、截图和真实软件中生成环境与可验证任务,称为Agentic Task Factory。该流水线已产出约1万个任务,其中网页应用4000个、MCP服务器3000个、桌面与操作系统3000个。任务只有在验证器能够拒绝近似错误答案、且代理必须通过真实界面解决时才被保留。监督微调数据集包含1270亿个token,其中约四分之三为成功的代理轨迹,按领域分为桌面45%、网页14%、MCP与API 12%、移动端3%。强化学习阶段采用异步在线RL训练两个LoRA专家,一个处理桌面与网页,另一个处理终端、MCP与API,两者以等权重合并,不再继续训练。框架方面,H公司依据OSWorld 2.0的失败分析重建了代理循环,最大改动是数百步范围内的可靠记忆和桌面机器上的shell。
H公司同日发布Holotron4 Nano,该模型通过Nemotron Coalition构建于英伟达的Nemotron 3 Nano Omni之上。据H公司称,同样的组合使OSWorld得分从基础模型的21.0%提升至76.3%。
定价方面,Holo4 27B为每百万输入token 0.40美元、输出3.00美元;Holo4 35B-A3B为输入0.30美元、输出2.00美元。API兼容OpenAI接口,地址为https://api.hcompany.ai/v1。Hugging Face上的权重提供BF16、FP8、NVFP4和4位GGUF格式,H公司提供了使用vLLM和llama.cpp进行本地推理的文档,并称用于加速推理的DSpark草稿模型检查点将在未来数日内发布。