科技媒体MarkTechPost于9月5日报道,Nous Research为其桌面应用Hermes Desktop新增一键本地模型设置功能。该功能可自动读取用户硬件信息,选择匹配的模型并完成下载与推理配置,使在个人电脑上部署开源大模型只需一次点击。

该报道称,此前的本地模型运行难点集中在准备工作上:用户需要自行核对显存规格、估算量化版本、设置上下文长度与GPU层数,并在加载时面对模型文件体积过大的问题。新流程在Hermes Desktop首次启动时自动出现,之后可在设置菜单的Providers → Local Models路径下重新打开。Hermes Desktop是开源Hermes Agent的免费版本,采用MIT许可,支持macOS 12及以上、Windows 10/11与各Linux发行版,使用本地模型无需账户。

Hermes在底层自行管理推理引擎。报道援引其本地模型文档说,应用会获取与硬件匹配的官方llama.cpp构建版本,体积为数百MB,随后校验并持续更新。推理后端覆盖CUDA、Metal、Vulkan、HIP与CPU,相关配置写入config.yaml的local_runtime区块,桌面界面会自动写入,无图形界面的用户也可手动设置。

报道还显示,在用户下载任何内容之前,应用会针对用户的机器逐个评估模型库中的模型,并给出显存适配判断。判断用三种颜色显示:绿色表示模型可完整放入GPU显存;琥珀色表示会占用系统内存,速度变慢;红色表示该机器无法承载。每行还会显示起始与最大上下文窗口,以及为当前硬件选择的构建下载体积。量化版本选择规则固定为:选择能在GPU显存中完整运行的最高质量版本,显存较小的机器则使用同一模型的更紧凑版本。系统设有4比特量化下限,若机器无法在不把模型溢出到系统内存的情况下运行该4比特版本,则这台机器无法使用该模型;不适配的模型仍会列出,并附上原因。

内存策略方面,报道称上下文窗口会从正好适配GPU显存的长度起步,随着对话增长扩展至模型原生的最大上下文,每个推荐模型至少保证64K窗口。当模型超出GPU显存时,超出部分按伤害最小的顺序放到系统内存,先转移专家权重,且从不卸载注意力缓存,以吞吐量换取上下文长度保障。只有当对话达到最大上下文窗口后,系统才会进行会话压缩。模型闲置15分钟会卸载,待用户再次发送消息后重新加载。