Perplexity与Nvidia于8月25日联合发布本地优先AI代理平台“Portable Computer”。该平台在搭载Nvidia硬件的Linux设备上运行AI模型、文件、工具和工作流,本地任务不产生token费用,数据默认保留在设备端,只有用户明确许可后,单个步骤才会被发送至云端模型处理。Nvidia开发者技术总监Nader表示,本地AI已经到达临界点,开源模型使其从爱好者的玩具转变为实用工具。
据Slashdot报道,Portable Computer面向Pro、Max、Enterprise Pro和Enterprise Max订阅者推出,Linux版本即日可用,Windows支持将在9月上线,macOS不在路线图中。硬件门槛为至少24GB显存的RTX GPU(如GeForce RTX 3090或更新),或Nvidia的DGX Spark设备。Nader称这一配置是保证良好体验的最低要求,同时也希望尽可能扩大覆盖范围。
Perplexity将本地模型、推理引擎、代理框架、工具沙箱和应用连接器打包为一个系统,用户无需自行搭建推理服务器或手动配置工具。用户可选择Qwen 3.8 27B或Perplexity针对自身框架微调的PPLX 27B模型,Nvidia的Nemotron 3.5 Lightning(开放30B MoE模型)也即将加入。代码和工具调用在操作系统强制沙箱内执行,限制进程、文件系统路径和网络访问;如果沙箱不可用,工具执行将被禁用而非静默降级。Gmail、Outlook、Slack和GitHub连接器均通过本地编排器路由。
所谓“本地优先”并非“仅本地”。当任务步骤需要实时网络或前沿推理时,编排器会暂停并征求用户许可。在调用云端模型前,系统会筛选相关上下文,运行PII分类器,并向用户展示将离开设备的具体内容。获批的步骤会发送至15种以上云端模型之一,远端模型仅返回文本建议,无法直接访问本地文件、工具或对话。针对小型模型的上下文限制,系统会保持系统提示和工具集精简、按需加载专业技能、将连接器暴露为紧凑的CLI工具,并在运行中压缩过时上下文。
Perplexity公布了多项基准测试结果。在自有53项本地知识工作测试中(涵盖深度研究、财务分析和文档创建),运行Qwen 3.8 27B的Computer平台在DGX Spark上得分82.6%,高于开源Pi框架的77.6%和Hermes的74.0%;采用PPLX 27B后得分升至85.4%。在BrowseComp上,Computer成绩为66.7%,同样超越Pi(50.2%)和Hermes(43.9%),且分别少用51%的墙钟时间和70%的token。在视觉文档理解测试ParseBench-100上,其得分65.1%,远高于后两者的34.6%和13.9%。在Terminal Bench 2.1上,纯本地运行得分59.6%,边际成本几乎为零;通过云端顾问升级后得分升至73.0%,单次成本约0.415美元,而Claude Opus 5得分为82.4%,成本约0.65美元。升级能缩小与前沿模型的差距,但并未完全关闭。
Portable Computer面向已拥有Nvidia工作站的企业和中型团队,以及资金充裕的AI原生初创公司,金融、法律、医疗、政府和国防以及知识产权密集型工程等对数据驻留或合同保密性有要求的行业是主要目标。应用场景包括文档集费用与披露审查、PII受限研究、代码库规模迁移、本地语料批量摘要等。由于硬件本身的价格门槛,该方案并不适合一般中小企业。DGX Spark安装需要GB10超级芯片、128GB内存和至少1TB存储;Qwen模型以3位量化发布,下载体积17.4GB,需32GB内存;Nemotron模型为4位量化,19GB,需36GB内存。其他系统需运行DGX OS或Ubuntu(ARM或x64),并配备24GB以上显存的RTX GPU。安装通过标准apt源完成。目前仅支持单台DGX Spark,集群功能仍在路线图中。