据MarkTechPost报道,Exa于2026年9月26日发布Agent Ultra,这是Exa Agent API的最高努力等级,面向必须运行到穷尽的研究任务,包括大规模清单构建、实体信息补全和需要数千个信源的问题。该功能当天已在Exa API上线,调用时将effort设为“ultra”;Exa称其不开放权重,也不能自托管。
Agent Ultra把任务拆分为子任务,分配子代理同时研究多个领域,并将前沿模型路由到需要它们的步骤,在足够简单的步骤使用更快的模型。Exa称Ultra是消耗算力最多的模式,运行时间长于其他努力等级,以返回最完整结果。按文档,复杂任务通常约30分钟完成,极难任务最长3小时。
Exa团队称,Ultra在4项研究基准上击败Opus 5.5、GPT-6 Astra和Perplexity Agent各自的最大努力设置。Exa发布的数据显示,WANDR软召回率为81.4%,高于Opus 5.5的72.3%、GPT-6 Astra的26.0%和Perplexity Agent的40.1%;DeepSearchQA的F1为93.9%,高于77.6%、85.3%和89.7%;WideSearch行级F1为58.9%,高于51.6%、54.7%和56.0%;Company Find-All每任务平均通过实体数为2451,高于146、113和98。
Exa还给出成本说法:WANDR比Opus 5.5高12.6%,每任务成本为其一半;DeepSearchQA比Perplexity高4.7%,每任务成本比GPT-6 Astra低46%;WideSearch比Perplexity高5.2%,每任务成本为4个系统中最低;Company Find-All比Opus 5.5高1579%,每找到实体成本最低。Exa说明这些是相对增益,不是百分点;WANDR上对Opus 5.5的绝对差距为9.1个百分点。
WANDR是Perplexity的500项宽泛与深度数据收集任务基准,带开放测试框架;DeepSearchQA是Google DeepMind的900条提示多步搜索基准,WideSearch测试广泛信息收集。Exa称其评分器沿用上游评估逻辑,换入Exa作为内容工具,调整传输逻辑,并使用gpt-6-luna作为评判。供应商已发布的结果直接采用,否则由Exa自行运行。所有结果由供应商报告,尚未被独立复现。
Exa列出三类目标用户:模型提供商可用于组装训练数据,并验证“发布权重而非仅API”等标准;金融服务可用于构建尽职调查市场地图、在申报文件和法院记录中开展KYC研究并监测投资组合信号;市场推广团队可用于构建账户清单,并用带引用URL的判断字段补全行数据。Ultra还可扩展现有清单,传入已有行后,这些行会从新结果中排除。
API方面,Ultra使用标准Agent运行端点,请求支持outputSchema、input.data和流式传输。定价按标准Agent使用费率计量,默认每次运行最高20美元,提前完成费用更低;maxCostDollars接受1至100美元,maxDurationSeconds接受300至10800秒。停止调用可提前结束运行并保留结果,按当时用量计费。在OpenAI兼容的/responses路径上,可将reasoning.effort设为“ultra”,用户可在Exa API Playground测试。