据 SiliconANGLE 报道,SpaceX 于 9 月 22 日发布 Grok 4.7,称其是该公司迄今能力最强的大语言模型,新版本在长时程任务处理和安全防护上做了针对性调整。

Grok 系列最初由马斯克创立的初创公司 xAI Corp. 开发。马斯克去年将这家公司与 xAI Inc. 合并,合并后的机构随后被并入 SpaceX,SpaceX 由此不仅获得 Grok 模型系列,还接手了多个人工智能数据中心。

在评测环节,SpaceX 使用 Cursor 开发的 CursorBench 4.0 对 Grok 4.7 进行测试。Cursor 同样是 SpaceX 近期收购的公司。Grok 4.7 完成该基准挑战的平均成本为每项任务 4.69 美元,领先 GPT-5.6 Sol 和 Fable 5.1。SpaceX 对后两款模型测试的是优先输出质量、不以成本效率为目标的硬件密集型版本。

在应用更广的基准上,Grok 4.7 在 Harvey Legal Agent Benchmark 和 EEBench 上明显超过 Fable 5.1,这两项基准分别包含法律任务和芯片设计任务。不过 Grok 4.7 在 EEBench 上的得分低于 OpenAI Group PBC 最新大语言模型 GPT-6 Astra。

SpaceX 将 Grok 4.7 的表现归因于新的基座模型。大语言模型训练由多个阶段组成,每个阶段改进算法的一个不同方面,基座模型是训练第一阶段结束后形成的初始版本,人工智能厂商常在不同版本的模型之间复用基座模型。按 SpaceX 的说法,其工程师还改进了 Grok 4.7 的强化学习流程,与上一代相比,该模型接受了难度更高的训练任务,训练持续时间也更长。

Grok 4.7 被设计为兼容 SpaceX 的 Grok Bot harness。这一技术资源集合允许模型把复杂工作拆分给多个 AI 智能体,这些智能体可并行执行多项不同任务以加快处理速度,并相互核验输出结果的准确性。

安全方面,SpaceX 为 Grok 4.7 配备了新的防护措施。公司称该模型在 LatchBio 和 HackerBench 两项基准上创下纪录,这两项基准分别测试大语言模型拦截恶意生物学研究请求和网络安全请求的能力。

定价上,Grok 4.7 的输入价格为每百万 token 2 美元起,输出价格为每百万 token 6 美元起。针对对延迟敏感的工作负载,SpaceX 提供处理提示速度翻倍、价格也翻倍的版本。

Grok 4.7 的发布距离 SpaceX 上一次模型发布不到一周。上周五,该公司推出一款文本转语音模型,准确率是上一代的两倍,成本减半。SpaceX 称 Grok Voice Transcribe 2.0 的表现也优于竞争对手的多款同类产品。