10月3日,据MarkTechPost报道,Prime Intellect推出面向前沿开源模型的推理服务平台Prime Inference,提供无服务器端点和预留容量,运行在该公司自有GPU及多个数据中心上。

该报道称,Prime Inference在公开发布前已在内部每日处理近一万亿token,流量来自强化学习rollout、合成数据生成、评估和长时间运行的编程智能体。它是Prime Intellect开放训练栈的推理层,与prime-rl、verifiers、sandboxes等后训练工具衔接,部署模型产生的生产轨迹可回流训练。公司称其GLM-5.3端点进入OpenRouter最快行列,工具调用错误率接近零,自上线以来保持100%可用性。

平台提供按需伸缩的无服务器端点和面向持续负载的预留容量,兼容OpenAI接口,用户可将OpenAI SDK指向https://api.pinference.ai/api/v1。跨数据中心自动故障转移会将流量路由至健康部署。当前硬件为英伟达Blackwell,Vera Rubin列为即将支持。计费统一并支持团队级用量追踪,但各模型定价尚未在文档中完全公布。

其推理栈结合英伟达Dynamo、vLLM、Mooncake和FlashInfer,由Prime Intellect与Inferact、英伟达共同构建,修复也贡献至上游。目标负载为智能体场景:典型轮次会在14万token提示词上增加约6000 token。平台采用预填充与解码分离,Dynamo负责路由,vLLM在各GPU组运行模型,解码器通过NIXL拉取KV;Prime称测试中p90 token间延迟降低近40%。Dynamo的KV感知路由器会权衡缓存前缀重叠与排队工作,使会话在轮次间留在同一解码器,Mooncake则用主机DRAM增加第二层KV缓存。

在GB200 NVL72上运行GLM-5.3时,Prime设定的交互目标为每用户每秒100个端到端token。在此目标下,1:4的预填充/解码比例服务用户最多,每个预填充组达到66个会话,每用户101 token/秒、每GPU输出100 token/秒。DEP8预填充拓扑在同一硬件上的可用前缀缓存容量约为TEP8的5倍。将每GPU每步token预算从8000减半至4000后,队列等待中位数从550毫秒降至110毫秒,首token时间中位数下降约20%。NVFP4 KV压缩使每条MLA缓存行从576字节降至352字节,每个解码器缓存token数从109万升至163万。原生稀疏MLA内核在15个查询token时约12.0微秒,分阶段方案为17.7微秒,FP8为13.7微秒。BLHNC KV布局将传输描述符从19559个降至约1940个,平均传输时间从146毫秒降至78毫秒。

工具调用方面,Prime Intellect团队为GLM工具格式向Dynamo贡献结构化标签构建器,vLLM使用xgrammar屏蔽违反schema的token,并修复多个解析错误。在同类服务对比中,Prime Inference、Together AI、Fireworks AI和Baseten均提供GLM-5.3无服务器服务;Prime价格尚未公布,后三者被列为每100万token输入1.40美元、输出4.40美元。Prime提供预留容量,一键专用部署在路线图中;Together提供专用模型端点,Fireworks和Baseten提供专用GPU部署。四者均兼容OpenAI API,批量推理在Prime路线图中。价格核验于2026年10月2日。