据量子位报道,是石科技(METASTONE)自研的Meta-Infer高效部署引擎披露,在8张PCIe-Only显卡环境中,DeepSeek-V4.1-Flash推理输入吞吐从社区Day0基线的1932 tok/s提升至13274 tok/s,整体提升6.87倍,并支持1M超长上下文。该引擎以纯软件优化,在不改动模型结构、不修改任务语义前提下,缩小模型框架与硬件间的性能差距。
是石科技定位为独立第三方全栈算力运营商,不绑定特定大模型厂商,提供硬件、组网、调度、优化与运营一站式服务。据量子位报道,该公司已纳管超过20000P算力资源,运营10多个智算中心,拥有2个国家级超算中心,团队成员曾获3项戈登·贝尔奖。
材料指出,许多GPU卡能完成模型加载、权重下载和服务拉起,但压测性能低于官方宣传。问题来自算子自动回退至低效通用实现、集合通信沿用NVLink调优参数、显存与并行配置沿用其他硬件默认值。这类卡没有高速卡间互联,也不在主流开源框架官方验证矩阵中,硬件算力被软件适配短板限制。
Meta-Infer优化分算模协同和通算重构两阶段,形成内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四项能力。内核补齐通过对齐元数据、修正页尺寸、替换老旧计算内核、扩大通信快路径生效阈值,解锁原本存在但无法触发的高性能路径。在DeepSeek-V4.1-Flash的8张PCIe-Only环境中,补齐sparse-MLA Prefill快路径、替换FP8稠密GEMM慢内核、扩大PCIe-IPC通信快路径覆盖范围后,输入吞吐从1932 tok/s升至5850 tok/s。仅完成算模协同,多款模型即获得20%至33%吞吐增益。
算模协同之后,瓶颈转向通信开销、并行调度、显存分配和重复计算。Meta-Infer对注意力、投影等关键算子做融合,将计算任务与集合通信在时间上重叠,把统计类计算嵌入通信间隙,并改写集合通信逻辑适配PCIe带宽。DeepSeek-V4.1-Flash完成全套调优后,输入吞吐从5850 tok/s进一步升至13274 tok/s。其他模型中,DeepSeek-V4-Flash从14546 tok/s提升至22584 tok/s,提升1.55倍;GLM5.3从3236.78 tok/s提升至6222.72 tok/s,提升1.92倍,P95首Token时延从141.6秒降至46.6秒,上下文支持上限从27万Token拓展到105万Token。
相同并发点配对比较下,B300的输入吞吐约为这台8卡整机的4.9至5.6倍,对应DeepSeek-V4-Flash;GLM-5.3上这一比值为3.5至4.7倍。视频生成方面,MiniMax H3借助稀疏注意力、风险感知缓存复用和Turbo LoRA组合,15秒参考图生视频端到端生成速度提升2.48倍,峰值显存与原始稠密基线持平。单机8卡整机的文生视频最高吞吐达到基线的5.33倍,参考图生视频达到基线的4.98倍。在单机8卡、5秒、768P、16:9统一整机口径下,文生视频为296条/时,参考图生视频为131条/时,对应B300的439条/时和225条/时,分别约为其67%和58%。按整机吞吐折算,在几乎无损的Ours Cache方案下,约2.6台6000D可对应1台B300的文生视频吞吐,参考图生视频约为2.9台;在Ours Cache加LoRA方案下,这一比例缩小到约1.5台和1.7台。
国产GPU上也完成了验证。国产GPU常不在主流框架官方验证矩阵内,需要针对具体硬件重新梳理执行路径。例如注意力模块要显式启用面向该平台优化的NSA稀疏注意力实现,Shared Expert融合等默认面向NVIDIA或AMD平台的特性需要关闭。通信策略按推理阶段配置,Prefill采用偏吞吐优化的DeepEP normal模式,Decode采用偏时延优化的low_latency模式,并将Shared Expert与Routed Expert拆分到两条stream中并行提交,仅这一改动在35组同配置配对测试中带来11.26%吞吐提升。
是石科技称,全部优化收敛在Meta-Infer内部,无需改动模型权重与模型结构,不改变业务任务语义。对于不在官方验证矩阵内的长尾硬件,新模型发布后能下载权重、拉起服务只是第一步,通过执行路径、通信模式和并行策略的系统适配,仍可释放更多推理性能。