据雷峰网报道,8月26日晚,智谱正式上线并开源原生多模态模型GLM-5.3-Flash(320B-A18B)。商汤大装置为其上线提供大规模国产算力支持与Token服务,国产算力在前沿大模型推理场景下实现规模化商用落地。
GLM-5.3-Flash总参数达320B,能力超过GLM-5.2。在Artificial Analysis Intelligence Index中,该模型获得57分,与Anthropic最受欢迎的Claude Opus 4.8持平,进入全球前沿模型能力区间。其架构专为极低成本设计,结合智谱最新的30T Token多模态预训练语料,能够以更少计算资源实现更强性能。
商汤大装置此次支持依托其“一套模型、一座Token工厂、一套智能体管控系统”核心能力体系。Token工厂通过多模态模型与大装置基础设施联合优化,将不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的Token,并与大模型构建双向反哺闭环,适配原生多模态模型的迭代需求。
在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode和OpenRouter上大规模测试,Token调用量高达62T,这些请求流量全部由国产芯片提供算力支持。相比同一硬件环境下的初始基线,该模型基于国产芯片集群的端到端服务性能提升3倍,硬件效率和单Token成本已达到主流英伟达GPU相当水平。这一实践表明,国产算力已能在大规模真实业务场景下高效、经济地支撑前沿大模型推理需求。
今年WAIC期间,商汤大装置从性价比、适配性、能效比三个维度应对国产算力规模化商用卡点。通过异构混合推理技术,让不同架构、不同定位的国产芯片各尽其长,整体推理性价比达到NVIDIA H系列的1.25倍,同等成本下Token产能扩大约2.5倍。同时通过底层算子优化、多卡并行调优和工具链适配降低应用门槛,并推出算电协同Agent,以TPW(Tokens Per Watt)作为AIDC价值标尺。
商汤大装置7月日均Token服务量已达2.42万亿,预计2026年底突破日均10万亿,全年Token量级增长25倍。商汤方面表示,未来将持续投入基于国产化算力的Token服务建设,推动国产算力从单点技术突破走向产业体系化繁荣。