8月26日,智谱发布并开源GLM-5.3 Flash,证实近日在海外开发者社区爆火的神秘模型“牛来”(Ox Alpha)正是出自该公司。据量子位报道,GLM-5.3 Flash是智谱GLM系列首个原生多模态模型,总参数量320B,实际激活参数18B,能力全面超越此前发布的GLM-5.2。

神秘模型“牛来”在匿名测试期间已获得大量关注。在OpenRouter上,它首日便冲上榜首并刷新单日tokens用量纪录;OpenCode表示,Ox Alpha终结了DeepSeek在该平台连续56天霸榜的纪录。智谱认领后披露,匿名测试期间该模型承接的真实请求全部由国产芯片提供算力。

架构上,GLM-5.3 Flash采用线性注意力与稀疏注意力混合架构,并通过IndexPool将索引器缓存向量压缩,相比GLM-5.3注意力计算量降低3.01倍,KV Cache缩小4.44倍。为在国产加速芯片上支撑多模态和1M上下文,智谱将模型拆分为Encode-Prefill-Decode分离式架构,叠加Layer Split、混合缓存量化等优化,端到端服务性能较初始基线提升3倍,单Token成本与主流英伟达GPU方案相当。

实测中,GLM-5.3 Flash展现了多项多模态与编程能力。它可以识别视频中的多个说话人并生成带高亮跟读的字幕,也能将整部电影《神话》剪辑成一条完整的中文解说视频。在给定一张UI设计稿后,模型能直接生成可交互的购物App。智谱官方还展示了一个由该模型独立运行12小时完成的3D Blender场景构建任务。模型专门为Visual Coding设计了数据合成流水线,可在执行过程中自行查看页面、交互和3D场景并继续修改。

价格方面,GLM-5.3 Flash定价为GLM-5.3的1/10,限时折扣为GLM-5.3的1/20、Claude Opus 4.8的1/40,低于DeepSeek-V4-Flash。根据最新AA榜单,该模型得分57分,与Claude Opus 4.8持平。模型已面向全球开源,并接入ZCode、开放API,开发者可通过BigModel开放平台和Z.ai获取。