Z.ai于8月26日发布GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型。该模型采用混合专家架构,总参数3200亿,每个token激活180亿参数,支持1048576个token的上下文窗口,并可处理图像和视频输入。模型权重以MIT许可发布在Hugging Face上。

据Z.ai公布的数据,GLM-5.3-Flash在多项基准测试和真实工作负载中超越GLM-5.2,价格约为其十分之一,内部编码基准得分与Claude Opus 4.8相差不到0.5个百分点。该模型发布首周曾以“Ox Alpha”的匿名身份在OpenCode和OpenRouter上运行,全程由国产AI芯片提供服务。

架构方面,GLM-5.3-Flash首次在GLM系列中结合线性注意力和稀疏注意力。据vLLM配置,45层语言模型交替使用KDA线性注意力层和NoPE稀疏MLA层,每个token路由到288个专家中的8个,并采用原生FP8权重。IndexPool机制通过加权池化压缩索引键向量,较GLM-5.3减少约3倍注意力计算,KV缓存缩小4.4倍。模型还采用Manifold-Constrained Hyper-Connections提升扩展效率,在相似总参数下,激活参数和层数约为GLM-4.5的一半。

基准测试方面,GLM-5.3-Flash在Terminal-Bench 2.1上得分84.3,Claude Opus 4.8为85.0,GPT-5.6 Terra为87.4;DeepSWE v1.1得分为63.4,而GLM-5.2为46.2。AutomationBench得分48.8,HLE得分55.3,OfficeQA Pro得分62.4,超过Claude Opus 4.8。Z.ai Code Bench v1.0得分为29.0,Claude Opus 4.8为29.5。独立测试机构Artificial Analysis给出的智能指数为57,输出速度为每秒48.7个token,首次响应时间1.52秒。视觉能力方面,该模型在BabyVision和MVbench上落后于Gemini 3.7 Flash。

部署方面,GLM-5.3-Flash的权重已在Hugging Face以MIT许可提供,官方API也已开放定价并开始服务。标准API价格为每百万输入token 0.15美元,缓存输入0.03美元,每百万输出token 0.50美元。默认FP8检查点约306 GiB,自托管需要NVIDIA Hopper及以上架构的GPU,至少8卡节点。Z.ai表示,整个Ox Alpha预览版均在国产AI芯片上运行,使用自研的SGLang引擎分离编码、预填充和解码,在数万个加速器上实现了3倍端到端服务提升。

该模型适用于软件和开发工具、IT/BPO自动化、金融和保险文档处理、企业BI和后台知识工作、电子商务等场景。具体应用包括仓库级编码代理、终端和浏览器/电脑操作代理、百万token级日志和合同分析、基于截图的UI回归检查,以及电子表格/演示文稿推理等。GLM Coding Plan各档位(Lite每月18美元、Pro 80美元、Max 168美元)的可用配额均为GLM-5.3的三倍,多模态能力通过ZCode的Browser Use和Computer Use功能提供。