据SiliconANGLE报道,Z.ai公司于8月26日开源了大型语言模型GLM-5.3-Flash,该模型的运行成本较上一代产品降低十倍。这款模型最初于上周以代号“Ox Alpha”亮相,由大模型市场运营商OpenRouter发布免费托管版本,但未公开开发者,引发业界猜测。如今Z.ai确认了其开发者身份。

GLM-5.3-Flash采用混合专家架构,总参数量达3200亿,每次回答提示词时激活180亿参数。模型支持处理包含100万token的文本、图像和视频输入,单次响应最多可生成131072个token。与Z.ai早期模型不同,GLM-5.3-Flash在注意力机制上做出重大改动。它通过将提示词拆分为token并相互比较来提取关键信息,但不再分析所有token,而是借助稀疏注意力技术只审查最相关的token,从而降低算力开销。

Z.ai还采用线性注意力技术进一步减少硬件资源占用。通常提示词规模翻倍会使注意力机制的内存消耗增至四倍,而启用线性注意力后,内存占用仅翻倍。传统注意力机制依赖softmax函数将数值转换为概率,该函数是内存消耗的主要来源之一,线性注意力则用更高效的算法替代了softmax。

Z.ai称,GLM-5.3-Flash的运行成本仅为上一代模型的十分之一,并在多项主流AI基准测试中表现出色。Z.ai将其与Claude Opus 4.8、GPT-5.6 Terra和Gemini 3.7 Flash对比,GLM-5.3-Flash在评估知识工作能力的GDPval-AA v2测试中得分最高,在评估云端应用任务完成能力的AutomationBench中位居第二。

该模型使用包含30万亿token的数据集训练,并引入名为mHC的技术优化训练流程。在训练过程中,梯度数据穿过模型神经元层以调整参数,但可能发生扭曲而降低效果,mHC技术降低了此类风险。GLM-5.3-Flash的权重已发布于Hugging Face平台。