8月26日晚,阿里巴巴发布并同步开源千问最新模型Qwen3.8-Flash(开源版本名为Qwen3.8-Flash-Next)。该模型采用全新的“Next”架构,总参数1250亿(125B),每次推理仅激活60亿(6B)参数,据称性能可超越Claude Opus4.6,并且训练成本较上一代Qwen3.7-Plus骤降近90%。阿里表示,这一架构将作为下一代千问大模型Qwen4的雏形。

模型结构上,Qwen3.8-Flash是一个多模态混合专家(MoE)模型,除125B的Transformer主干外,还配有51B的N-gram嵌入参数和一个40亿参数的multi-token prediction模块,磁盘上共180B参数,但每个token只激活6B。据科技媒体MarkTechPost报道,模型原生上下文长度为262,144 tokens,可通过YaRN扩展到100万。开源的权重已上传至Hugging Face和魔搭社区,采用qwen-community-1.0许可证,并非Apache-2.0,商业使用前需核实条款。

在性能方面,中文科技媒体雷峰网报道,Qwen3.8-Flash在SWE-bench Pro编程评测中领先Claude Opus4.6达9.1分,在JobBench智能体任务中超出近20分,在AndroidWorld手机操作评测中高出22.5分。MarkTechPost给出了具体分数:DeepSWE 1.1为58.7,SWE-bench Pro为62.5,SWE-bench Multilingual为81.0,LiveCodeBench v6为91.9;智能体任务中CoWorkBench 73.9、JobBench 55.7、Toolathlon Verified 73.5;多模态方面AndroidWorld 84.5、MathVision 95.7。但MarkTechPost同时指出,该模型并非在所有基准上领先:在HLE(人类最后考试)上Claude Opus 4.6获得40.0分,Qwen3.8-Flash为35.9分;在NL2Repo-Bench基准上,DeepSeek-V4-Flash-0731以54.2分领先于Qwen的48.1分,前沿推理仍是差距所在。

架构创新方面,据雷峰网报道,Qwen3.8-Flash引入了独特的QSA(Qwen Sparse Attention)机制,与GDN形成混合注意力结构,在高缓存命中的100万token长上下文场景下可提速8倍以上;同时引入Gated Residual方法,将传统Transformer的信息主通道从1条扩展为4条动态读写;还通过51B的N-gram Embedding参数提供高效的查表寻址。MarkTechPost详细说明了布局:每4层中3层使用Gated DeltaNet线性注意力层,第4层使用QSA,共48层形成12组,QSA预算为512个块或2048个token。关于加速效果,MarkTechPost提到厂商报告QSA内核在100万token下prefill最高加速7.6倍、decode最高4.9倍,而SGLang和vLLM食谱中称分别可达10.2倍和6.6倍,这些数据尚未经独立测量验证。

成本方面,据雷峰网,Qwen3.8-Flash仅用九分之一的资源便完成训练,训练成本下降90%;推理时每百万tokens输入1元、输出3元,约为Claude Opus4.6的3%,最低为DeepSeek-V4-Flash忙时价格的三分之一。MarkTechPost也确认训练成本约为Qwen3.7-Plus的九分之一。部署方面,模型FP8权重为172.78 GiB,BF16权重为335.28 GiB,MarkTechPost指出自托管需要多GPU节点,工作站无法运行。模型已上线“千问办公”标准模式,开发者和企业可通过千问AI平台获取API,支持vLLM、SGLang、llama.cpp等推理框架,并已开始为Qwen4的研发提供验证。