快速了解本文
阿里通义千问开源 Qwen3.8-Flash,训练成本降至前代九分之一。
模型原生支持 26 万 tokens 上下文,可通过 YaRN 扩展至 1M。
API 定价为每百万 Tokens 输入 1 元、输出 3 元。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 阿里通义千问团队发布并开源 Qwen3.8-Flash 及 Qwen3.8-Flash-Next 模型权重。这是一个主模型参数量 125B 的多模态 MoE 模型,每 token 激活 6B 参数,额外配备 51B 的 N-gram Embedding。模型原生支持 262,144 tokens 上下文,可通过 YaRN 扩展至 1M tokens。模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本。
01架构创新支撑成本下降
Qwen3.8-Flash 在架构层面引入多项创新以支撑成本下降与能力提升。Attention 方面采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构,面对 1M token 超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。Residual 方面引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写,残差状态支持 FP8 存储。Embedding 方面引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量,这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。Optimization 方面采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化,针对新架构重新拟合了 Scaling Law。
关键数据
相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。

