本土快讯2026.08.26

阿里通义千问开源 Qwen3.8-Flash:训练成本降至前代 1/9,支持 1M 上下文

阿里通义千问团队发布并开源 Qwen3.8-Flash 125B 参数 MoE 模型,训练成本降至前代的九分之一,原生支持 262K 上下文并可通过 YaRN 扩展至 1M,API 定价为每百万 Tokens 输入 1 元、输出 3 元。

数智朋克
发布者数智朋克
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

阿里通义千问开源 Qwen3.8-Flash,训练成本降至前代九分之一。

02

模型原生支持 26 万 tokens 上下文,可通过 YaRN 扩展至 1M。

03

API 定价为每百万 Tokens 输入 1 元、输出 3 元。

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 阿里通义千问团队发布并开源 Qwen3.8-Flash 及 Qwen3.8-Flash-Next 模型权重。这是一个主模型参数量 125B 的多模态 MoE 模型,每 token 激活 6B 参数,额外配备 51B 的 N-gram Embedding。模型原生支持 262,144 tokens 上下文,可通过 YaRN 扩展至 1M tokens。模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本。

01架构创新支撑成本下降

Qwen3.8-Flash 在架构层面引入多项创新以支撑成本下降与能力提升。Attention 方面采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构,面对 1M token 超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。Residual 方面引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写,残差状态支持 FP8 存储。Embedding 方面引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量,这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。Optimization 方面采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化,针对新架构重新拟合了 Scaling Law。

关键数据

1/9训练成本相比 Qwen3.7-Plus
7.6×Prefill 加速1M 上下文场景
4.9×Decode 加速1M 上下文场景

相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签