8月26日,阿里通义千问团队宣布推出Qwen3.8-Flash,同时发布了Qwen3.8-Flash-Next的开源权重,标志着全新一代Qwen4系列模型的雏形。Qwen3.8-Flash是一个多模态MoE模型,主模型参数量达到125B,配合51B的N-gram Embedding和每token激活6B参数,原生支持262,144tokens上下文,并可通过YaRN扩展至1Mtokens。
Qwen3.8-Flash在四个方向进行了系统升级:Attention方面,采用GDN+QSA混合架构,显著降低长序列Attention开销;Residual方面,引入GatedResidual机制,残差状态支持FP8存储,降低访存开销;Embedding方面,引入51B参数的N-gram Embedding,扩展模型容量;Optimization方面,采用MuonOptimizer,并针对多项策略进行优化。性能与成本相比Qwen3.7-Plus,Qwen3.8-Flash的训练成本大幅降低,但在编码和办公任务上表现更强。
Qwen3.8-Flash即将上线千问AI平台,提供API服务,定价为每百万Tokens输入1元、输出3元。模型权重已于8月26日23:00在HuggingFace与ModelScope平台开源,并发布FP8量化版本。Qwen3.8-Flash-Next默认支持1M上下文并内置官方工具。


