阿里通义千问多模态MoE大模型,125B主模型+51B N-gram,激活仅6B,训练成本仅前代1/9

流云 2026-08-28 856 0条评论
摘要:    2026年8月26日,阿里通义千问团队正式推出Qwen3.8-Flash——一款多模态MoE大模型。主模型125B叠加51B N-gram Embeddi...

   2026年8月26日,阿里通义千问团队正式推出Qwen3.8-Flash——一款多模态MoE大模型。主模型125B叠加51B N-gram Embedding,每token仅激活6B,原生支持262K上下文,可YaRN扩展至1M。同步上线的还有「千问办公」入口,以及作为Qwen4架构雏形提前开源的Qwen3.8-Flash-Next。API定价每百万tokens输入0.8元、输出2.7元、缓存命中0.1元,训练成本约为Qwen3.7-Plus的1/9——用更少的激活参数、更低的成本,在编码、办公和多模态基准上全面超越竞品。

一、技术架构:GDN+QSA混合注意力与四大组件

Qwen3.8-Flash延续了Qwen3.5的混合架构设计:每4层中3层使用Gated DeltaNet压缩历史,1层保留全局Attention做精准检索。全局Attention层引入了Qwen Sparse Attention,将序列聚合成micro-block后选出最相关区域执行Attention,显著降低长序列开销。在1M上下文下,QSA的Prefill与Decode分别最高加速7.6倍与4.9倍;当90% Prefix Cache命中时,1M Prefill吞吐达到Qwen3.7-Plus的8.6倍。

除了注意力机制的优化,Qwen3.8-Flash还引入了三项关键设计:Gated Residual将Residual Stream扩展为4条并行分支并以动态Gate逐元素控制读写,支持FP8存储以压低访存;N-gram Embedding结合局部上下文查表为常见短语提供额外表示,51B参数可卸载到Host Memory并与计算重叠;优化方面以Muon Optimizer为主优化器,重新拟合Scaling Law后可稳定使用更大的Learning Rate与Batch Size。四者叠加,使模型在保持6B激活参数的前提下,实现了远超同激活参数模型的基准表现。

二、性能数据:6B激活参数,全面领先竞品

在官方发布的评测数据中,Qwen3.8-Flash以6B激活参数,在编码、办公与多模态基准上全面领先DeepSeek-V4-Flash和Claude Opus 4.6:

基准测试Qwen3.8-FlashDeepSeek-V4-FlashClaude Opus 4.6
Agentic Coding58.754.4
SWE-bench Pro62.556.053.4
长程办公73.945.168.2
专业工作55.741.336.6
科学推理91.790.891.3
竞技编程91.990.688.8
指令遵循81.379.262.5
移动操控84.562.0
长视频理解76.663.0

长程办公CoWorkBench领先DeepSeek-V4-Flash达28.8分,专业工作JobBench领先Claude Opus 4.6达19.1分,而训练成本仅约Qwen3.7-Plus的1/9。与此同时,提前开源的Qwen3.8-Flash-Next-Base在14项benchmark中拿下8项最优,作为Qwen4系列的架构雏形,已经在社区检验中展现出下一代架构的潜力。

三、应用场景与适用人群

  • 编码与办公任务:与「千问办公」深度集成,适合作为白领生产力工具底座

  • 长上下文检索与摘要:1M上下文+QSA长序列加速,适合文档/代码库检索与总结

  • 高并发API经济模型:API定价低、训练成本低,适合大规模在线推理

适用人群:需要在效率与成本间平衡的API产品经理、长上下文架构师、多模态应用开发者,以及关注Qwen4演进的开源社区研究者。在AI工具导航的框架下,Qwen3.8-Flash不仅是一个模型,更是一整套效率工具链的底座——它与千问办公的同步首发意味着用户可以直接在办公场景中调用其多模态能力;而极低的API定价和1/9的训练成本,则让它在AI办公软件推荐的选型逻辑中占据了明确的“成本优先”位置——对于需要大规模推理部署的团队来说,这个定价意味着运营成本的可控性被大幅提升。

四、如何使用与开源情况

Qwen3.8-Flash已在千问AI平台上线API,并同步首发千问办公;权重在HuggingFace与ModelScope发布。用户可通过Python SDK、HTTP或OpenAI兼容接口调用,也可下载Qwen3.8-Flash-Next开源权重在本地推理或微调。API价格每百万tokens输入0.8元、输出2.7元,缓存命中0.1元,是主流多模态MoE模型中性价比突出的档位。Qwen3.8-Flash-Next作为Qwen4架构雏形被提前释出,让社区在正式版发布前即可对下一代架构进行验证和适配。

文章版权及转载声明:

作者:流云本文地址:https://www.sanwenge.com/post/1380.html发布于 2026-08-28
文章转载或复制请以超链接形式并注明出处三文阁