阿里近日正式推出并开源了新一代大语言模型Qwen3.8-Flash,这款采用多模态混合专家(MoE)架构的模型凭借其创新技术,在模型效率与成本控制方面树立了全球新标杆。该模型通过激活1250亿参数中的60亿(6B),实现了超越Claude Opus4.6的性能表现,同时在训练成本上较前代Qwen3.7-Plus降低近90%,推理成本更是低至每百万Tokens输入1元、输出3元,成为当前性价比最优的模型之一。
Qwen3.8-Flash的核心优势源于其架构革新。模型引入了自研的QSA(Qwen Sparse Attention)注意力机制,与GDN高效融合后形成混合注意力架构,使长上下文处理速度提升8倍以上;通过Gated Residual方法将信息主通道扩展为4条,实现动态信息读写,训练稳定性显著提高;51B规模的N-gram Embedding参数则作为“外挂记忆手册”,在不增加计算负担的前提下提升参数扩展效率。这些技术突破使模型在通用能力、数学推理、编程任务等基础评测中,超越了参数规模3倍于己的Qwen3.7-Plus。
在专业场景测试中,Qwen3.8-Flash展现出全面领先性。智能体编程评测SWE-bench Pro中,其得分较Opus4.6高出9.1分;长程任务CoWorkBench与工具调用Toolathlon Verified评测均超越DeepSeek-V4-Flash;办公任务JobBench评测中更以近20分的优势领先Opus4.6。多模态能力方面,模型在移动端操作AndroidWorld、视觉数学推理MathVision、具身智能ERQA等任务中,分别取得22.5分、25.1分和31.5分的显著优势,整体多模态表现远超同类模型。
成本优化是Qwen3.8-Flash的另一大亮点。该模型仅用前代九分之一的资源完成训练,推理成本仅为Claude Opus4.6的3%,闲时价格是DeepSeek-V4-Flash的2/3、忙时价格的1/3。目前,千问办公“标准模式”已内置该模型,可完成95%的日常办公任务,开发者与企业可通过千问AI平台获取API服务。阿里同步开源了Qwen3.8-Flash-Next模型权重,在Hugging Face与魔搭社区全面开放,为全球开发者参与Qwen4模型研发提供基础。
随着Qwen3.8系列发布,阿里已开源2.4T参数量的Qwen3.8-Max、27B及Flash三大尺寸模型。截至目前,Qwen系列全球下载量突破30亿次,衍生模型超30万个,其全尺寸、全模态的开源策略正推动中国AI模型在全球范围内形成技术影响力。


