Qwen4还没出,架构先开源了。

阿里发布Qwen3.8-Flash-Next的全部权重, 同时也是Qwen4新架构的早期预览版。

这个新架构它确实够新。

除了常规的125B参数MoE模型配6B激活参数,关键是还附加了51B的N-gram Embedding参数。

这是个啥呢?

发布公告明确写着,受DeepSeek的Engram启发,进一步扩展了这种设计。

它的主要优势在于,它可以添加大量参数,而每个token几乎不需要额外的计算。

Qwen3.8-Flash-Next 大幅降低了训练和推理成本,训练时间仅为原来的九分之一,却在代码和办公任务方面表现出色。

Qwen3.8-Flash-Next的跑分可以总结在小模型里超过DeepSeek V4 Flash正式版,向上多项测试可以挑战Claude-Opus-4.6(Max)。

模型权重公开后,也确实有人在24GB显存的4090+128G内存上成功部署,而且不用量化。

虽然之前发布的密集模型Qwen3.8-27B在消费硬件上体验更好。

但这一次,Qwen3.8-Flash-Next证明了在消费级硬件上跑满血版MOE模型也是完全可行的。

01、DeepSeek Engram更复杂,Qwen更精简

传统Transformer只有一个词嵌入层,每个token对应一个向量。

而Qwen的N-gram Embedding和DeepSeek的Engram都是利用当前token及其前面若干token组成的局部上下文作为key,通过确定性的哈希函数在一张巨大的嵌入表中查到对应的向量,时间复杂度为O(1)。

DeepSeek的Engram论文首次将这一思路形式化为“条件记忆”(conditional memory),并将其定位为与MoE的“条件计算”(conditional computation)平行的第二种稀疏方式。

Engram论文通过Sparsity Allocation实验发现了一条U形缩放定律:在总参数和FLOPs固定的前提下,把大约20%–25%的稀疏参数预算从MoE专家重新分配给Engram嵌入表,能获得比纯MoE更低的验证损失。这一分配比例在5.7B和9.9B两个规模上保持稳定,最 优点均落在75%–80%分配给MoE的区间。

Qwen3.8-Flash-Next在技术报告中直接引用了Engram论文和Gemma 3n的Per-Layer Embedding作为灵感来源,并在最终模型中配置了51B的N-gram嵌入参数,附加在125B主模型之上。

Engram的设计有四个关键组件。

第 一是Tokenizer Compression,通过NFKC归一化和小写映射把128k词表压缩23%,消除”Apple”和”apple”这类语义等价但ID不同的冗余。

第二是Multi-Head Hashing,对每个N-gram阶数使用K个独立哈希头映射到素数大小的嵌入表中以缓解冲突,最终把所有检索到的向量拼接成一个记忆向量。

第三是Context-aware Gating,用当前层的隐藏状态作为Query、检索到的记忆作为Key和Value,通过RMSNorm归一化后的缩放点积计算出一个标量门控值,决定是否采纳这条记忆——如果记忆与当前上下文矛盾,门控趋近于零自动抑制噪声。

第四是一个核大小为4、膨胀率等于最 大N-gram阶数的深度可分离因果卷积,用于扩展感受野并增加非线性。此外,Engram还专门设计了与多分支架构的集成方案:多个分支共享一张嵌入表和一个Value投影矩阵,但各自拥有独立的Key投影以实现分支级别的差异化门控。

Qwen3.8-Flash-Next的N-gram Embedding在公开博客中没有披露同等细节深度的设计说明,但从已公布信息可以看出几点差异。

Qwen最终只使用了一个N-gram Embedding层,而Engram在27B模型中部署于第2层和第15层两个位置。

DeepSeek的Engram论文在严格的等参数、等FLOPs条件下完成了对照实验。在26.7B总参数规模上,Engram-27B相比纯MoE-27B基线在知识任务上提升了MMLU +3.0、CMMLU +4.0,在推理任务上提升了BBH +5.0、ARC-Challenge +3.7,在代码数学上提升了HumanEval +3.0、MATH +2.4。

Engram论文还通过LogitLens和CKA分析揭示了增益来源:Engram让模型的第5层表示在功能上等价于纯MoE基线的第12层,相当于在不增加实际层数的情况下增加了网络的有效深度。

Qwen的51B嵌入参数远超Engram论文中验证过的最 大规模(Engram-40B的嵌入参数为18.5B),这意味着Qwen在实践中把Engram论文中观察到的“嵌入槽数量与验证损失呈对数线性关系”这一结论推到了更大的尺度。

不过由于Qwen3.8-Flash-Next同时引入了QSA稀疏注意力、Gated Residual和Muon优化器等多项改动,N-gram Embedding的单独贡献无法从最终结果中精确隔离。

02、四项架构升级,从注意力到优化器全换了

除了嵌入层外,Qwen3.8-Flash-Next还在注意力、残差、和优化三个维度上做了系统性升级。

注意力层面,模型延续了Qwen3-Next以来“GDN+注意力”的混合设计。

48层网络中,每4层有3层使用门控DeltaNet将历史信息压缩进固定大小的状态,剩余1层负责全局精确检索。

但这次全局注意力从之前的Gated Attention升级为全新的Qwen Sparse Attention(QSA)。

QSA的做法是先用一个轻量索引器把序列聚合成”微块”,在块级别估计上下文重要性,再只对最相关的区域做注意力计算。这不仅降低了注意力本身的开销,连索引过程的计算量也一并压了下去。

在100万token的长上下文场景下,QSA的注意力内核在预填充和解码阶段分别实现了7.6倍和4.9倍的加速。在90%前缀缓存命中率的在线服务场景中,Qwen3.8-Flash-Next在100万token上下文长度下的预填充吞吐量达到了Qwen3.7-Plus的8.6倍。

残差连接方面,引入了Gated Residual(GR),把传统Transformer的单条残差流扩展为4条并行分支,通过动态门控机制控制每一层对各分支的读写。这样做的效果是加强了跨层信息流动和训练稳定性,同时残差状态还支持FP8存储以降低显存带宽开销。

优化器方面,用Muon替代AdamW作为主优化器,并围绕正交化精度、Muon与AdamW的分工以及融合参数的拆分做了改进。

Qwen还公布了一个新发现:大规模训练中常见的Batch Size Warmup在新架构上不再必要,直接用目标Batch Size开训的效果一样,反而省掉了18.8%的优化器步数。

03、百万token上下文,每百万输入token定价0.16美元

Qwen3.8-Flash-Next原生支持262144 token上下文,通过YaRN可扩展至100万token。模型权重已在HuggingFace和ModelScope开放下载。

在QwenCloud上,这个模型以”qwen3.8-flash”提供API服务,也是加入了100万上下文默认支持和官方内置工具的版本,输入定价为每百万token 0.16美元,输出为每百万token 0.47美元。

作为参照,同门旗舰Qwen3.8-Max的输入和输出定价分别是2.00和6.00美元,Flash-Next的成本约为旗舰的十二分之一。

部署生态方面,通义千问这次直接兼容了Anthropic和OpenAI两套API协议,可以直接插入Claude Code、OpenAI Codex等主流编程助手使用。

团队还同步推出了Qoder CLI和Qwen Code两个自研编程工具,以及与OpenClaw的集成。

阿里AI办公平台QwenWork也已将Qwen3.8-Flash-Next集成为其”Standard”模式的底层模型。

至于未来的Qwen4本体,只能说,还会更强。

最新快讯

2026年08月27日

16:02
鼓狮财经8月27日电,乌克兰总统泽连斯基27日表示,俄军当天对乌克兰多个地区发动无人机和弹道导弹联合袭击,目前袭击后续处置工作仍在进行。泽连斯基称,俄军袭击了波尔塔瓦州、苏梅州和赫尔松州的关键基础设施,并袭击哈尔科夫州住宅设施。在克拉马托尔斯克,一栋多层住宅楼遭制导航空炸弹袭击,乌克兰国家紧急情况局救援人员成功救出4人。此外,扎波罗热有3人受伤,克里维里赫有...
16:02
鼓狮财经8月27日电,银邦股份(300337.SZ)公告称,公司发布2026年半年度报告,实现营业收入42.7亿元,同比增长49.1%;归属于上市公司股东的净利润8853.8万元,同比增长95.08%。业绩增长主要系销售量增加导致销售额增加。公司计划不派发现金红利,不送红股,不以公积金转增股本。小财注:公司Q2净利润0.34亿,Q1净利润0.55亿,据此计算...
16:02
鼓狮财经8月27日电,惠普公司盘前跌超8%,公司预计第四财季调整后每股收益为69美分至79美分,此前预计为67美分。
16:02
鼓狮财经8月27日电,摩根大通欧洲投资级融资主管Matthias Reschke表示,AI巨头大规模发债正在考验债券市场的承受力,债券发行价格将成为衡量投资者需求的重要指标。Reschke表示,超大规模科技公司发行的债券在美国市场的交易利差较其他企业债高出约55个基点,存在“明显溢价”。他称,市场并不担心这些债券无法发行,关键在于投资者愿意接受什么样的价格。
16:01
鼓狮财经8月27日讯美国银行再次坚定看好存储超级周期,并维持对韩国存储芯片巨头SK海力士的买入评级,目标价为250美元。 美国银行分析师Simon Woo团队指出,存储芯片的降规配置主要出现在电脑、智能手机和低端GPU及ASIC中,但引发降配的根本原因是存储芯片不足,而不是需求下降。 而在包括下一代GPU的高端领域中,制造商将继续采用高内存容量的配置,避免降...
16:01
核心观点核心观点:2026年6月末至今,黄金、原油与铜共振走强,三者共同受益于地缘风险溢价抬升与海外流动性的阶段顺风期,亦折射出全球供应链脆弱性与美元信用的削弱。①国际金价8月下旬触及4700美元/盎司,联储加息预期收敛叠加美日联合干预汇率,美元强势基础阶段转弱;美国财政可持续性担忧+美联储独立性的削弱为核心催化;中国央行增持黄金至外储占比9%,去美元化逻辑...
16:01
2026年上半年,中国新能源汽车行业进入一轮深幅调整期。乘联会数据显示,2026年第二季度,中国新能源汽车市场整体承压,销量同比下降14%。与此同时,碳酸锂、车规级芯片等核心原材料价格持续走高,单车制造成本较上年同期增加约1.5万至2万元。需求收缩与成本上行形成双向挤压,行业整体承压显著。就在这样的背景下,理想汽车却主动按下了“暂停键”:停产增程主力车型,完...
16:01
8月27日,A股主要指数集体上涨,沪指涨1.13%,深证成指涨1.5%,创业板指涨1.71%,北证50涨0.65%,科创50涨3.77%。三市成交额21409亿元,全市场近3400家个股上涨。盘面上,英伟达强劲业绩验证AI基础设施投资逻辑,算力硬件板块集体爆发,半导体、CPO、PCB方向领涨,大普微、德明利等涨停;粮食概念股再度活跃,万向德农3连板;贵金属、...
16:01
8月26日,微软联合创始人比尔·盖茨在个人网站“盖茨笔记”上发表近六千字长文,题为《动荡的AI时代已经到来,我们现在做出的选择至关重要》。这位曾亲手推动个人电脑革命的科技先驱,一改往日对技术进步的乐观语调,发出了关于人工智能的深刻忧虑。就在2023年,他还在《AI时代已经开启》中把AI比作汽车和互联网,认为风险虽真实但可控。而今天,他的标题里多了“动荡”二字...
16:01
17个月,三次签约。这个节奏放在汽车行业并不寻常。一款新车从开发到量产通常以年计算,两家体系不同的车企要建立信任,往往更慢。协议签得快,究竟意味着合作深入,还是清单越列越长,最终要看有没有产品接得住。8月24日,答案有了新的进展。在长春,零跑汽车创始人、董事长兼CEO朱江明与中国一汽总经理、党委副书记刘亦功共同出席《深化战略合作协议》签约。双方把合作范围扩展...
15:27
8月27日,半导体板块表现活跃,截至10:05,中证半导体材料设备主题指数上涨1.2%,上证科创板芯片指数上涨2.3%,半导体设备ETF易方达(159558)盘中成交额超4亿元。消息面上,英伟达二季度财报全面超预期,单季营收962亿美元,同比增长106%;数据中心收入890亿美元,同比增长117%;净利润超539亿美元,同比增长118%,超一致预期约6%。公...