资讯

DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了

华尔街见闻·2026/9/10 10:49:16🔗 原文

📋总体概括

DeepSeek发布V4.1 Flash,跑分重回国产第一。该模型为552B参数MoE架构,首次采用非对称Causal-Encoder-Decoder新结构,输入激活仅8B、输出激活16B,成本显著低于同尺寸模型。这是完全重新训练的版本:新预训练数据、更大规模强化学习后训练,并与DeepSeek Harness v0.1.5深度结合。Flash在多数评测中打败自家Pro,还首次把视觉多模态能力统一进正式版模型。9月14日起V4 Pro请求将全部重路由至Flash,V4.1 Pro上线前API仅提供此一款模型。

关键信息

  • V4.1 Flash为552B参数MoE模型,采用全新非对称Causal-Encoder-Decoder架构,输入激活8B、输出激活16B
  • 跑分重回国产第一,且Flash在多数测试中战胜自家Pro,仅知识容量例外
  • 完全重新训练:新预训练数据、更大规模强化学习,与Harness v0.1.5深度结合
  • 首次原生支持多模态视觉理解,取代此前的V4 Flash Vision Exp实验版
  • 9月14日起V4 Pro请求全部重路由至Flash,V4.1 Pro上线前API仅此一个模型

🔥犀利点评

非对称激活架构才是这次的真看点:输入8B、输出16B的拆分直指推理成本痛点,跑分第一只是副产品。更狠的是用便宜模型直接顶替Pro的API流量——在V4.1 Pro上线前,DeepSeek等于把整条产品线收缩到一个模型上,这是拿Flash当主力硬扛成本与体验的双线压力。国产一哥的位子靠跑分守不住,真正的护城河是这种架构层面的降本能力。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文