资讯
DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了
📋总体概括
DeepSeek发布V4.1 Flash,跑分重回国产第一。该模型为552B参数MoE架构,首次采用非对称Causal-Encoder-Decoder新结构,输入激活仅8B、输出激活16B,成本显著低于同尺寸模型。这是完全重新训练的版本:新预训练数据、更大规模强化学习后训练,并与DeepSeek Harness v0.1.5深度结合。Flash在多数评测中打败自家Pro,还首次把视觉多模态能力统一进正式版模型。9月14日起V4 Pro请求将全部重路由至Flash,V4.1 Pro上线前API仅提供此一款模型。
⚡关键信息
- ▸V4.1 Flash为552B参数MoE模型,采用全新非对称Causal-Encoder-Decoder架构,输入激活8B、输出激活16B
- ▸跑分重回国产第一,且Flash在多数测试中战胜自家Pro,仅知识容量例外
- ▸完全重新训练:新预训练数据、更大规模强化学习,与Harness v0.1.5深度结合
- ▸首次原生支持多模态视觉理解,取代此前的V4 Flash Vision Exp实验版
- ▸9月14日起V4 Pro请求全部重路由至Flash,V4.1 Pro上线前API仅此一个模型
🔥犀利点评
非对称激活架构才是这次的真看点:输入8B、输出16B的拆分直指推理成本痛点,跑分第一只是副产品。更狠的是用便宜模型直接顶替Pro的API流量——在V4.1 Pro上线前,DeepSeek等于把整条产品线收缩到一个模型上,这是拿Flash当主力硬扛成本与体验的双线压力。国产一哥的位子靠跑分守不住,真正的护城河是这种架构层面的降本能力。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →