资讯
DeepSeek V4.1 Flash正式发布:性能全面超越V4 Pro 成本更低
📋总体概括
深度求索9月10日发布全新架构系列中尺寸最小的DeepSeek V4.1 Flash,原生支持多模态视觉理解。模型采用552B参数MoE架构和新颖的Causal-Encoder-Decoder结构,输入输出侧不对称激活,输入侧仅激活8B参数、输出侧激活16B参数,在保持大参数规模的同时推理成本显著低于已知同尺寸模型。官方基准测试显示其多项成绩超越包括自家V4 Pro在内的旗舰模型,新架构还为后续扩展至更大参数规模模型奠定基础。
⚡关键信息
- ▸DeepSeek V4.1 Flash为全新结构系列最小尺寸模型,原生支持多模态视觉理解
- ▸采用552B参数MoE架构,引入全新Causal-Encoder-Decoder结构
- ▸输入输出不对称设计:输入侧激活8B参数,输出侧激活16B参数
- ▸官方基准测试显示其超越DeepSeek V4 Pro等旗舰模型,且推理成本更低
- ▸新架构目标为更快推理、更高吞吐,并为更大参数规模模型扩展打基础
🔥犀利点评
小尺寸模型干翻自家旗舰,本质上是架构红利而非参数堆砌——不对称激活设计把推理成本压到同尺寸模型之下,这才是能落地的竞争力。但「全面超越」的说法需警惕官方基准的自证倾向,真实场景表现仍待第三方验证。真正值得盯的是新结构能否顺畅扩展到更大规模,那才是深度求索挑战第一梯队的底气所在。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →