资讯
DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse
📋总体概括
DeepSeek AI发布DeepSeek-V4.1-Flash,这是一款面向长程Agent工作负载的多模态MoE模型:主干552B参数,另有196B Engram参数,支持1M token上下文窗口。针对百万级上下文与反复预填充带来的KV缓存压力,该模型采用FP4量化的KV缓存和跨层注意力复用两项优化,缓解HBM容量与带宽瓶颈,把输入重载型的推理服务成本进一步压低。
⚡关键信息
- ▸DeepSeek-V4.1-Flash为多模态MoE模型,主干552B参数,附带196B Engram参数
- ▸支持1M token上下文窗口,面向长程Agent推理场景
- ▸采用FP4 KV缓存压缩,降低对HBM容量与SSD带宽的占用
- ▸引入跨层注意力复用,缓解重复预填充带来的计算冗余
🔥犀利点评
方向选得准:Agent时代推理瓶颈确实从算力转向KV缓存的显存与带宽,DeepSeek直接在数据格式(FP4)和架构(跨层复用)两头下手,而不是堆卡。但注意,正文语焉不详,Engram参数是什么、FP4 KV缓存的精度损失有多大、实际吞吐提升多少,一概没给数字。发布→媒体转发→没人做复现,这是当前模型营销的标准流水线,数据要等实测说话。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →