资讯🔥7.0
国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑
📋总体概括
寒武纪宣布基于vLLM推理框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配,实现模型发布当天即可在寒武纪芯片上稳定运行。该模型为总参数552B的MoE架构,KV缓存压缩突破显著,HBM需求降至上一代1/4。寒武纪借助自研Torch-MLU-Ops算子库和NeuWare软件生态实现快速适配,并于9月8日加入PyTorch基金会成为白金成员,与NVIDIA、AMD等巨头同级。目前已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产大模型的推理适配。
⚡关键信息
- ▸寒武纪基于vLLM完成DeepSeek V4.1 Flash的Day 0适配,模型发布当天即可在其芯片上稳定运行
- ▸V4.1 Flash为552B总参数MoE模型,采用Causal-Encoder-Decoder新结构,输入侧激活仅8B参数
- ▸KV缓存压缩突破:HBM需求降至上一代1/4,SSD需求降至1/8,相对初代缩小437倍
- ▸寒武纪9月8日加入PyTorch基金会成为白金成员,与NVIDIA、Meta、AMD等同一级别并获管委会席位
- ▸已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配
🔥犀利点评
Day 0适配的噱头大于实质——发布当天能跑和跑得高效是两回事,跑分数据一个没给。但真正值得警惕的是另一件事:寒武纪挤进PyTorch基金会白金席位,这才是捅向CUDA护城河的刀子。国产芯片拼了多少年的从来不是算力而是软件生态,如今搭上PyTorch官方快车,加上国产大模型厂商集体配合适配,生态旁路正在成型。NVIDIA的护城河第一次在中国市场出现了结构性裂缝。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →