资讯

国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑

驱动之家·2026/9/10 07:33:00🔗 原文

📋总体概括

寒武纪宣布基于vLLM框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配,实现模型发布当天即可在寒武纪芯片上稳定运行。该模型为总参数552B的MoE架构,KV缓存较初代缩小437倍,HBM需求降至上一代1/4。寒武纪通过自研Torch-MLU-Ops算子库专项加速,并支持5D混合并行等优化。此前其刚于9月8日加入PyTorch基金会成为白金成员,目前已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配。

关键信息

  • 寒武纪实现DeepSeek V4.1 Flash发布当天的Day 0适配,基于vLLM推理框架即可稳定运行
  • V4.1 Flash为552B总参数MoE模型,KV缓存较初代缩小437倍,HBM需求降至上一代1/4、SSD需求降至1/8
  • 寒武纪用Torch-MLU-Ops算子库专项加速,并以BangC语言优化稀疏/压缩Attention等热点算子
  • 9月8日寒武纪加入PyTorch基金会成白金成员,与NVIDIA、AMD、微软等巨头同级并列
  • 寒武纪已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型推理适配

🔥犀利点评

Day 0适配确实是个里程碑式信号——说明寒武纪软件栈从「能跑」进化到「跟得上节奏」,而国产大模型百花齐放恰好给了国产芯片练兵场,这是英伟达没有的本土红利。但别急着庆功:Day 0跑通只是入门券,真正的考验是生产环境下的吞吐、稳定性和成本对比H100的硬数据,这些寒武纪一个都没给。KV缓存暴降437倍倒是个好消息,内存墙压力小了,国产芯片的短板被间接遮了一块。生态追赶在加速,性能账本还得再晒。

本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文