今日上午,DeepSeek-V4 终于正式登场,而第一时间,寒武纪便给予 vLLM 推理框架,完成了对 285B DeepSeek-V4-flash 和 1.6T DeepSeek-V4-pro 两个版本的 Day0 适配,适配代码已开源到 GitHub 社区。

这并非一日之功。背后是寒武纪长期积累的自研 NeuWare 软件生态与芯片设计能力,也是公司持续推动“芯片+算法”联合创新的又一次落地。
此前,寒武纪已对 DeepSeek 系列模型进行了深入的软硬件协同性能优化,在算力利用率上达到业界领先水平。本次围绕 DeepSeek-V4 的适配工作,主要从“快速模型迁移”和“极致性能优化”两个维度展开。
快速迁移,实现Day 0首发
在软件生态层面,寒武纪 NeuWare 全面拥抱开源社区,原生支持 PyTorch、vLLM、Diffusers 等主流 AI 框架,新模型可快速迁移至寒武纪平台。
同时,公司与众智FlagOS生态持续深度合作,解耦模型与不同芯片架构之间的生态壁垒,进一步降低适配成本。
算子开发方面,寒武纪借助Triton良好的兼容性与易用性进行快速算子开发,缩短功能适配周期。此外,团队自研了代码生成智能体CNAgent,实现了算子生成与模型迁移的全流程加速。
硬件层面,寒武纪芯片原生支持主流低精度数据格式,无需额外转换即可完成功能适配与精度验证。软硬件协同之下,模型在发布当日即实现稳定运行,真正做到Day 0适配。

性能优化,释放推理潜能
针对DeepSeek-V4的新结构,寒武纪通过自研高性能融合算子库Torch-MLU-Ops,对Compressor、mHC等模块进行专项加速;并利用BangC高性能编程语言,编写稀疏/压缩Attention、GroupGemm等热点算子的极致优化Kernel,充分释放底层硬件性能。
在推理框架层面,寒武纪在vLLM中全面支持TP/PP/SP/DP/EP 5D混合并行、通信计算并行、低精度量化以及PD分离部署等优化技术。通过策略优化,在满足延时约束的同时达到最佳词元吞吐量,显著提升端到端推理效率。
硬件特性也被深度挖掘:利用MLU的访存与排序加速能力,有效加速稀疏Attention、Indexer等模块;借助高互联带宽与低通信延迟,将Prefill和Decode两种负载场景下的通信占比降至最低,最大化分布式推理利用率。
正是这种软硬件一体化的设计思路,让寒武纪能够在大模型部署中持续降低算力成本、提升性能上限。未来,寒武纪将继续深耕大模型软硬件协同生态,为开发者与客户提供更快、更省、更高效的大模型部署方案。
SANC盛色27英寸2K240Hz 1152分区MiniLED电竞显示器 QD量子点广色域 HDR1000nit高亮 电脑屏幕S73mPro
联想笔记本电脑小新Pro16GT超能本 酷睿Ultra5 32G 1T 2.8K 120Hz OLED 大屏轻薄办公本 国家补贴
绿联USB/Type-C3.2高速读卡器 SD/TF3.0双卡适用电脑平板手机大疆pocket4/3无人机苹果17运动相机
Apple/苹果 iPhone 17 256GB 薰衣草紫色 支持移动联通电信5G 双卡双待手机
Looki L1 AI 生活主理人 Looki PIE ai智能设备 漫画自动生成 十字路口播客罗永浩同款 lookil1黑
¥1489
¥1489
北通鲲鹏70精英无线游戏手柄AI智控自适应双切扳机摇杆 xbox电脑PC蓝牙NS体感steam电视switch2地平线6
南卡【新品上市】(NANK)Clip Super2耳夹式蓝牙耳机AI翻译耳机开放式运动骑行无线不入耳通话降噪 暮霭黑
体重秤米家APP体脂秤电子秤称体重秤减肥专用智能精准体重宿舍家用减肥专用智联精准电子秤体重秤 【爆款】米家APP体脂秤 充电 特厚钢化玻璃
皓丽65英寸会议平板一体机会议平板触摸屏一体机多媒体教学一体机会议显示电子白板会议标准版E65套装
¥4759
¥4759
网友评论