返回热力追踪
关注AI产品

DeepSeek推出内核补齐与通信重构优化方案,PCIe显卡推理吞吐翻近7倍

当前大模型算力成本高、高端GPU供给受限,主流开源框架对普通PCIe显卡适配不足,实际性能远低于硬件标称。DeepSeek通过内核补齐和通信重构优化,特别是DeepEP优化MoE模型的all-to-all通信,大幅提升PCIe显卡的推理吞吐性能。

编辑视角

该技术方案挖掘了存量PCIe显卡的算力潜力,降低AI推理硬件成本,给算力资源不足的开发者和企业提供了降本增效的可行路径。

深度解读

当前AI大模型推理领域面临高端GPU采购成本高、供给约束大的问题,而大量存量PCIe显卡因为开源框架适配不足,存在性能鸿沟,实际算力无法充分发挥。DeepSeek针对这一痛点,通过内核补齐解决算子低效问题,通过通信重构优化集合通信,结合DeepEP对MoE模型all-to-all通信的优化,实现了节点内和跨节点的通信效率提升,实测显示推理吞吐提升近7倍,甚至1.5台6000D的性能就可以超过1台B300。不过该优化效果是基于DeepSeek自身框架和特定测试场景得出,目前尚未看到第三方大规模验证结果,对于非DeepSeek框架部署的模型,该优化方案不一定能直接复用,且对于已经使用高端互联GPU的场景,提升幅度可能有限。后续需要观察社区对该优化方案的适配情况,以及更多第三方测试结果。

核心要点
  • 针对PCIe显卡适配不足问题,DeepSeek通过内核补齐和通信重构优化
  • 优化后DeepSeek推理吞吐性能提升接近7倍,1.5台6000D性能超1台B300
  • DeepEP优化MoE模型all-to-all通信,NVLink和RDMA双场景均获大幅提升
延伸阅读
  • DeepSeek 开源周第二天:DeepEP 亮相,MoE 模型效率革命来袭!-CSDN博客 — 详细介绍DeepEP的通信优化技术细节