返回热力追踪
关键AI产品芯片
原vLLM团队新创公司Inferact实现TPU跑Kimi速度超英伟达GPU 57%
由vLLM原班人马创立的推理创业公司Inferact,用megakernel推理内核配合DeepSeek的DSpark加速框架,在16块谷歌TPU v7上跑Kimi K3,每秒跑出709个Token,速度比英伟达GB200快57%。
编辑视角
该优化方案证明TPU在大模型推理上可以实现比高端英伟达GPU更优的性能,为大模型推理硬件选型提供了新方向,团队背景和融资情况也值得行业关注。
深度解读
本次公开的成果是原vLLM团队创立的Inferact公司,针对谷歌TPU架构开发了megakernel推理内核,将大量小调度程序合并为一个大程序,配合TPU片上内存架构,把内存带宽利用率推到接近硬件理论峰值,再结合DeepSeek的DSpark加速框架,在Kimi K3模型上实现了比英伟达GB200快57%的推理速度。该公司刚完成a16z领投的1.5亿美元种子轮融资,估值8亿美元。当前信息边界在于,仅公开了Kimi K3单模型的测试成绩,尚未公开完整测试对比数据、开源代码以及实际商用案例,性能提升是否具备通用性还需后续验证。没有证据显示该优化对所有大模型都有效,也未提及实际部署成本对比。后续需要关注代码开源情况、更多模型的测试结果以及商业化进展。
核心要点
- Inferact由vLLM原班人马创立,获1.5亿美元种子轮融资估值8亿
- Inferact开发megakernel内核配合DeepSeek框架优化TPU推理
- 16块TPU v7跑Kimi K3比英伟达GB200快57%达每秒709Token
- 优化逼近TPU内存带宽理论峰值,性能提升显著
- 成果已公开,相关代码即将开源
延伸阅读
- 月之暗面推出Kimi Code桌面客户端 — 涉及Kimi相关产品动态,与本事件相关