返回热力追踪
关注AI产品

AWS为SageMaker HyperPod推出Curvine分层KV缓存,优化大模型推理成本

大语言模型规模化推理长期存在KV缓存的两难选择,要么使用大GPU增加成本,要么首token响应变慢。AWS官方博客推出基于Curvine的分层KV缓存方案,可将缓存扩展到共享分布式NVMe池。该方案能让副本以接近本地磁盘的速度复用缓存,适配低成本实例部署。

编辑视角

该技术针对大模型推理落地的核心痛点优化,可帮助企业在保证推理速度的同时降低部署成本,对LLM生产部署有直接参考价值,值得AI工程团队关注。

深度解读

主旨:AWS针对大模型规模化推理的KV缓存痛点,推出基于Amazon SageMaker HyperPod的Curvine分层缓存方案,将缓存拓展至共享分布式NVMe存储池,平衡推理速度与部署成本。证据:AWS官方博客发布技术方案,且SageMaker HyperPod已在2025年11月推出受管分层KV缓存功能,现有官方文档支持该能力。边界:本次博客仅介绍基于Curvine的NVMe分层缓存方案,未公开Curvine的开源地址,也未披露具体性能提升的量化数据,该能力目前仅在SageMaker HyperPod上可用,未支持其他部署环境。后续需观察该方案的开源进展、公开测试数据,以及第三方厂商的落地适配情况。

核心要点
  • 解决大模型推理KV缓存两难:速度与成本难以平衡的问题
  • 将KV缓存拓展至共享分布式NVMe存储池,降低GPU依赖
  • 副本可接近本地磁盘速度复用缓存,适配低成本实例
  • 该方案部署于Amazon SageMaker HyperPod,由AWS官方推出
延伸阅读
  • SageMaker HyperPod now supports Managed tiered KV cache and intelligent routing介绍SageMaker已推出的受管分层KV缓存功能,是基础能力
  • Amazon SageMaker HyperPod 现已支持分离式预填充与解码功能SageMaker另一项大模型推理优化功能,和KV缓存配合优化效果