返回热力追踪
关注AI产品

NVIDIA推出机密计算方案 保障高负载LLM推理数据安全

针对大语言模型推理处理敏感信息和专有模型上下文的安全需求,NVIDIA推出机密计算方案,可在企业可控环境安全部署专有模型。该方案带来的性能开销极小,能维持接近原生的推理性能。

编辑视角

大模型推理对数据安全要求越来越高,该方案解决了安全与性能的平衡问题,帮助企业降低对按量计费API的依赖,对企业级大模型落地有重要参考价值。

深度解读

本文核心是NVIDIA推出面向生产级LLM推理的机密计算方案,提供了经实践验证的参考架构,可支持自托管虚拟机和Kubernetes两种部署环境,帮助企业在可控环境中安全部署专有模型,同时降低对按量计费API的依赖,提升高负载推理成本可预测性。实测显示启用该方案带来的吞吐和延迟开销通常低于8%,配合FlashInfer自动调优等优化,可维持接近原生的推理性能。

本次公开内容仅提及方案架构和性能数据,未披露新增硬件支持、新合作伙伴接入或商业化落地最新进展,该方案仅针对NVIDIA生态内的推理场景,对非NVIDIA硬件部署的LLM推理暂无直接支持。后续可关注该方案的落地案例和更多厂商适配进展。

核心要点
  • NVIDIA推出面向生产级LLM推理的机密计算方案
  • 提供自托管虚拟机和Kubernetes两种部署参考架构
  • 启用方案后性能开销通常低于8%,接近原生性能
  • 帮助企业降低按量API依赖,提升推理成本可预测性
  • 解决LLM推理中敏感数据和专有模型的安全问题
延伸阅读
  • Deploying Proprietary Models Securely with NVIDIA Confidential Computing on Self-Hosted Virtual Machines提供该方案在自托管虚拟机上的架构参考
  • Hardware-Rooted AI Security That Won’t Slow You Down补充该方案性能数据和优化细节