返回热力追踪
关注AI产品
NVIDIA推出机密计算方案 保障高负载LLM推理数据安全
针对大语言模型推理处理敏感信息和专有模型上下文的安全需求,NVIDIA推出机密计算方案,可在企业可控环境安全部署专有模型。该方案带来的性能开销极小,能维持接近原生的推理性能。
编辑视角
大模型推理对数据安全要求越来越高,该方案解决了安全与性能的平衡问题,帮助企业降低对按量计费API的依赖,对企业级大模型落地有重要参考价值。
深度解读
本文核心是NVIDIA推出面向生产级LLM推理的机密计算方案,提供了经实践验证的参考架构,可支持自托管虚拟机和Kubernetes两种部署环境,帮助企业在可控环境中安全部署专有模型,同时降低对按量计费API的依赖,提升高负载推理成本可预测性。实测显示启用该方案带来的吞吐和延迟开销通常低于8%,配合FlashInfer自动调优等优化,可维持接近原生的推理性能。
本次公开内容仅提及方案架构和性能数据,未披露新增硬件支持、新合作伙伴接入或商业化落地最新进展,该方案仅针对NVIDIA生态内的推理场景,对非NVIDIA硬件部署的LLM推理暂无直接支持。后续可关注该方案的落地案例和更多厂商适配进展。
核心要点
- NVIDIA推出面向生产级LLM推理的机密计算方案
- 提供自托管虚拟机和Kubernetes两种部署参考架构
- 启用方案后性能开销通常低于8%,接近原生性能
- 帮助企业降低按量API依赖,提升推理成本可预测性
- 解决LLM推理中敏感数据和专有模型的安全问题
延伸阅读
- Deploying Proprietary Models Securely with NVIDIA Confidential Computing on Self-Hosted Virtual Machines — 提供该方案在自托管虚拟机上的架构参考
- Hardware-Rooted AI Security That Won’t Slow You Down — 补充该方案性能数据和优化细节