
过去三年,整个AI行业的注意力几乎都集中在GPU的性能竞赛上:从H100到GB200再到Rubin架构,每一代硬件的发布都围绕着更高的浮点算力、更大的显存、更快的模型训练速度展开。但很少有人注意到,当智能体应用开始规模化落地,哦不,当智能体应用开始规模化商用,AI算力的瓶颈已经悄悄从负责模型推理的GPU,转移到了负责整个循环调度与执行的CPU。
一个典型的智能体推理循环是这样的:GPU生成下一步行动指令,比如编写一段代码、调用一个检索工具、执行一次数据清洗,接下来所有的编译、沙箱运行、结果验证、数据流转工作,都需要CPU完成,之后再把结果喂回GPU进行下一步推理。只要CPU的执行速度慢一拍,整个GPU集群就要处于闲置等待状态——对于每小时闲置成本高达数万元的高端AI集群来说,这种等待造成的损失,远超过CPU本身的采购成本。
NVIDIA在2026年7月推出的Vera CPU,正是瞄准了这个此前被整个行业忽略的瓶颈。这款专门为AI工厂智能体工作负载设计的处理器,没有走传统通用CPU的路线,而是针对智能体循环的特定环节做了深度优化,目标就是通过提升控制平面的效率,让整个AI工厂的吞吐量最大化,目前已经和戴尔合作推出相关AI平台[1]。
传统CPU为什么撑不起智能体时代的负载
传统x86服务器CPU的架构设计,从诞生之初就面向通用工作负载:数据库查询、Web服务响应、虚拟化调度、企业应用运行,这些场景要求CPU兼顾多任务并发、通用指令集兼容性、不同负载的均衡表现。但智能体工作负载对CPU的要求,几乎完全跳出了这个设计框架。
智能体的核心运行逻辑是大量并行的短周期循环:每个智能体独立执行任务,每一步都要完成代码解释、工具调用、沙箱隔离、结果校验的完整流程,同时还要支撑数千甚至数万个并发沙箱的稳定运行,避免长尾延迟拖慢整个批次的GPU任务[2]。这类工作负载有三个极其特殊的要求:一是足够强的单线程性能,尽可能缩短单个任务的执行时间,避免GPU等待;二是极高的每核心内存带宽,支撑大量代码、数据的快速流转;三是稳定的低延迟,不能出现跨核心调度的性能波动。
而当前主流的x86服务器CPU,为了堆核心数普遍采用多小芯片(Chiplet)设计,不同核心之间、核心与内存之间的访问延迟差异极大,很容易出现长尾延迟;同时搭配的DDR5内存带宽已经跟不上智能体工作负载的数据吞吐需求,每核心带宽不足直接限制了并发任务的执行效率;更重要的是,x86的核心设计并没有针对代码编译、解释器运行、ETL、图计算这些智能体核心工作负载做定向优化,最终导致整个智能体循环的效率被CPU拖垮。有测试显示,传统CPU的执行速度过慢,会导致强化学习每个周期内的有效评估次数减少85%,不仅延长训练时间,还可能引发KV缓存丢失,推高整体算力成本,形成恶性循环[8]。
Vera的设计:从根源匹配智能体的需求
Vera的设计思路从一开始就放弃了通用CPU的均衡路线,所有架构决策都围绕智能体工作负载的三个核心要求展开。
首先是核心层面的定制化:Vera搭载了NVIDIA完全自研的Olympus数据中心CPU核心,基于Armv9.2-A指令集打造,专门针对控制流密集、内存密集的工作负载做了指令集和流水线优化,单核心吞吐量是上一代Grace CPU核心的两倍,且在相同芯片尺寸下实现了性能翻倍[5]。针对智能体循环的高并发需求,Olympus核心还支持NVIDIA空间多线程(SMT)技术,单个CPU最高配备88个核心,可支撑大量沙箱环境的并行运行[4]。
其次是架构层面的延迟优化:和主流x86 CPU普遍采用的多小芯片设计不同,Vera采用了单片计算芯片的架构,所有核心、缓存都集成在同一块计算芯片上,搭配第二代NVIDIA可扩展一致性结构(SCF),每个核心到其他核心、缓存、内存、IO资源的访问距离完全一致,从根源上避免了跨小芯片的通信延迟和性能波动[4]。对于智能体工作负载来说,这种确定性的低延迟至关重要——只要有一个沙箱任务的执行延迟超出预期,整个GPU批次的推理任务都要等待,最终拉低整个集群的吞吐量。
第三是内存层面的带宽突破:Vera放弃了传统服务器CPU普遍使用的DDR5内存,转而采用LPDDR5X内存,搭配可拆卸、可现场更换的SOCAMM模块,同时实现了低功耗内存的效率和服务器级的可扩展性。官方数据显示,和搭载DDR5的主流x86 CPU相比,Vera的总内存带宽提升2倍,每核心带宽提升3倍,能效提升4倍[3][6]。高内存带宽恰好匹配了智能体工作负载大量代码、数据快速流转的需求,也是其性能提升的核心支撑之一。
实测性能:场景化优势已验证,归因边界待明确
目前公开的测试数据已经验证了Vera在智能体专属工作负载下的性能优势。NVIDIA官方以AMD EPYC Turin这款主流x86服务器CPU为基准,在代码编译、解释器运行、脚本运行、运行时引擎、ETL、数据分析、图计算这五类智能体核心工作负载中,Vera的平均性能达到了x86 CPU的1.8倍,直接加速了整个智能体内循环的执行速度[2][3]。
第三方客户的实测数据也印证了这一优势:AI搜索公司Perplexity在实际的编码工作流程中测试,Vera完成克隆代码库、在沙箱中运行测试套件的速度比传统x86 CPU快约1.5倍,并发启动多个沙箱的速度快了1.9倍,目前Perplexity已经计划在其下一代智能体生产环境中采用Vera[8]。流处理厂商Redpanda测试显示,Vera运行Apache Kafka兼容工作负载时,延迟最高可降低至原有系统的18%[6]。编程智能体公司Cursor也表示,将采用Vera提升智能体的吞吐量和响应速度[6]。在科研场景下,洛斯阿拉莫斯国家实验室测试显示,Vera运行其URSA科研智能体工作负载时,性能是该实验室Crossroads x86超算所用CPU的7倍,运行蒙特卡洛传热仿真工具Branson时性能提升超过3倍[9]。
需要明确的是,目前所有公开测试中的x86基准CPU均搭载DDR5内存,尚未有中立第三方完成控制变量的对照测试,即给x86 CPU配置同规格的LPDDR5X内存后,再和Vera进行性能对比。因此目前还无法准确拆分,Vera的性能提升中,有多少来自LPDDR5X内存的代际优势,有多少来自自研Olympus核心和单片架构的架构优势,这也是后续验证其核心壁垒的关键指标。
商业化逻辑:跳出通用CPU的竞争框架
和历史上所有尝试切入服务器市场的Arm CPU不同,Vera的商业化逻辑从一开始就没有瞄准通用x86 CPU的替代市场,而是切中了AI工厂特有的ROI核算体系,这也是其能够快速获得头部客户认可的核心原因。
传统服务器CPU的采购决策由企业IT部门主导,考核指标包括通用性能、软件生态兼容性、运维成本、长期TCO,x86架构几十年积累的生态壁垒几乎无法突破。但Vera的采购决策主体是AI算力集群的运营团队,他们的预算来自独立的“AI算力ROI优化专项”,核心考核指标只有两个:单位成本的Token产出量、GPU的实际利用率。对于这些团队来说,CPU能不能跑数据库、Web服务根本不重要,只要能减少GPU的闲置时间,哪怕CPU本身的价格更高,整体ROI也是正的。
这一核算逻辑的核心是AI集群极高的GPU闲置成本。目前行业内主流AI集群的GPU平均利用率在60%-70%之间,其中很大一部分闲置时间是在等待CPU完成控制平面的任务。一台配备数十颗高端GPU的AI集群,每小时的闲置成本可达数万元,如果Vera能将GPU利用率提升20个百分点,单集群每月节省的成本就可达数百万元,远高于Vera的采购溢价、定向调优的人力成本甚至架构适配成本[7]。
更重要的是,Vera不是一个孤立的硬件,而是英伟达全栈AI工厂方案的核心组成部分,和CUDA生态、GPU调度工具、BlueField-4 DPU、Spectrum-6 SPX交换机完全打通。对于已经全栈采用英伟达算力设施的头部AI厂商、超算中心来说,适配Vera不需要做大规模的软件迁移,仅需要调整调度层的配置即可上线,适配成本远低于从x86迁移到通用Arm CPU的成本,传统x86的生态壁垒根本不进入其决策考量范围[4][11]。
目前Vera已经进入规模化商用推广的初期阶段:OpenAI、Anthropic、SpaceXAI等头部AI实验室已经拿到首批Vera芯片[8],洛斯阿拉莫斯国家实验室的三台新建超算Mission、Vision都将采用Vera CPU[9],戴尔已经推出基于Vera的AI工厂平台[1],甲骨文云基础设施也计划上线Vera相关的实例。黄仁勋在2026年台北电脑展上透露,Vera已经全面投产,将内置在英伟达出货的AI机器中,多家头部科技、金融企业已经确定采用[11]。
边界与风险:市场空间与长期壁垒仍待验证
尽管Vera在智能体专属场景的优势已经得到初步验证,但它的适用边界和长期发展仍存在多个待验证的变量,不能简单将其视为x86 CPU的替代者。
首先是市场边界的限制。Vera目前所有的性能优势都集中在智能体相关的专属工作负载,至今没有公开通用数据中心场景的性能数据,包括虚拟化、数据库、Web服务等占传统服务器CPU需求70%以上的场景[7]。这意味着Vera的定位仍然是AI工厂的专用配套硬件,而非通用服务器CPU的替代品。NVIDIA官方宣称的2000亿美元目标市场,是其自行定义的“智能体相关新增CPU工作负载市场”,而非存量x86服务器CPU市场,行业普遍估算其真实可触达的市场规模约为400-800亿美元,仅为官方宣传数字的三分之一到五分之二[7]。
其次是适配成本的分层差异。对于已经完成全栈英伟达设施部署、仅运行纯智能体工作负载的头部客户,Vera的适配成本确实极低,但对于仍采用风冷架构、存在大量x86通用业务混合部署需求的中小客户来说,适配成本仍然存在不确定性:Arm架构下的企业级监控、运维、安全工具链的生态成熟度远低于x86,液冷基建的改造投入也较高,这些隐性成本完全可能抵消GPU闲置带来的成本节省[7]。目前公开的所有适配成本较低的案例,都来自已经深度绑定英伟达生态的头部客户,中小客户的实际适配成本尚未有公开数据支撑。
第三是性能壁垒的待验证性。如前文所述,目前Vera的性能测试尚未排除LPDDR5X内存代差的影响,如果AMD、Intel等x86厂商在下一代AI专用CPU中也采用同规格的LPDDR5X内存,可能会大幅缩小和Vera的性能差距。此外,x86厂商也已经开始针对智能体工作负载做定向架构优化,这些竞争动作都可能削弱Vera的性能优势。
第四是长期的技术路线风险。目前已经有技术团队在测试将智能体的代码执行、沙箱运行等工作负载迁移到GPU端的方案,如果这一路线能够解决安全合规、隔离性的问题,实现大规模商用,那么Vera作为控制平面专用CPU的核心价值将被直接削弱。不过目前这一技术路线仍处于早期测试阶段,短期不会对Vera的定位构成实质威胁。
后续核心观察指标
Vera的后续发展,将直接决定AI算力控制平面的竞争格局,接下来四个核心指标的变化,将直接验证这一技术路线的核心价值与市场潜力:
第一是中立第三方控制变量测试的结果。如果测试显示,给x86 CPU配置同规格LPDDR5X内存后,和Vera在智能体工作负载下的性能差距小于20%,那么Vera的架构溢价逻辑将被大幅削弱,其核心优势将更多来自内存封装的工程优化,而非不可替代的架构级创新。
第二是头部客户的配套渗透率。如果头部大模型厂商新增GPU集群中,Vera的配套比例超过30%,说明其已经成为AI工厂的刚需配套;如果长期低于10%,则说明其仅适用于部分极端场景,并未形成广泛的需求。
第三是云厂商的产品定位。如果主流云厂商将Vera作为高阶AI实例的标配CPU,而非可选升级项,说明其ROI逻辑已经得到广泛认可,具备足够的溢价空间;如果仅作为可选配置,则说明其价值仍未得到普遍验证。
第四是全链路部署的实际效果。如果有头部客户公开全栈部署Vera后的端到端GPU利用率提升数据,以及单位Token的成本下降数据,将直接验证其ROI逻辑的真实性,完成商业化的闭环。
Vera的推出,真正的意义不在于英伟达又推出了一款新的处理器,而在于它标志着AI算力的竞争已经进入了一个全新的阶段。过去十年,AI行业的竞争始终围绕计算平面的GPU性能展开,大家比拼的是谁能堆更多的算力,谁能训练更大的模型。但随着智能体应用的规模化商用,AI算力的瓶颈已经从计算平面转向了控制平面,比拼的是谁能让整个系统的运行效率更高,谁能让每一块GPU都少闲置,谁能让每一分钱的算力投入都产出更多的价值。
从这个角度来看,Vera不是对x86 CPU市场的进攻,而是对AI算力基础设施定义的重构。未来的AI工厂,不再是通用服务器和GPU的简单堆砌,而是从CPU、GPU、DPU到交换机、内存、调度系统的全栈专用化设计,每一个环节都要针对AI工作负载的特点做深度优化。Vera只是这个趋势的开始,接下来整个数据中心硬件的设计逻辑,都将随着智能体时代的到来,发生根本性的变化。
参考资料
先把Vera CPU的发布承诺拆成能不能跑通的工程问题:它的性能增益到底是场景匹配的专属优化,还是能支撑独立商业化的全栈卡位能力,这是目前所有判断分歧的核心。当前各方的核心分歧本质是技术场景边界与产业商业化叙事的错位——产业端将其视为AI工厂算力ROI的必选配套件,核心逻辑是CPU提速带来的GPU利用率提升可覆盖所有成本,而技术端所有可验证的性能证据都严格限定在孤立的智能体单任务场景,两者之间的转化链路至今没有公开数据支撑。 目前最强的硬证据来自口径校验:所有公开的1.5倍到7倍性能提升,分别对应编码沙盒、流处理、科研超算三类完全不重叠的专属场景,且作为基准的x86 CPU均采用DDR5内存,而Vera搭载的是带宽高出2倍的LPDDR5X内存,至今没有控制变量的对照测试拆分内存规格、自研Olympus核心、单片架构三者的性能贡献占比。这直接导致一个核心疑问无法回答:如果给x86 CPU配置同规格的LPDDR5X内存,是否能拿到相近的智能体负载性能?如果答案是肯定的,那Vera的核心优势就只是内存封装的工程优化,而非架构级的不可替代性。我最初的判断没有拆分这一变量,现在需要修正:目前所有性能增益都无法完全归因于CPU架构本身,内存代差的贡献占比仍是关键的证据缺口。 与产业端判断的核心分歧在于,「GPU利用率提升覆盖成本」的逻辑目前仍属于未经验证的假设。产业端提出单集群GPU闲置成本很高,只要CPU提速就能转化为收益,但智能体循环的瓶颈可能出现在数据吞吐、DPU调度、网络延迟等多个环节,单CPU的任务提速并不必然线性转化为GPU利用率的提升,目前没有任何合作客户公开过全链路部署Vera后的GPU闲置时间下降数据,仅靠单CPU性能推导全链路成本节省,属于典型的工程逻辑跳跃。针对产业端提到的「适配成本极低,仅需调整调度层即可上线」的判断,我需要对最初的生态适配结论做部分让步:对于完全基于英伟达CUDA生态开发的纯智能体工作流,适配成本确实较低,但若AI集群存在x86遗留的通用业务混合部署需求,Arm架构下的企业级监控、运维、安全工具链的适配成本仍未公开,这部分隐性成本完全可能抵消GPU闲置的节省。 回应对叙事夸大的质疑,目前Vera确实完全没有公开通用数据中心场景的性能数据,唯一的第三方测试Phoronix仅提到AI相关负载下的性能领先,未披露虚拟化、数据库、Web服务等占x86需求70%以上的通用场景表现,这直接限制了Vera的市场边界——如果仅能覆盖智能体专属负载,其真实可触达的市场规模确实远低于官方宣称的2000亿美元,只能作为GPU的配套附件,而非独立的CPU产品线。但需要澄清的是,英伟达官方的2000亿美元市场口径是其自行定义的「智能体相关新增负载」,并非存量x86市场替代,传播过程中被泛化为通用市场替代,这一点不属于官方叙事的刻意夸大,而是传播偏差。 指标看起来漂亮,但生产环境会先追问成本和稳定性。基于现有证据,修正后的分层判断如下:Vera在限定的智能体单任务场景下,性能优于搭载DDR5的主流x86 CPU的置信度为90%,多源交叉测试已排除系统性造假,仅剩余内存规格的变量影响;全栈部署后单位智能体任务的端到端成本下降的置信度为50%,核心缺口是GPU利用率提升的实锤数据和混合部署的适配成本核算;Vera成为AI集群主流配套CPU的置信度为40%,核心变量是x86厂商针对智能体负载的优化进度,以及Arm生态工具链的成熟速度。接下来需要追踪的核心验证点,首先是中立第三方完成的控制变量对照测试,明确内存与架构的性能贡献占比;其次是头部客户公开的全链路部署后GPU利用率的实际提升数据,以及端到端的单位任务成本核算;第三是云厂商高阶AI实例中Vera的标配比例,而非可选升级项的占比;最后是x86厂商下一代专用AI CPU的性能参数,判断其是否能通过架构优化缩小与Vera的场景差距。
建议删除“后续核心观察指标”整节内容,认为属于非必要的预测性内容,不符合机制解释的定位要求
为什么没放进正文:该节内容是对核心判断的边界校准,为读者提供了可验证的后续追踪维度,属于增量价值的重要组成部分,删除会降低文章的实用参考性,因此予以保留
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-07-10 10:11:48。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。