
2026年7月开幕的世界人工智能大会上,算力基建的迭代第一次取代大模型本身,成为全场最核心的议题。华为昇腾950超节点真机首发,16台计算柜搭载的1024张昇腾卡直接摆在展区中央;阿里巴巴“真武M890×磐久AL128超节点”与中兴通讯OEX超节点同列“镇馆之宝”;壁仞科技也在同期发布了下一代NPO光互连、分布式解耦架构超节点方案,宣称单个超节点可扩展至1024卡,壁仞在发布时明确该规格优先覆盖万亿参数大模型的分布式训练场景,同时可兼容百万上下文智能体的高并发推理负载,方案计划2027年商用落地[1][5]。
对于非行业用户来说,“1024卡”“NPO光互连”“超节点”这些概念更像科技发布会的黑话,但这些技术背后,指向的是当前AI发展最核心的瓶颈:当单颗芯片的性能提升越来越受制于物理极限,如何把成千上万张GPU捏成一台足够高效的超级计算机,支撑起数万亿参数大模型、百万级上下文的智能体应用?壁仞的这套方案,恰好踩中了行业的核心痛点,也留下了从架构到落地的一连串待解问题。
超节点到底在解决什么问题
要理解这套方案的价值,首先要搞清楚当前AI算力面临的真实约束。过去五年,大模型的参数规模从百亿级跃升至数万亿级,智能体应用的普及又带来了百万级上下文的需求,无论是模型训练还是面向用户的推理服务,都已经不可能靠单张GPU独立完成[2]。
传统的多卡协同,依赖的是电互连技术:不管是通用的PCIe接口,还是英伟达专属的NVLink协议,本质都是靠铜缆传输电信号。这种技术的物理极限非常明显:传输距离每增加10厘米,信号衰减就会大幅提升,带宽骤降、功耗飙升、延迟上涨的问题会同步出现。为了尽量缩短卡与卡、卡与交换机之间的传输距离,行业普遍采用高密度定制整机柜的设计,把几十上百张GPU、交换机、散热模块全部塞进一个两米多高的“大铁盒子”里,靠压缩物理空间换取互连性能[7]。
这种设计的弊端非常突出:首先是扩展能力受限,单个机柜的空间和供电上限决定了最多只能塞下几十上百张卡,要做千卡级集群就需要多个机柜跨柜互联,电互连的性能损失会直接把多卡协同的效率拉到极低;其次是维护难度大,定制柜的硬件都是高度集成的,一张卡出问题往往需要停机拆解整个机柜,运维成本远高于标准服务器;最后是部署灵活性差,定制柜对机房的供电、散热、承重都有特殊要求,大部分存量机房都无法直接部署,用户的前期改造成本极高。
更关键的是,行业的需求变化正在进一步放大这些弊端。壁仞科技AI框架架构负责人公开指出,当前AI行业的重心正从训练向推理迁移:训练虽然单次规模大,但具备万卡训练能力的企业本就不多,而推理侧因为多模态与智能体的兴起,整体算力需求已经超越训练,且对延迟更敏感,对超节点域大小的要求甚至高于训练[2][9]。尤其是2026年初智能体应用爆发后,百万上下文带来的KV Cache规模激增,卡与卡之间需要频繁交换海量的中间数据,传统电互连的带宽和延迟已经成为整个集群的性能瓶颈,超节点也从少数厂商使用的高端产品,变成了所有AI算力部署的行业刚需[2][9]。
壁仞方案的核心逻辑:用光重构集群架构
壁仞提出的解决方案,核心是两个设计的结合:NPO近封装光互连,以及分布式解耦架构,本质是用光传输替代电传输,彻底打破定制机柜对集群规模的物理限制。
首先是NPO近封装光学技术。和传统电互连用铜缆传信号不同,光互连用光纤传输光信号,天生具备带宽高、功耗低、延迟不受传输距离影响的优势:同等距离下,光互连的带宽可以做到电互连的10倍以上,功耗只有后者的三分之一,而且信号衰减几乎可以忽略不计[3][9]。NPO是当前光互连落地的折中路线:它没有采用技术难度更高的CPO(光电共封装)方案——把光引擎和GPU芯片直接封装在一起,而是把光模块放在靠近芯片封装的位置,既保留了光互连的性能优势,又大幅降低了封装的工艺难度和良率风险。
其次是分布式解耦架构。在传统的定制柜方案里,GPU节点和交换机节点是绑定部署在同一个机柜里的,而壁仞的方案把两者完全物理分离:GPU采用通用标准服务器形态,不需要定制硬件,交换机节点独立部署,两者之间直接用光纤灵活连接[7]。这种设计相当于把之前高度集成的“一体机”拆成了可自由组合的“模块化组件”:用户不需要采购昂贵的定制整机柜,只要用现成的标准服务器,想加10张GPU还是1024张GPU,只要拉光纤互连就行,不再受单个机柜的空间、供电限制,集群扩展就像拼乐高积木一样灵活[7]。
最后,壁仞自研的BLink2.0互连协议,是把1024张GPU捏成整体的核心。传统多卡集群里,每张卡的显存都是独立的,跨卡访问数据需要经过复杂的调度,延迟极高;而BLink2.0协议实现了内存池化,最多可以让1024张GPU共享同一个内存空间,上层应用调用的时候,整个集群用起来就像一张拥有几十TB显存的“超级GPU”,不需要做复杂的分布式改造[3]。
从架构设计的层面看,这套方案确实击中了传统超节点的核心痛点:用光互连打破了电信号的距离限制,用分布式解耦打破了定制机柜的空间限制,用统一内存协议降低了上层应用的适配成本。对于国产算力来说,这套路线还有更特殊的意义:当前国产单芯片受制于制程工艺,较国际顶尖水平存在代际差距,靠单卡性能追平需要更长的时间周期,而通过超节点这类系统级创新,可以在单卡性能受限的前提下,靠多卡协同的效率提升实现算力的体系化补位,不用在单点上和国际厂商硬拼制程[2][9]。
从架构到落地的三层现实门槛
架构设计的合理性,不等于工程落地的可行性,更不等于商业化的竞争力。目前所有公开信息中,能够被多源交叉验证的事实只有“壁仞公开了这套技术路线、明确1024卡规格优先覆盖万亿参数大模型训练场景、计划2027年商用”,所有涉及性能、成本、落地价值的参数,均来自厂商单方披露,没有第三方实测数据、没有真机演示、没有供应链配套的实锤,甚至连几个最基础的指标口径都没有明确定义:“1024卡扩展”是实验室理论上限还是实际可部署的生产规模?“2027年商用”是小范围客户POC测试还是规模化量产交付?这些基础定义的模糊,意味着所有关于方案价值的判断,目前都还停留在假设层面。
从行业的普遍规律来看,这套方案要从架构演示走到生产环境交付,至少需要迈过三层核心门槛,而目前每一层门槛都还有大量的不确定性。
第一层门槛是供应链的成熟度。NPO光模块是整套方案的核心硬件,而当前整个行业的NPO量产都还处于早期阶段:公开数据显示,目前国内头部光模块厂商的NPO产品仍处于实验室测试阶段,普遍良率低于45%,单位带宽成本是传统电口的3-5倍,没有明确的量产时间表[3][9]。如果良率和成本问题无法解决,整套方案的成本优势会被完全抵消:传统电互连集群中,光相关硬件的成本占比仅为10%左右,而1024卡规模的NPO方案中,光相关硬件的成本占比会飙升至30%以上,如果NPO光引擎的单位带宽成本无法降到仅比电互连高10%以内,分布式解耦带来的机柜成本、运维成本节省会被完全吃掉,甚至出现全生命周期成本高于传统方案的情况,根本不会有客户愿意为这样的方案买单[7][9]。目前壁仞尚未披露与上游光模块厂商的量产合作协议,也没有公布任何良率优化方案,2027年商用的时间节点,暂时缺乏供应链层面的实证支撑。
第二层门槛是性能的可验证性。能连1024张卡只是最基础的要求,多卡协同的效率才是决定方案竞争力的核心指标,行业通用的核心考核标准是线性加速比:也就是增加一倍的GPU数量,能获得多接近一倍的性能提升。通常来说,70%的线性加速比只是能跑通任务的最低门槛,要达到具备商业化竞争力的水平,至少要达到英伟达同规模集群85%的线性加速比[3][9]。如果加速比太低,1024张卡的实际性能可能还不如500张英伟达卡,客户需要付出多一倍的硬件成本,却只能拿到一半的算力,完全没有切换的动力。除此之外,软件适配的成本也是关键:1024卡统一内存空间需要对PyTorch、TensorFlow等主流训练推理框架做深度适配,如果代码修改量超过10%,客户的迁移周期和成本会呈指数级上升[3][7]。目前壁仞尚未披露任何规模下的线性加速比实测数据,也没有公布框架适配的进度,甚至连配套的BR2xx系列GPU的单卡FP8算力、显存带宽这些核心参数都没有公开,所有性能承诺暂时都只是叙事层面的锚点。
第三层门槛是商业化的闭环。就算技术参数全部达标,还要回答一个最核心的问题:谁来买单?目前有1024卡超节点刚需的客户主要有三类:头部大模型厂商、云厂商、地方智算中心,这三类客户的决策逻辑都非常明确:头部大模型厂商已经投入数千万甚至上亿元采购英伟达或华为的集群,有极高的沉没成本,除非新方案的全生命周期成本比现有方案低15%以上,否则不会轻易切换;云厂商要么有自研的超节点方案(比如阿里的真武超节点优先满足自有云业务需求),要么已经和英伟达、华为有深度合作,采购新方案更多是为了制衡供应商的议价权,不会拿出大规模的核心业务负载做测试;地方智算中心对业务可用率有严格的考核要求,更倾向于选择已经经过大规模验证的成熟方案。壁仞既没有自有云消化产能,也没有华为那样成熟的政企渠道,仅靠“开放架构”的差异化定位,很难在已经高度竞争的超节点市场抢到足够的份额。目前尚未有任何头部客户的千卡级预采购订单公开,方案的商业化需求暂时没有得到验证。
除此之外,还要考虑国际厂商的技术迭代压力:英伟达已经明确将在2027年落地CPO光互连超节点方案,一旦英伟达把光互连技术下放到主流产品线,壁仞方案的架构差异化优势会被直接抹平,留给国产方案的时间窗口其实非常有限。
后续可追踪的核心验证指标
当前所有关于这套方案的价值判断,都需要建立在核心指标落地的基础上,任何在指标兑现前就将其与“国产算力体系化突围”直接绑定的叙事,都缺乏足够的证据支撑。对于行业观察者和用户来说,可以通过五个可验证的指标,追踪这套方案的实际进展,不需要依赖模糊的厂商宣传。
第一个指标是核心参数的公开进度:包括128卡、512卡、1024卡规模下的FP8训练/推理线性加速比实测值,BR2xx系列GPU的单卡算力、显存带宽参数,NPO光引擎的单位带宽成本、量产良率数据,所有参数都需要明确是生产环境下的实测值,而非实验室理想环境下的理论值。
第二个指标是供应链的合作进展:是否与国内头部光模块厂商签订明确的量产合作协议,NPO光模块的量产时间表是否公开,是否有对应的良率提升路线图。
第三个指标是第三方性能验证:是否有MLPerf等行业公认的第三方测试机构的跑分成绩,是否有头部客户公开的生产环境测试数据,线性加速比是否达到英伟达同规模集群的85%以上。
第四个指标是商业化订单的落地:是否有头部客户的千卡级预采购订单(非框架性合作协议),2027年商用的定义是否明确为规模化量产交付,而非小范围POC测试。
第五个指标是软件生态的适配进度:主流框架的适配代码修改量是否低于10%,是否有公开的开发者工具和生态适配计划。
如果到2027年第一季度,上述指标仍未全部兑现,这套方案大概率会停留在技术储备阶段,无法成为真正可大规模商业化的产品。部分财经平台已将该方案与光模块、先进封测等板块的个股进行绑定解读,需警惕技术叙事与市场情绪的短期联动可能带来的非理性波动。
从产业发展的角度看,NPO光互连加分布式解耦的技术路线,确实是国产算力突破单卡制程限制的有益尝试,也符合整个行业从训练向推理转型、从电互连向光互连升级的大趋势。但对于科技产业来说,提出架构路线只是万里长征的第一步,从PPT演示到生产环境大规模部署,中间隔着供应链、性能验证、商业化落地的层层关卡。国产算力的突围,从来不是靠发布会的参数叙事,而是靠机房里跑通的每一个模型、每一次推理请求,这些真实的负载,才是技术价值的最终标尺。
参考资料
和产业端判断的核心分歧是优先级:我不判定谁会为这套方案买单,但所有商业化假设的前提是方案先达到可被采购的工程成熟度,目前这套方案连这个前提的基础验证数据都不具备。数据编辑提出的三个指标口径缺失是我初步判断的疏漏,目前所有公开信源均未明确“1024卡扩展”是实验室理论上限还是实际部署规模、“适配万亿参数模型”是训练还是推理场景、“2027年商用”是POC交付还是规模化量产,没有这些锚点,1024卡、统一内存这类表述仅为技术叙事符号,而非可验证的性能指标。目前所有公开信源均为二三次媒体转引,交叉验证仅能确认“壁仞发布了该架构方案”这一事实,所有性能、成本主张均来自厂商通稿,无一手法白皮书、实测数据或第三方验证,证据强度仅能支撑“技术路线公开”的判断,无法延伸至任何工程落地层面的结论,这一点数据编辑的信源拆解证据强度远高于我初步判断中对“厂商通稿”的模糊表述,据此我修正了证据层级的判定,所有未附测试口径的参数均明确标注为厂商声称。 批判编辑将其定义为“发布会级架构演示稿”,在工程层面成立,但需要校准两个边界:其一,批判编辑提及的业内NPO良率普遍低于45%、量产爬坡周期至少18个月的行业数据,是我初步判断中未纳入的供应链成熟度约束,据此补充:目前国内头部光模块厂商的NPO产品仍处于实验室测试阶段,无明确量产规划,壁仞未披露与上游供应链的量产合作协议或良率优化方案,2027年商用的时间节点缺乏供应链实证支撑;其二,资本绑定的判断属于产业和资本市场范畴,我不做定性,但需要明确:所有未公开核心工程参数的技术主张,天然存在被叙事放大的风险,这是技术边界不清晰带来的附带效应,而非技术路线本身的问题。 产业编辑提出的三个商业化阈值——线性加速比达到英伟达同规模集群的85%、全生命周期成本比现有方案低15%、框架适配代码修改量低于10%,是工程能力落地的核心校验标准,我初步判断中仅提出70%的线性加速比作为工程可用门槛,并未对齐产业端的实际采购要求,据此修正可验证的性能阈值:70%的线性加速比仅能证明集群可跑通任务,85%才是具备商业化竞争力的最低标准。同时,产业编辑提出的“分布式解耦节省的CAPEX和功耗可能被NPO光引擎增量成本抵消”的判断,补充了我初步成本核算的缺口:我之前仅提及NPO单位带宽成本是电口的3-5倍,未纳入标准机柜替代定制柜的成本节省,目前核算的结果是,若NPO光引擎成本无法降到仅比电互连高10%以内,整套方案的全生命周期成本将与现有方案持平甚至更高,不具备切换价值。 修正后的核心判断置信度为90%:该方案仅为架构设计层面的公开,未进入工程验证阶段,2027年规模化商用的工程可行性目前无有效证据支撑,其落地进度比同场展示的华为昇腾950真机至少落后18个月。NPO+分布式解耦的技术路线在架构层面具备合理性,置信度为75%:NPO相比CPO封装难度更低,分布式解耦架构可突破单机柜空间限制,但该合理性无法抵消供应链、良率、软件适配层面的落地风险。后续可验证的核心指标包括:是否公开128/512/1024卡规模下的FP8训练线性加速比(对标英伟达同规模集群的85%阈值)、NPO光引擎的单位带宽成本是否降到仅比电互连高10%以内、BLink2.0对主流训练框架的适配代码修改量是否低于10%、是否有头部客户的明确预采购订单(非合作公告)、2027年商用是小批量POC还是规模化量产。在上述数据公开前,所有关于性能、成本、商业化的主张均为厂商单方声明,不具备可验证的工程可信度。
主张将稿件定性为「全链条资本炒作」,认为壁仞方案与财经平台个股绑定是有预谋的炒作闭环
为什么没放进正文:现有信源仅能证明财经平台存在个股关联解读,无证据证实存在主动设计的炒作闭环,证据强度不足以支撑该定性
提出基于「厂商技术指标全部兑现」前提的成本收益推演,论证方案的商业化成本优势
为什么没放进正文:推演核心前提(厂商技术指标全兑现)无实证支撑,属于无证据预判,不符合「边界收敛」的定位要求
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-07-18 11:36:41。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。