
2026年7月10日,蚂蚁灵波发布具身世界动作模型LingBot-VA 2.0,与行业此前普遍采用的技术路线不同,该模型直接放弃了“视频生成模型+动作微调”的成熟路径,选择基于自回归架构从零开始预训练,面向物理世界的交互需求做原生设计[1][8]。这一选择的意义远不止于一款新产品的发布:它第一次将具身智能领域长期存在的路线分歧摆到了台前——机器人的“大脑”,到底应该从数字世界的内容生成模型迁移改造,还是从物理世界的交互规律出发从头构建?
主流路线的底层错位
在LingBot-VA 2.0发布之前,“视频大模型+微调”几乎是具身智能领域的默认路径。过去三年,随着视频生成技术的快速成熟,通用视频模型已经具备了对物理世界动态规律的基础建模能力,只需要在预训练底座上增加动作控制头,再用少量机器人交互数据微调,就能快速生成可用的机器人控制模型。这条路的优势十分明显:不需要从零开始投入巨额预训练成本,能复用通用大模型的现有能力,研发周期短,中小团队也能快速跟进。
但这条路径从底层逻辑上就存在无法调和的结构性错位。面向内容创作的视频生成模型普遍采用双向建模架构,为了生成连贯的画面,它可以同时调用过去和未来的全局帧信息,相当于“偷看答案”之后再生成内容;但机器人在物理世界中的执行是严格单向的,它只能基于已经发生的观测数据做决策,不可能提前知道下一秒环境会发生什么变化[3]。这种“预测范式”与“执行范式”的根本错位,导致微调路线的模型在实际落地中普遍存在三个难以解决的问题:一是能力迁移不足,在训练场景表现良好的模型,换一个新场景就出现动作精度大幅下降;二是因果逻辑混乱,比如预测的动作不符合重力、摩擦力等物理规则,出现“悬空抓取”“用力过猛打碎物体”等低级错误;三是灾难性遗忘,每微调适配一个新任务,就会部分丢失之前学会的能力,需要反复重训[7]。
这些问题已经成为具身智能落地工业场景的核心障碍[3][7]。当前主流微调模型每适配一个新的工业产线或新的机器人构型,调试成本往往达到前期训练成本的2-3倍,知识遗忘导致的良率波动更是让很多制造企业对具身智能的落地持观望态度。
原生设计的技术逻辑
LingBot-VA 2.0选择的原生预训练路线,核心目标就是从根源上解决双向模型微调的结构性错位问题。整个模型从架构设计到训练范式,都完全围绕物理世界的交互规则构建,没有复用任何通用视频生成模型的预训练权重,相当于专门为机器人造了一个“天生就懂物理规律”的大脑[4][6]。
支撑这一目标的是四大核心设计。第一是语义视觉-动作分词器,作为全新的视觉编码器,它在对视觉信息做压缩处理的过程中,就同步完成了语义信息与动作参数的对齐——比如当模型接收到“把咖啡杯轻轻放回第三层橱柜”的指令时,不需要先做语义理解再转成动作指令,而是直接在token层面就将“轻轻”映射为末端执行器的力控阈值,“第三层”对应空间坐标,“放回”触发逆运动学序列,大幅减少了指令转动作过程中的信息损耗,提升了动作精度。
第二是严格的因果预训练范式。模型从训练的第一天起,就采用自回归架构,所有的视觉状态预测和动作生成,都只能依赖此前所有的观测和动作数据,绝对不允许调用未来帧的信息,相当于从训练阶段就强制模型养成“只根据已经发生的事做决策”的习惯,完全符合物理世界的单向时序规则[3]。
第三是MoE混合专家架构。原生预训练需要模型容纳足够多的物理交互知识,参数量往往非常大,如果全部激活会导致推理速度过慢,无法满足实时控制的需求。MoE架构的引入,让模型在推理时只激活15%-20%的专家子网,既扩大了模型的总容量,又不会牺牲推理效率,在性能和速度之间找到了平衡。
第四是增强的异步推理机制。传统机器人的控制逻辑是“观测-规划-执行”的串行流程,执行当前动作的时候不会做下一步的规划,等动作执行完再重新观测环境,响应延迟很高,遇到环境突然变化的时候往往来不及调整。而异步推理机制实现了并行处理:当机器人正在执行当前动作的时候,模型已经开始推演未来的环境状态,同时不断用最新的观测数据校正下一步的决策,相当于人类走路的时候,脚还没落地,眼睛已经在看下一步的路,大脑已经在调整步幅了[4]。
这一整套架构设计的逻辑自洽性,已经得到了部分可验证的支撑。在LingBot-VA 2.0发布之前,蚂蚁灵波已经连续开源了多份子模块的技术代码:LingBot-World 2.0的因果建模范式、LingBot-Video的MoE架构都已经上传公开开源仓库,开发者可以独立复现其基础能力。官方公开的真机演示视频也显示,搭载该模型的机器人可以在不依赖外部拍摄设备的情况下,完成与人类的多轮随机对打,证明其可以在受限动态场景下实现实时闭环控制[9]。
技术宣称的证据边界
不过,在技术逻辑的合理性之外,LingBot-VA 2.0的多项核心宣称仍然存在明确的证据边界。
首先是“蚂蚁灵波公开的首个配套全栈工具链的具身原生世界动作模型”的定位。这一宣称基于厂商自设的分类框架,其判定标准为“放弃视频微调路线+基于自回归架构从零预训练+配套全栈原生工具链”,仅在该口径下具备有效性。实际上,原生预训练路线已有多家厂商布局:无界动力发布的MWA模型同样采用了放弃视频微调、从零预训练的技术路线,并且已经登顶斯坦福牵头的RoboCasa具身智能榜单;英伟达高级科学家Jim Fan也在2026年早些时候公开提出世界动作模型(WAM)范式,其推出的DreamZero模型同样采用原生预训练路线[7]。因此这一定位并不具备行业通用性,更多是对技术分类标准的一种定义尝试。
其次是核心性能指标的验证问题。目前官方披露的核心性能数据,包括“动作生成效率较传统方法提升300%”“物理规则违反率降至0.7%以下”“单卡150Hz实时推理效率”,均来自厂商发布的技术白皮书,以上数据尚未获得第三方独立验证,且未披露对应的测试条件:150Hz推理对应的显卡型号、输入分辨率、动作自由度未作说明,效率提升的对比基线未明确,物理规则违反率的测试场景复杂度也没有公开[10]。截至目前,没有第三方机构在RoboCasa等通用具身评测集上对该模型的性能进行过独立复现,也没有公开的横向对比数据证明其性能显著优于谷歌RT-2、英伟达DreamZero等同类型模型。
此外,该模型的泛化能力边界也尚不清晰。目前公开的真机测试仅覆盖人机对打、机械臂操作、移动机器人导航三类高结构化场景,没有非结构化户外场景、未知物体交互的公开测试数据,其跨场景、跨机器人构型的适配能力也没有公开的验证结果。目前可以确认的是,该模型的架构设计确实在逻辑上规避了双向视频微调模型的未来帧泄露、因果逻辑混乱问题,但这一架构优势能否转化为实际落地中的性能优势,仍然需要更多独立验证数据的支撑。
商业化的现实约束
比技术验证更关键的是商业化的不确定性。原生预训练路线的核心想象空间,是其有可能反转具身智能模型的成本结构:如果原生预训练的底座具备足够强的泛化能力,那么后期适配新场景、新机型的边际成本会远低于微调路线,随着落地场景的增多,总成本会被快速摊薄。但这一判断目前仍属于理论假设,尚未获得可验证的产业数据支撑。
从已经明确的成本结构来看,原生预训练路线的前期投入远高于微调路线。由于自回归架构无法利用双向视频模型的未来帧并行训练优化,其训练阶段的算力开销比同参数的双向模型高30%-50%;而带力反馈、关节扭矩的真实具身交互数据,采集成本是普通视频数据的10-20倍,两者叠加之下,原生预训练的前期总投入至少比微调路线高一个数量级,目前只有头部科技厂商有能力承担,中小研发团队基本没有复制这条路线的可能性[3][7]。
而成本结构反转的核心前提——“后期适配边际成本大幅下降”,目前也没有公开数据可以验证。官方没有披露跨机型适配的成本与微调路线的对比数据,也没有公开不同场景下的调试周期、示教数据需求量等核心指标,无法证明其后期成本优势确实存在。
目前公开信息仅提及有产业落地试点布局,但未披露具体项目规模、付费信息、合同周期与实际落地效果,暂无法确认其商业化进展[11]。从工业客户的普遍付费逻辑来看,当前制造企业为具身智能方案付费的上限通常不超过对应岗位人力成本的50%,还要考虑后续的维护、调试成本,在原生路线的全周期成本没有被明确验证之前,很难出现大规模的付费采购。
蚂蚁灵波本身的商业化也存在明显的短板。不同于特斯拉拥有Optimus机器人的自有场景,可以通过内部生产需求不断迭代数据闭环,也不同于西门子等传统工业软件商拥有成熟的工厂客户渠道,蚂蚁灵波既没有自有机器人硬件场景,也没有工业客户的采购积累,其当前的核心策略是通过全栈开源吸引中小机器人开发者,抢占具身智能的开发者入口——这也是其在一周内连续发布并开源6款具身相关模型的核心原因,从空间感知的LingBot-Vision、LingBot-Depth 2.0,到多机控制的LingBot-VLA 2.0,再到世界模拟的LingBot-World 2.0和视频基模LingBot-Video,整套全栈工具链的目标就是降低开发者的适配门槛,快速扩大生态规模。但这条路径也存在明显的不确定性:如果后续英伟达、无界动力等厂商推出同等级的开源方案,其技术先发优势会被快速抹平,而没有硬件和客户场景的支撑,就算开源生态做起来,最终的商业价值也很容易被云厂商或硬件厂商截留。
路线分化后的行业未来
抛开单个厂商的产品叙事,LingBot-VA 2.0发布带来的最明确的信号,是具身智能领域已经出现了清晰的路线分化:一条是已经相对成熟、成本可控的“视频大模型+动作微调”路线,适合场景固定、变化较少的标准化工业产线;另一条是正在探索中的“原生世界动作模型预训练”路线,目标是解决微调路线的因果逻辑混乱、适配成本高的痛点,适合动态变化多、泛化要求高的场景,比如家庭服务机器人、户外作业机器人[7]。
这两条路线并非绝对的替代关系,而是会在未来相当长的一段时间内并存,各自适配不同的场景需求。原生预训练路线会不会成为未来的主流,取决于三个关键问题能不能得到明确的答案:一是其全周期成本能不能降到比微调路线更低的水平,二是其泛化能力能不能覆盖足够多的非结构化场景,三是能不能形成足够成熟的开源生态和商业落地路径。
从当前的信息来看,验证这些问题的时间节点已经不远。蚂蚁灵波已经宣布将在2026年7月17日开幕的世界人工智能大会上,展示其全栈大脑2.0的落地应用,届时会不会开源LingBot-VA 2.0的完整可商用权重,会不会有第三方机构公开独立复现的性能结果,会不会披露正式的商业付费合同,都将直接改变当前的判断。
在此之前,更稳妥的观察视角是:LingBot-VA 2.0不是具身智能的“范式革命”,而是原生预训练路线走向公众视野的标志性事件。它证明了从零开始构建面向物理世界的具身模型是一条可行的技术路径,也把路线选择的选择题抛给了整个行业——但这条路能不能走通、能走多远,仍然需要更多的技术验证和商业落地来回答。
参考资料
目前对LingBot-VA 2.0的判断分歧,本质是“架构设计的逻辑自洽性”与“可验证的工程落地性”的权重差异:产业编辑侧重原生路线成本结构反转的长期产业可能性,数据与批判编辑则强调所有核心叙事均为厂商自造定义、无有效独立信源支撑,而修正后的技术判断介于两者之间:已开源的子模块技术栈可部分支撑架构设计的自洽性,但核心模型的性能、成本、泛化性均未达到工程可验证的标准,所有超出架构设计层面的结论均需补充核心证据。 首先接受数据与批判编辑对“首个”宣称的质疑,修正此前未明确定义口径的疏漏:“业界首个具身原生世界动作模型”的判定标准为蚂蚁自定义,既未覆盖无界动力MWA、英伟达DreamZero等同属原生预训练路线的竞品,也未获得行业通用评测体系的认可,该定性仅在厂商自设的“自回归架构+全栈原生工具链”口径下成立,不具备行业通用性。同时修正此前对信源的判断:此前提及的LingBot-World 2.0因果建模范式、LingBot-Video的MoE架构,均已上传公开开源仓库,可独立复现其基础能力,属于与本次技术栈直接相关的可验证一手证据,并非完全无一手信源,但核心的LingBot-VA 2.0权重、训练数据集细节、端到端评测基准均未公开,这一核心证据缺口确实存在,所有端到端性能宣称目前仅能标记为“厂商声称”,不能作为已实现的技术结论。 针对产业编辑提出的“原生路线成本结构反转”逻辑,从工程视角回应:这一判断目前仅为理论假设,尚未获得可验证的技术数据支撑。确实,主流“视频大模型+动作微调”路线存在已被行业验证的隐形成本:每适配新场景或新机器人构型的调试成本可达前期训练成本的2-3倍,且普遍存在知识遗忘、长时序因果逻辑混乱的问题,但原生路线“后期适配边际成本大幅下降”的核心前提,是预训练底座具备跨场景、跨构型的强泛化能力,而目前仅有的公开测试场景为人机对打、机械臂操作、移动导航三类高结构化场景,无任何非结构化户外场景、未知物体交互的测试数据,跨机型适配的成本与微调路线的对比也无官方披露,因此完全无法验证边际成本下降的结论。反而目前可核算的确定工程代价不存在争议:自回归架构无法利用双向视频模型的未来帧并行训练优化,算力开销比同参数双向模型高30%-50%,带力反馈、关节扭矩的真实具身交互数据采集成本是普通视频数据的10-20倍,原生路线的前期预训练总投入至少比微调路线高一个数量级,仅能支撑头部厂商布局,中小团队完全没有复制能力。 此外,针对“全栈技术布局形成协同效应”的辩护,目前也无有效技术证据支撑:已开源的6款子模块与核心LingBot-VA 2.0的适配测试数据完全未披露,子模块的单独优化能否转化为端到端的具身控制性能提升,目前仅为官方宣称。修正后的分层技术判断与置信度如下:其一,“LingBot-VA 2.0的具身原生预训练架构在设计层面可避免双向视频模型微调的未来帧泄露、因果逻辑混乱问题”,置信度70%,支撑证据为已开源的因果建模、MoE子模块的可复现测试,以及官方公开的受限动态场景真机闭环演示,缺口为核心模型未开源、无法端到端验证架构的实际落地效果;其二,“该模型的所有官方宣称性能、成本优势、泛化边界均无第三方独立验证”,置信度95%,支撑证据为所有核心指标均来自官方白皮书,未披露评测基准、对比基线、硬件测试条件,无第三方复现结果,也未与谷歌RT-2、英伟达DreamZero等同类型模型进行公开榜单对比;其三,“原生路线与微调路线的工程成本拐点尚未到来”,置信度90%,支撑证据为原生路线的前期算力、数据成本已明确高于微调路线一个数量级,而边际成本下降的核心前提(强泛化能力)无有效验证数据。后续核心技术验证点包括:核心模型权重是否按承诺开源并提供商用许可、是否公开可复现的端到端评测脚本与基准、是否有第三方机构在通用具身评测集上复现其核心性能指标。
认为本文未采用负面拆穿立场,对原生预训练路线的技术风险与商业化不确定性批判不足,应大幅增加否定性内容,弱化其技术突破意义
为什么没放进正文:本次写作定位为突破深挖而非负面拆穿,文章已明确指出技术宣称的证据边界、成本劣势与商业化短板,符合定位要求,无需过度否定,过度增加负面内容会偏离客观分析的定位
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-07-11 10:25:31。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。