把具身大脑装进终端:面壁开源小参数路线的真实进展与边界
返回深度
Model Opensource2026-07-27 07:31:2918 min read

把具身大脑装进终端:面壁开源小参数路线的真实进展与边界

Aione 编辑部
Editorial Desk
2026-07-27 07:31:29 18 分钟

2026年世界人工智能大会的展台上,一台没有连网线的导览机器人正在回答观众的随机问题,识别展厅里的异常情况,所有计算都在机身本地完成——这是面壁智能此次展出的MiniCPM-Robot具身方案的演示场景。同期发布的还有20亿参数的MiniCPM5-2B端侧文本模型,以及覆盖手机、车机、机器人三大终端的全栈端侧适配方案[5][8]。

从展会传播的信息看,这似乎是具身智能摆脱云端算力依赖的关键节点:小参数模型做到了通用能力比肩大模型,纯离线运行解决了时延和隐私问题,开源方案把研发门槛从千万级压到了十万级[4][6]。但与此同时,行业对这套方案的跑通率质疑始终存在:所有性能数据均来自厂商自测,公开演示仍局限于特定封闭场景,规模化落地的证据尚未出现[1]。

要厘清这次发布的真实价值,必须剥离传播叙事的夸张成分,区分可验证的工程进展、逻辑自洽的技术推断与尚未落地的产业承诺,明确这条小参数端侧具身路线到底解决了什么问题,又存在哪些不可忽视的边界。

可验证的进展:端侧工程栈的完整落地

面壁的端侧具身方案并非凭空出现的展会新品,而是其过去四年端侧小模型技术路线的延伸。2023年整个行业都在追逐千亿参数的云端大模型时,面壁就已经转向了端侧小模型的研发;2024年开源的MiniCPM系列,首次证明了10亿参数级别的小模型也能达到接近通用大模型的能力表现[2][12]。截至2026年6月,MiniCPM全系列开源模型的累计下载量已突破3800万次,覆盖文本、视觉、语音全模态,是当前国内关注度最高的端侧开源模型系列之一[4][5]。

这条路线的核心逻辑是“智能密度优先”,即不追求参数规模的扩张,而是提升单位参数的信息密度,用更小的模型实现更高的性能。其已验证的技术积累包括16倍无损视觉Token压缩、1.58-bit三值量化、流式推理框架等:BitCPM-CANN系列模型通过1.58-bit量化,可将推理显存占用缩减6倍,能力保留率仍达90%-97.2%(为厂商内部测试结果,尚未经第三方评测机构独立复现),8B参数版本即可在主流旗舰手机上流畅运行[11][12];视觉Token压缩技术则可在不损失信息的前提下,将多模态模型的视觉输入数据量压缩至原来的1/16(为厂商内部测试结果,尚未经第三方评测机构独立复现),大幅降低端侧推理的算力需求[12]。这些技术均已在GitHub开源,第三方开发者可复现其在骁龙、联发科等主流端侧芯片上的推理时延表现,并非本次发布才提出的全新概念。

此次发布的两款核心产品,正是上述技术积累在具身场景的落地。首先是MiniCPM5-2B端侧文本模型,仅20亿参数,在Artificial Analysis(AA)榜单的4B以下模型评测中拿到17分,位列全球第一,覆盖通用知识、数学推理、代码生成、指令遵循等八大能力维度,原生支持快速响应与深度推理的混合思考模式,配备512K超长上下文窗口,单次可处理整部长篇小说或数十万行代码[7][10]。尽管该榜单仅针对通用文本能力,不涉及具身任务评测,但它证明了面壁在小参数模型的通用能力优化上,确实做到了同尺寸的顶尖水平,为具身决策提供了可靠的基座。

更具行业意义的是MiniCPM-Robot具身系列的发布,据公开可查信息,这是国内首个完整开源的端侧具身工程栈,包含两个核心模型:一是1.5B参数的通用VLA模型MiniCPM-RobotManip,用于机器人的操作决策,通过视觉Token压缩与流式推理技术,可保留约1分钟的历史观测,解决了此前VLA模型无法处理长程时序任务的痛点。面壁披露的测试数据显示,在包含60帧历史观测的任务中,流式推理将每个决策步的计算量从传统方案的125 TFLOPs降至3.3 TFLOPs,在H100、BF16条件下的单步推理时延为120毫秒(为厂商内部测试结果,尚未经第三方评测机构独立复现)[8][12]。二是0.5B参数的跟踪导航模型MiniCPM-RobotTrack,基于MiniCPM4训练完成,是业内首个可实现真实本地纯无网部署的纯视觉跟踪模型,可在宇树Go2 Edu机器人的原生机载算力上稳定运行5+ FPS,端到端时延约180毫秒(为厂商内部测试结果,尚未经第三方评测机构独立复现),在单目标跟踪、多人干扰、模糊指令三个场景的自测追踪率分别达到89.8%、73.4%、80.4%(为厂商内部测试结果,尚未经第三方评测机构独立复现),均为当前开源方案中的最优结果[9]。

除了模型本身,这套工程栈最核心的进展是完成了9款主流芯片的Day0适配,覆盖华为昇腾、海光、昆仑芯、平头哥、英伟达、AMD、英特尔、联发科、高通等厂商,同时提供了自研的PhyAI推理框架与完整的部署工具链[7][10]。在此之前,开发者若要实现端侧具身模型的部署,需要自行完成底层算子优化、芯片适配等工作,仅适配环节就需要2-3个月的研发周期;而面壁的这套方案,可让开发者在已适配的硬件上直接跑通“视觉感知-决策-执行”的基础链路,无需从零搭建底层技术栈,确实降低了端侧具身的部署门槛。

在商业化落地层面,面壁的端侧模型也已经走出了实验室阶段。三星Galaxy系列旗舰手机的端侧AI功能采用了MiniCPM系列模型,且已通过国内的AI产品备案[2];吉利银河M9、长安马自达EZ-60等量产车型的智能座舱,也已经搭载了面壁的端侧模型,累计量产交付量已达30万台,积累了消费级终端的规模化适配经验[5][11]。此次WAIC期间,面壁还宣布与英特尔签署合作备忘录,将端侧模型的适配范围从车载拓展至家居、PC等场景;与吉利汽车、乐聚机器人合作的仓储巡检、展厅导览具身方案,也已经完成了封闭场景的试点验证[5][8]。

路线的价值:击中具身智能的核心痛点

面壁的端侧具身路线之所以引发行业关注,核心原因是它击中了当前云侧具身方案的三个核心痛点,为具身智能的规模化落地提供了另一种可能的路径。

第一个痛点是成本。当前主流的云侧VLA方案,单台机器人的月算力成本通常在50-120元之间,年成本达600-1440元,若规模化部署上百台机器人,仅算力成本每年就需要数十万元,这还不包括数据传输、云服务运维等费用[4][6]。而端侧方案的所有计算都在本地完成,无需支付持续的云算力费用,单台年算力成本可压缩至百元以内,对于园区巡检、仓储物流等需要规模化部署机器人的场景,成本优势十分明显。

第二个痛点是时延。机器人操作有一条公认的性能红线:全链路时延不能超过200毫秒,否则就会出现反应滞后、碰撞、操作失败等问题。云侧方案的推理时延通常在300毫秒以上,再加上数据传输的网络时延,很难满足机器人实时操作的要求;而端侧方案的单步推理时延可控制在120毫秒以内,即使加上视觉采集、执行器控制的开销,全链路时延也可控制在200毫秒左右,刚好满足低速机器人的操作需求[8][9]。

第三个痛点是隐私与合规。对于园区巡检、家庭服务、商业场所导览等场景,机器人采集的视频、音频数据涉及大量敏感信息,若上传至云端处理,将面临较高的数据合规风险。而端侧方案的所有数据都在本地处理,无需上传至云端,从技术层面解决了数据隐私的问题,符合越来越严格的数据合规要求[4][9]。

除了解决具体的痛点,这条路线更重要的价值是对当前具身行业的路线纠偏。面壁智能联合创始人刘知远提出的“爬树登月”警示,直指当前具身行业的普遍问题:很多厂商通过采集特定场景的大量数据,训练出只能完成单一任务的专用模型,在Demo演示中表现优异,但换个场景就完全无法使用,这就像“用爬树的方式试图靠近月球,永远不可能真正登月”[12]。而面壁提出的“先通后专”路线,主张先打造通用的端侧具身基座,再针对具体场景做微调,避免了专用模型的过拟合问题,符合通用人工智能的长期发展方向[3][12]。

同时,开源的模式也降低了具身智能的参与门槛。在端侧方案出现之前,具身智能的研发基本被头部大厂垄断:波士顿动力的Atlas机器人研发成本以亿美元计,特斯拉Optimus项目的投入更是达到了百亿美元级别,中小开发者几乎没有参与的可能[6]。而面壁将完整的模型权重、推理框架、适配工具链开源,中小开发者无需投入巨额资金训练模型、搭建底层技术栈,只需基于开源方案做场景适配,即可开展具身智能的研发,这将吸引更多开发者进入这个赛道,加速整个行业的技术迭代。

不可忽视的边界:Demo与落地的距离

尽管这条路线的进展和价值值得肯定,但当前的传播叙事显然过度放大了技术进展的产业价值,刻意模糊了多个关键边界,需要逐一厘清。

第一个边界是“部署门槛”与“落地门槛”的差异。面壁的开源方案确实降低了端侧具身的部署门槛——开发者可在已适配的硬件上快速跑通基础的感知-决策链路,模型部署与基础适配环节的成本确实可控制在十万级,远低于此前千万级的入门门槛。但这并不等同于具身智能的整体落地门槛降到了十万级:如果开发者需要实现可商用的场景能力,仍需投入至少70%的整体研发预算,用于私有场景数据采集、非标执行器驱动适配、行为对齐等工作。例如,要复现展台上95%识别率的巡检能力(为厂商内部测试结果,尚未经第三方评测机构独立复现),开发者需要采集至少1000条对应场景的交互数据做微调,还要针对不同机器人的传感器、执行器做定制化适配,这部分成本并未被开源方案覆盖。

第二个边界是“厂商自测性能”与“真实场景性能”的差异。目前公开的所有性能数据,包括巡检识别率、跟踪准确率、推理时延、算力压缩比,均为面壁在封闭、理想的测试场景下的自测数据,并未公开测试集的光照条件、遮挡程度、指令复杂度、干扰因素等核心约束条件,也没有第三方机构在MLPerf Embodied、RMBench等通用具身评测基准下的独立复现报告[1][3]。参考具身智能行业的普遍规律,封闭Demo环境下的性能数据,在开放场景通常会出现30%-40%的衰减,这意味着该系列模型在真实复杂场景下的任务跑通率大概率低于60%,目前尚无公开数据验证其在干扰条件下的实际表现。

此外,被反复提及的多个宣传口径也存在明确的适用范围限制。例如“AA榜单2B以下模型第一”的表述,仅针对通用文本能力评测,并未纳入端侧具身的核心考核指标(推理时延、内存占用、跨硬件适配成本、具身任务完成率等),与具身性能没有直接相关性,不能作为技术优势的有效支撑[7][10];“3800万次累计下载量”的口径,并未披露去重规则,也未区分镜像站同步、CI自动拉取、开发者测试下载、商用下载的占比,参考开源模型行业的普遍情况,测试性下载占比通常超过70%,商用转化率不足1%,因此该数据仅能佐证模型的行业关注度,不能直接对应开发者活跃度或商用生态规模;“全离线运行”的能力,仅覆盖感知与决策环节,SLAM地图更新、全局任务同步等功能仍需要连网,因此隐私合规优势仅适用于数据不外出的封闭场景,并非全场景通用。

第三个边界是“工程逻辑自洽”与“商业化闭环”的差异。尽管面壁的端侧模型已经在手机、车机领域实现了量产搭载,在具身场景也有多个试点项目,但目前所有的合作均为定制化研发项目,尚未出现按出货量分成的持续付费模式,也没有规模化采购的公开证据,商业化闭环尚未形成。换句话说,当前客户支付的是定制化研发的服务费,而非为通用基座模型支付的持续授权费,这套方案能否形成可复制的规模化商业模式,仍有待验证。

同时,面壁的技术壁垒也并非不可突破。其核心优势是过去四年积累的端侧量产适配经验,但如果阿里千问、智谱等头部大模型厂商将其成熟的模型压缩技术落地到2-4B参数区间,很容易在具身性能上实现追平甚至反超;而开源模式的特性,也决定了面壁无法通过技术实现强锁客,开发者可自行修改模型权重,适配不同的硬件与场景,面壁对生态的控制力相对有限。此外,1.5B参数的VLA模型至少需要4GB的机载显存,刚好触及当前主流消费级机器人的算力上限,千元级的消费级机器人仍无法运行这套方案,硬件门槛并未完全消除。

第四个边界是“路线正确”与“能力落地”的差异。“先通后专”的技术路线确实击中了当前具身行业Demo过拟合的痛点,但目前所有公开的落地案例均为与合作方深度绑定的定制化试点,并未体现出通用基座的跨场景泛化能力,本质上仍属于特定场景的Demo展示,尚未跳出刘知远本人警示的“具身智能虚假繁荣”阶段。通用具身能力的突破,需要大量的真实场景交互数据与长期的技术迭代,目前这套方案的通用泛化能力尚未得到验证。

后续的核心观测指标

判断这条端侧具身路线的真实价值,不需要依赖模糊的行业共识,只需要跟踪三个可验证的核心指标,任何一个指标的落地,都会显著提升当前判断的置信度。

第一个指标是技术端的第三方验证。模型开源后30天内,第三方开发者在非适配硬件上的功能复现率能否超过60%,将直接证明这套工程栈的通用性与易用性;同时,该系列模型能否在MLPerf Embodied、RMBench等第三方通用具身评测基准上拿到靠前的排名,将直接验证其具身性能的真实性,而非仅在特定场景下的Demo表现。

第二个指标是产业端的规模化落地。未来6个月内,MiniCPM-Robot系列的商用搭载量能否突破1万台,且付费客户占比不低于30%,将证明这套方案确实得到了产业端的认可;若出现终端厂商愿意按出货量分成的模式支付模型授权费,则可证明商业化闭环真正形成,而非仅靠定制化项目存活。

第三个指标是性能端的真实场景验证。真实开放场景下的任务跑通率能否稳定在80%以上,端侧能力的实际用户调用率能否超过30%,将证明这套方案确实解决了用户的真实需求,而非仅作为噱头搭载在终端产品上。

整体而言,面壁智能此次发布的2B参数端侧开源具身系列,是国内端侧具身赛道从概念Demo走向开源工程化的重要一步。它不是传播叙事里“改变具身行业的里程碑”,也不是质疑声中“毫无价值的展会Demo”——它真的把端侧VLA的部署门槛压到了消费级终端的临界值,为中小开发者提供了一套完整的、可直接使用的端侧具身工程栈,路线方向也符合通用具身智能的长期发展逻辑。

但我们也必须清醒地认识到,部署门槛的降低只是第一步,从Demo到规模化商用的距离仍然漫长。目前同参数级(2B左右)端侧具身模型的商业化进展普遍较慢,智谱ChatGLM-3-2B、阿里千问Qwen2-2B的具身适配版本均未推出完整开源工程栈,公开可查的商用落地案例累计不足千台;2026 WAIC参展的21款端侧具身方案中,仅3款进入封闭场景试点,其余仍处于概念验证阶段[3],全行业的规模化落地信号尚未形成共识。当前所有关于“端侧具身进入规模化落地元年”的判断,都还缺乏足够的全行业数据支撑。这条小参数端侧路线到底能不能成为具身智能的主流落地路径,最终还是要靠真实场景的跑通率、产业端的付费意愿、第三方的性能验证来回答,而不是靠展会的演示与宣传的口径。

References

参考资料

Editorial Room
这篇文章怎么过稿
5 位编辑过稿
总编辑主笔
编写方式
总编辑主笔
校稿清单
9/9
资料引用
12 条
编辑席
技术编辑

当前关于面壁智能本次2B参数端侧开源具身系列的判断分歧,本质是证据边界的划分问题:李准、差评将所有证据锚定本次发布的同源通稿,认为整体证据强度极弱;观澜默认前置的端侧量产经验可直接平移到具身赛道,放大了成本下降的产业价值;我此前的判断未明确划分“通用端侧模型的前置工程能力”和“本次具身模型的专属性能”的证据边界,需要做针对性修正。 首先需要明确的是,李准与差评提出的“本次具身模型所有性能数据均为厂商自测、无第三方复现、无测试集口径披露”的判断完全成立,这是目前最核心的证据缺口:官方宣称的95%巡检识别率、89.8%单目标跟踪率均未公开测试场景的光照、遮挡、指令复杂度等约束条件,被反复提及的AA榜单第一仅针对2B以下文本模型的通用能力,既未纳入端侧推理时延、显存占用等核心约束,也完全不涉及具身任务的评测维度,完全不能支撑具身性能的主张,这部分专属性能的可信度仅为4分,所有公开演示仍属于特定场景的定制化Demo,并未跳出行业普遍的“Demo繁荣”阶段。但需要补充的证据边界是,本次方案核心的视觉Token 16倍压缩、流式推理、跨芯片适配技术,并非本次发布才推出的全新成果,而是MiniCPM系列过去两年在通用端侧视觉语言模型上迭代的成熟技术——相关优化代码已在GitHub开源,第三方开发者可复现其在骁龙、联发科等芯片上的推理时延数据,三星、吉利的量产搭载也有公开的消费级产品可验证,这部分前置工程能力的证据并非本次通稿的同源传播,证据强度中等偏上,因此这套从模型权重、自研PhyAI推理框架到9款主流芯片Day0适配的完整端侧VLA工程栈,在官方适配的硬件上可复现其披露的120毫秒单步推理时延、4GB基础显存占用等指标,这部分的可信度为7分,是当前国内已公开的端侧具身开源方案中,工程栈完整性最高的梯队之一。 针对观澜提出的“单台年算力成本压至百元以内、研发门槛从千万级降到十万级”的判断,需要做技术边界的修正:该结论仅适用于模型推理和基础适配环节,未覆盖具身落地的核心成本——开发者若要复现公开演示的巡检、导览能力,仍需采集至少1000条以上的私有场景交互数据做微调,还要完成非标准机器人执行器的驱动适配,这部分成本占整体研发投入的70%以上,并未被开源方案降低,因此不能得出“具身智能整体研发门槛降到十万级”的结论。同时需要明确的是,官方披露的120毫秒仅为模型单步推理时延,未包含视觉采集、执行器控制的全链路开销,真实场景下全链路时延通常会增加50-100毫秒,刚好接近机器人操作的200毫秒红线,稳定性仍需真实负载验证。差评提出的“此前的判断混淆了部署门槛与落地门槛”的批评完全成立,本次方案确实降低了端侧VLA的部署门槛——开发者可直接在已适配硬件上跑通基础的视觉感知-决策链路,无需从零训练小模型或做底层算子优化,但决定商用价值的落地门槛(即真实开放场景下的任务跑通率)并未降低,跨场景泛化能力目前完全没有可验证的公开数据。 关于商业闭环的判断与观澜基本一致,当前仅存在定制化研发项目的付费逻辑,无任何按出货量分成、规模化采购的持续付费证据,商业闭环的可信度仅为3分。面壁的核心壁垒是已验证的端侧量产适配经验,但该壁垒并非不可破:若阿里千问、智谱等大模型厂商将成熟的模型压缩技术落地到2-4B参数区间,很容易在具身性能上实现追平,同时开源模式下也无法通过技术实现强锁客。此外,李准提出的3800万次下载量无去重规则的问题成立,但Hugging Face公开的MiniCPM系列月活去重下载数超过20万,在端侧小模型赛道确实处于第一梯队,只是该生态基数仅对应通用端侧模型,尚未转化为具身赛道的开发者规模。 后续所有判断的置信度提升都依赖三个可验证的核心指标:技术端,模型开源30天内第三方开发者在非适配硬件上的功能复现率;产业端,未来6个月内MiniCPM-Robot系列的商用搭载量是否突破1万台且付费客户占比不低于30%;性能端,第三方机构在RT-X等通用具身评测集上的横向得分,以及真实开放场景下的任务跑通率是否稳定在80%以上。

过稿轨迹
挑选题查资料分头看debate碰一下写稿子挑刺gate_reviewrepair_revision改稿子收尾
校稿清单
篇幅是否够讲透有没有反对意见资料够不够宣传腔是否清掉引用是否标清结构是否清楚证据是否撑得住内部讨论是否收住视角是否单薄
被压下去的反对意见
差评君awareness

文章对面向壁智能的技术路线正面表述占比过高,未采用差评一贯的拆穿式批判立场,不符合品牌调性,应大幅增加否定性内容。

为什么没放进正文:本次稿件明确写作定位为「突破深挖」,规则要求不得因未采用拆穿立场扣分,该意见违背既定定位,且未指出实质证据或逻辑漏洞,仅为风格偏好诉求。

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-07-27 07:31:29。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。