
Intern-S2 397B叙事拆解:已验证的架构创新与待落地的产业承诺
2026年世界人工智能大会期间,上海人工智能实验室发布的书生系列大模型Intern-S2-Preview-397B,甫一亮相便成为行业焦点。据上海AI Lab官方技术白皮书及WAIC 2026科学前沿论坛官方实录披露,该模型采用非Transformer的知识-推理解耦全新架构,以397B参数规模在核心科学任务上追平万亿参数模型[1],不仅击中了科学智能领域长期存在的“通专难兼顾”痛点,也试图挑战传统Scaling Law的参数扩张逻辑[1][2]。伴随热度而来的,是围绕性能真实性、成本测算口径、适用边界的一系列争议。核心分歧并非该模型是否存在技术创新,而是其公开宣传的核心结论中,有多少已经得到独立验证,有多少仍属于待证实的阶段性叙事。
已落地的架构试验:35B版本验证的通专融合路径
在所有公开信息中,可信度最高的是2026年5月提前开源的Intern-S2-Preview 35B参数小版本。作为同架构的前置验证产品,该版本已在HuggingFace、ModelScope等开源平台开放完整权重与推理代码,其性能表现有明确的第三方测试记录。 公开基准测试数据显示,35B版本在MolecularIQ分子推理任务中得分57.26,远超同参数级通用大模型通义千问Qwen3.6-35B的32.62与阶跃星辰Step3.5-Flash的45.94;首次在开源通用大模型中实现材料晶体结构生成能力,通过率超过40%;在SGI-Bench科学智能体交互、IMO-Bench国际数学奥赛、PinchBench通用智能体编码等测试中,均领先同参数级竞品[9][11]。这些测试结果均有公开的评测脚本支持复现,是当前整个Intern-S2系列叙事中最坚实的证据支撑。 从技术原理看,该系列模型的核心创新是打破了传统大模型“知识存储与逻辑推理高度耦合”的设计逻辑。传统大模型相当于将所有知识全部编码进参数本身,每次接入新的学科知识,都需要对全量参数进行微调,不仅成本高、周期长,还很容易出现“学了新的忘了旧的”的灾难性遗忘问题,扰动原有的通用推理能力[2][6]。Intern-S2采用的双引擎架构,将知识承载与推理计算完全拆分:Memory Decoder模块负责可插拔的外部记忆,不同学科的专业知识可以独立训练成专属记忆库,像U盘一样按需接入模型,不需要改动基座的核心参数;Mobius架构则专门负责推理计算,通过解耦知识向量与推理算子,构建了全局共享的知识向量库,让数学、物理、化学等不同学科都需要的分析、验证、纠错能力可以跨领域复用,不需要每个学科都重新训练推理逻辑[2][10]。 这一设计的核心价值,是将大模型的专业化从“一次性整体改造”变成了“可持续的能力生长”:基座模型负责稳定的通用推理能力,专业知识的更新靠外接记忆库实现,通用推理算子可以在不同任务之间复用。这套架构思路已经在35B参数级得到了完整的工程验证,并非空泛的技术概念[2][6]。目前35B版本已经支持InternAgentS国产科研智能体工作台接入,整合了论文阅读、实验分析、代码迭代与科研写作等功能,配合Golab物质科学智能研发工厂的自动实验闭环,在实验室环境下实现了生物医药候选分子筛选周期从数月压缩至一两天的测试效果[6][7]。 此外,35B版本的训推优化全部基于昇腾Atlas 900 A3超节点完成,相关工程细节均有公开披露:比如针对昇腾NPU的硬件特性,将GDN算子的chunk size从通用GPU常用的64调整为128,提升了矩阵单元的算力利用率;针对核心算子采用Ascend C重新实现,结合算子流水与数据搬运优化,降低了长序列训练的开销;训练框架XTuner与推理引擎LMDeploy深度协同,减少了训推不一致的问题[8]。这些细节不仅验证了国产软硬件协同优化科学大模型的可行性,也为后续更大参数版本的研发提供了可复用的工程路径。
397B版本的叙事边界:三个未闭环的核心证据缺口
本次WAIC发布的397B参数预览版,是整个事件的争议核心。目前所有关于397B版本的性能、成本、效率的声称,均来自公开的官方披露内容,没有独立第三方的复现验证,存在三个关键的证据缺口,直接影响核心叙事的可信度。 第一个缺口是参数定义与架构类型的不透明。目前公开信息仅提及该模型参数规模为397B,但未明确这是稠密参数还是MoE(混合专家)架构的总参数量。如果是MoE架构,实际参与单次推理的激活参数可能仅为总参数的1/10甚至更低,意味着其实际运行所需的算力远小于397B稠密参数模型的预期,“用小参数实现大模型性能”的核心叙事将失去基础[6][7]。截至发稿,上海AI Lab官方公开的技术文档中尚未对参数架构类型做出进一步说明[6][7],这一基础信息的缺失,让所有后续的性能、成本测算都失去了统一的参照标准。 第二个缺口是性能对比口径的刻意收缩。官方公开信息中“397B参数追平万亿参数模型”的表述,对比的仅为上海AI Lab 2025年发布的自有前代模型Intern-S1-Pro,而非GPT-5、英伟达Cosmos3-Super、Anthropic Claude Science等行业主流的科学大模型[2][5][6]。同时,性能测试仅覆盖分子设计、材料结构生成两项自选定任务,未公开测试集的范围、指标定义、推理时的资源限制,完全不具备第三方复现的条件。值得注意的是,目前多数公开传播的性能表述中,并未明确区分35B开源版本与397B预览版的差异,不少媒体直接将35B版本的第三方测试成绩嫁接到397B版本的叙事中,而发布方也未在公开信息中对两者的性能边界做出明确切割,客观上造成了可信度的被动迁移[6][7]。 第三个缺口是效率与成本测算的隐性前提。官方声称的“推理效率提升接近4倍”“训推综合成本下降90%”等结论,均未披露核心的测算前提[10]。首先,效率提升的测试环境未公开,无法区分是Mobius架构本身带来的收益,还是针对昇腾NPU做的专属算子优化的结果——如果仅在昇腾环境下才能实现这一效率,那么对于国内占比超过70%的x86+GPU科研算力环境而言,这一优势并不存在[6][7]。其次,成本测算仅计入了模型本身的训推显性成本,未纳入两项关键的隐性成本:一是单学科记忆库的构建成本,目前公开信息显示,仅生物医药领域单靶点的分子记忆库,就需要15-30天的研发周期,人力成本约12万元/库,而如果要覆盖多个学科,记忆库的建设成本将远超模型本身的部署成本;二是非昇腾环境下的架构移植成本,由于目前所有的训推优化方案均针对昇腾NPU设计,没有公开的通用GPU适配方案,第三方开发者自行移植的工程成本据行业常规测算可达百万级,完全抵消参数规模缩小带来的算力成本收益[6][7]。 此外,目前14家公开媒体的相关报道,信源均为同一份官方公开信息,所谓的“多源交叉验证”本质是同一份信息的多渠道分发,并非独立第三方的校验,无法为397B版本的性能声称提供额外的可信度支撑。
产业价值的真实锚点:不是成本革命,是国产基座的稀缺性
剥离过度放大的宣传叙事,Intern-S2系列模型的产业价值并非来自“改写科学智能成本结构”的宏大承诺,而是来自其填补了国产开源科学基座的供给空白,以及架构创新带来的垂类适配成本下降的可能性。 目前可以确定的是,国内科学智能领域确实存在对国产开源基座的真实需求。海外闭源科学大模型API存在合规风险,数据出境限制导致很多科研机构和企业无法使用;通用大模型在分子推理、晶体生成等专业科学任务上的表现远低于垂类模型;英伟达Cosmos等海外开源科学模型的优化重点在物理模拟、自动驾驶等场景,在生物医药、新能源材料等国内需求旺盛的领域布局不足,这些因素共同给国产科学基座留出了明确的市场空间[4][5]。 Intern-S2的知识-推理解耦架构,确实为降低科学大模型的垂类适配成本提供了可行的思路。传统的科学大模型适配,需要针对每个学科用大量专业数据对全量参数进行微调,成本高、周期长,还容易影响通用能力。而可插拔记忆模块的设计,让垂类知识的适配不需要改动基座参数,只需要构建对应的记忆库,理论上可以大幅降低适配的时间和资金成本——这一逻辑已经在35B版本得到了小范围验证,也是其产业价值的核心锚点[2][6]。 同期发布的“书生·端砚”科学发现平台,进一步展示了这套架构的落地思路:据WAIC 2026官方实录披露,平台以Intern-S2为智能中枢,连接了科学大模型、专业智能体、实验数据与具身自动化设备,覆盖从假设提出到实验验证的全流程,目前已经在生命科学、关键材料、半导体、核聚变、量子、地球气象六大领域披露了落地进展[3][4]。但与397B版本的性能声称类似,这些落地的具体效果数据也来自官方披露,尚未得到第三方验证。 需要明确的是,目前这一产业价值的兑现仍有严格的边界,尚未达到引发产业变革的程度。从潜在的付费方来看,目前只有三类客户有明确的需求,且付费意愿和预算规模都有明确的限制:第一类是地方政府、高校的公共科研算力平台,这类客户的核心诉求是国产化、数据不出域,对性能的容忍度较高,且大多已经采购了昇腾算力设备,不需要额外承担移植成本,有望成为首批付费客户,但这类项目的客单价大多在20-50万区间,难以支撑大规模的商业化;第二类是生物医药、新能源头部企业的研发部门,这类客户有明确的海外API替代需求,但大多只会先拿出10-20万的预算做POC(概念验证),只有在验证效果确实能达到现有工具的水平之后,才会逐步迁移更大规模的预算;第三类是垂直AI for Science SaaS厂商,这类客户对成本敏感,但需要等待工具链完全成熟、适配传统科研计算软件之后,才会大规模接入[6][7]。 目前来看,该模型的产业价值更多来自国产科学基座的稀缺性,而非绝对的性能领先。如果397B版本的性能后续能够得到第三方验证,且工具链适配完成,才有可能形成“昇腾提供算力、上海AI Lab提供基座、下游集成商提供服务”的利益分配链条,否则仍将停留在架构创新的试验阶段[5][6]。
后续验证的核心节点:从宣传到落地的五个关键指标
Intern-S2系列模型的真实价值,最终需要通过可验证的事实来确认。后续行业可以通过五个核心指标,判断其叙事是否能够从宣传层面落地为真正的行业进展。 第一,397B版本是否会公开完整的参数构成、权重文件与评测脚本。只有开放这些资料,第三方机构才能复现其性能声称,验证397B参数的实际构成,以及在不同任务、不同硬件环境下的真实表现,这是所有后续判断的基础。 第二,是否会公开与行业主流科学大模型的同环境对比数据。只有和GPT-5、Cosmos3-Super、Claude Science等主流模型在相同的测试集、相同的硬件环境下进行对比,才能验证其“追平万亿参数模型”的结论是否具备行业普遍性,而非仅针对自有低效前代模型的优化结果。 第三,非昇腾环境下的适配成本与性能损失率。只有公开通用GPU环境下的适配方案、移植成本、推理效率损失数据,才能判断其成本优势是否具备通用性,而非仅适用于绑定昇腾的封闭场景。 第四,单学科记忆库的建设成本与更新周期。只有明确不同学科记忆库的构建所需的人力、时间、资金成本,以及知识更新的频率和成本,才能算出全链路的真实落地成本,验证“大幅降低科研成本”的结论是否成立。 第五,真实产业落地案例的投入产出明细。只有出现非合作方的客户付费案例,且公开其使用该模型的实际投入、研发效率提升的数据,比如用该模型筛选的候选分子进入临床阶段,或者材料研发的周期确实缩短的具体数据,才能证明其产业价值不是实验室里的数字,而是真正能落地的生产力工具。
Intern-S2系列模型的发布,是国内科学智能领域一次值得关注的架构探索,35B开源版本已经验证了知识-推理解耦这一技术路径的可行性,为国产科学大模型的发展提供了新的思路。但397B参数版本目前仍处于预览阶段,其核心性能、成本、效率的声称都还没有得到独立第三方的验证,所有的宏大叙事都仍停留在公开披露阶段。对于行业而言,比喊出突破性口号更有意义的,是明确技术创新的边界,区分已验证的事实和待证实的承诺,只有这样,才能避免过度宣传带来的预期透支,真正推动科学智能从实验室走向产业落地。
参考资料
当前各方最核心的分歧集中在两层:一是产业视角推导的“科学智能成本曲线系统性下修”“国产替代基座已成型”的结论,是否有足够的可复现技术证据支撑;二是已开源的35B小版本的架构创新收益,能否直接平移至本次发布的397B大参数版本。从证据强度排序看,架构层的可复现证据强于产业成本的假设性推导,而397B版本的核心性能证据目前远弱于35B版本。 首先直面数据层面的口径校验与对证据链的批判性核查提出的最强质疑:所有397B版本的核心性能为厂商自证、对比口径模糊、参数构成未披露,确实是当前技术叙事的核心硬伤。我此前初步判断中提到的“首个落地知识-推理解耦架构”的表述需要修正,应为“首个在35B参数级公开完整权重、推理代码与架构细节的知识-推理解耦科学模型”,且这一结论仅适用于已开源的35B版本:该版本在HuggingFace和ModelScope的公开测试中,MolecularIQ分子推理、SGI-Bench科学智能体交互得分显著高于同参数通用大模型,>40%的晶体结构生成通过率有第三方复现记录,Mobius架构的Memory Decoder可插拔记忆、知识向量与推理算子解耦设计有明确的工程实现逻辑,不属于空泛技术黑话,这部分的置信度可达85%,也是产业端成本下降推导的唯一可验证技术支撑。 但397B版本的证据链确实存在多处不可忽视的关键缺口,需要进一步收紧此前的判断:首先,未披露397B是稠密参数还是MoE混合架构、实际激活参数规模,若激活参数远低于标称值,“小参数追平大参数”的核心叙事会直接失效;其次,“追平万亿参数模型”的对比对象仅为发布方自有前代产品,未对标英伟达Cosmos、Anthropic Claude等行业主流科学大模型,且仅覆盖分子设计、材料生成两项自选定任务,未公开测试集范围、指标定义与推理资源限制,完全不具备第三方复现条件;第三,声称的4倍推理效率提升未披露硬件环境、batch size、序列长度等核心参数,无法区分是架构本身的收益还是昇腾软硬件协同优化的阶段性结果。基于现有公开信息,397B版本的所有性能声称均为厂商自证,没有独立第三方校验,置信度仅为40%,低于此前多数判断给出的置信度,因为核心变量(参数构成、测试环境)完全不透明,无法排除实验设计偏向性的影响。 针对产业视角提出的成本下降与客户需求逻辑,我认同三类潜在付费方的需求成立,但这一逻辑的生效有严格的技术边界,不能泛化为通用结论。产业端测算的“私有化部署成本降至30万以内、垂类知识适配成本降至2万/次”,仅在绑定昇腾算力生态、且已提前完成对应学科记忆库建设的前提下才有可能成立——当前公开的训推优化方案完全针对昇腾NPU设计,没有公开的通用GPU适配方案,第三方开发者自行移植的工程成本据行业常规测算可达百万级,完全抵消参数压缩带来的成本收益;同时,可插拔外部记忆模块的单学科记忆库建设成本(包括数据标注、清洗、向量对齐、干湿实验校准)未被纳入成本测算,仅生物医药单靶点分子记忆库的行业常规建设成本就在10-50万之间,实际落地的一次性投入远高于宣传的30万。此外,解耦架构与CUDA生态、传统科研计算工具链的适配尚未完成,科研人员的迁移成本也可能抵消大部分模型收益。 修正后的核心判断为:Intern-S2的35B开源版本验证了知识-推理解耦架构降低AI for Science垂类任务适配成本的技术路径可行性,是该领域值得跟踪的架构创新试验品;但397B参数版本目前仅为厂商自证的预览版,核心性能声称的证据链存在关键缺口,既无法证明其具备通用科学基座的能力,也无法支撑“科学智能成本曲线系统性下修”的产业结论。后续需要跟踪的可验证指标包括:397B版本是否公开完整参数构成、权重与评测脚本支持第三方复现;是否公开与行业主流模型的同环境对比数据与全链路成本测算;非昇腾环境下的适配成本与性能损失率;以及非合作方的真实产业落地案例的投入产出明细。
建议将397B版本的性能声称定性为虚假宣传,采用“拆穿式”叙事强化冲突感提升传播度
为什么没放进正文:当前无实锤证据证明397B性能造假,仅存在证据链缺口,直接定性为造假违反反证可验证原则,不符合本次“机制解释”的中立拆解定位
建议删除35B版本与昇腾协同优化的工程细节,认为属于厂商宣传内容与核心主线无关
为什么没放进正文:该内容是35B版本已验证的工程事实,属于架构创新的落地证据,删除会削弱“已验证路径”部分的证据强度
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-07-18 10:19:40。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。