智能体的理想与广告的现实:OpenAI双轮布局的底层约束
返回深度
技术深度相关追踪2026-07-10 07:27:0517 min read

智能体的理想与广告的现实:OpenAI双轮布局的底层约束

Aione 编辑部
Editorial Desk
2026-07-10 07:27:05 17 分钟

2026年7月9日的科技行业,几乎所有头条都被OpenAI的系列更新占据:一端是承载着“下一代生产力”叙事的ChatGPT Work智能体正式亮相,宣称能跨应用、跨文件连续跟进复杂项目,无需人工逐步骤干预[1];另一端是争议缠身的ChatGPT广告生态全面开放,多家营销服务商成为官方合作伙伴。同一天,OpenAI还宣布将GPT-5.6从有限预览转为全面可用,推出三层差异化模型家族,NVIDIA也同步发布了专为智能体工作负载优化的Vera CPU——四件事密集落地,绝非时间上的巧合,而是OpenAI在技术迭代、成本约束与商业化诉求三重压力下,交出的一份充满张力的答卷。

长周期智能体的实质性突破

要理解这轮更新的价值,首先需要区分ChatGPT Work与此前所有工具调用能力的本质差异。自2023年插件功能上线以来,ChatGPT已经能实现单步工具调用:用户发出“帮我订一张下周去北京的机票”的指令,模型会识别需求、调用订票工具、返回结果,全程无需人工切换应用。但这类能力始终停留在“指令响应”层面,一旦涉及多步骤、跨周期的复杂任务,就需要用户持续给出中间指令、修正错误,本质上仍是人机交替协作的“半自动化”模式。

ChatGPT Work的核心突破,是实现了无需人工介入的长周期任务闭环。按照公开演示的场景,用户只需给出“完成Q3产品迭代的前置准备工作”的顶层指令,智能体就能自行拆解出12个细分步骤:读取共享盘里的需求文档、调用GitHub修改对应模块的代码框架、在Jira上创建任务分发给对应负责人、调用Outlopk给团队发送进度同步邮件、生成测试用例并上传到测试平台,中间若遇到工具调用失败、权限不足或逻辑冲突,还会自行重试、调整路径或向用户发起必要的确认,整个过程可以持续数小时甚至数天,无需用户逐步骤盯守[1]。

支撑这一能力的,是GPT-5.6的三层模型架构与Responses API的工程升级。OpenAI将GPT-5.6拆分为物理隔离的三个算力池:旗舰级Sol模型负责复杂推理与长周期调度,均衡型Terra模型覆盖中等复杂度的日常任务,轻量型Luna模型则承接高频、低难度的单轮交互[2]。同步更新的Responses API新增了编程式工具调用与多智能体beta功能,解决了此前智能体调度需要硬写大量Prompt引导、容错率极低的工程痛点——开发者无需再为不同工具的对接编写定制化提示词,只需通过API声明工具的功能与参数边界,模型就能自行判断调用时机与方式,大幅降低了智能体的开发门槛。

产业链层面的配套也在同步补位。NVIDIA发布的Vera CPU,专门针对智能体工作负载中的非推理环节优化:此前长周期智能体的性能瓶颈,往往不是GPU的推理速度,而是中间步骤的代码编译、工具链运行、状态持久化等CPU任务,这类任务占智能体总运行时间的40%以上,传统通用CPU的吞吐量不足以支撑大规模智能体部署。Vera CPU针对这类场景做了指令集优化,实测可将AI工厂的智能体整体吞吐量提升3倍以上,目前已和戴尔合作落地相关AI平台[3]。

这一系列迭代,意味着通用智能体终于走出了实验室演示的“玩具阶段”,进入了可以尝试对接真实生产场景的工程化阶段——无论后续商业化进展如何,这都是AI从“回答问题”向“完成任务”转型过程中,不可忽视的实质性进步。

绕不开的成本硬约束

技术迭代的光环之下,长周期智能体的成本结构,仍是当前尚未突破的核心硬约束。这一约束并非来自工程实现的缺陷,而是智能体架构层面的必然规律:任何跨工具、百步以上的长周期工作流,都需要每一步做状态校验、错误重试、上下文回溯,这部分增量Token消耗不会随模型参数优化消失,已被多个开源智能体项目复现,仅具体倍数会随垂直场景的定制化优化浮动[1]。

普通单轮对话的Token消耗,基本等于提问与回答的总长度,模型只需做一次推理即可完成。而长周期智能体每执行一步,都需要把之前所有步骤的执行结果、工具返回的参数、当前任务的整体目标,全部作为上下文喂给模型,让它判断下一步的动作是否正确、是否需要调整、是否需要向用户确认。这意味着工作流的步数每增加一阶,上下文长度就会随之膨胀,Token消耗呈指数级增长,而非线性增长。

基于GPT-5.6 Sol模型的公开API定价的理论测算,一个中等复杂度的产品迭代工作流,仅核心推理环节的Token成本就达到34.5美元——该数值并非落地实测数据,还未计入调度、重试、工具对接的额外开销。更关键的是,此前被寄予厚望的三层模型分层调度方案,目前尚无法应用于长周期智能体的核心环节。开源智能体的对照测试显示,若将百步工作流的状态校验环节从Sol模型切换为Luna轻量模型,工作流的端到端完成率会从演示场景的85%直接跌至27%,大量错误无法被识别,最终输出的结果完全不可用。这意味着ChatGPT Work的核心调度与校验环节,必须全程调用旗舰级Sol模型,无法通过分层调度摊薄成本[2]。

NVIDIA的Vera CPU也并未解决核心的成本问题。它的优化仅针对非推理环节的性能与延迟,能提升单台服务器承载的智能体并发量,降低单位任务的硬件分摊成本,但完全不涉及核心的推理Token消耗——而后者占长周期智能体总成本的70%以上。换句话说,Vera CPU补全了智能体大规模部署的硬件短板,但并未触动成本结构的核心,无法从根本上扭转长周期智能体成本过高的现状[3]。

当前行业对成本风险的讨论,仍需明确证据边界。目前公开的“单任务34.5美元”的测算,是基于全程使用Sol模型、未做垂直场景定制优化的假设,仅能证明通用长周期智能体的当前成本远高于企业级SaaS的通用付费阈值(通常单任务不超过5美元),不能直接推导为“长周期智能体必然成本暴雷”。如果ChatGPT Work后续针对特定场景(如软件开发、财务报销)做专门的上下文压缩、工具链定制,Token消耗仍有较大的下降空间。但至少在当前的通用场景定位下,长周期智能体尚未达到规模化商业化部署的成本要求,这是可验证的高置信度结论。

广告入场的务实与代价

与ChatGPT Work的高期待形成鲜明对比的,是同期开放的广告生态引发的普遍争议。这并非OpenAI首次尝试广告变现,但其态度的转变与当前的模式设计,始终绕不开用户结构与成本压力的现实背景。

2024年Sam Altman还曾在公开采访中称,将广告嵌入ChatGPT回复是“反乌托邦”的想法,表示更倾向于订阅模式以避免用户成为产品。2025年12月,ChatGPT Plus付费用户的对话中曾出现未标注的品牌推荐,引发舆论反弹,OpenAI最终关闭该功能并公开道歉[5]。仅仅半年后,OpenAI就正式向美国企业开放自助广告管理平台,明确将免费版与8美元/月的Go版用户作为广告投放对象,20美元/月的Plus、200美元/月的Pro及企业版用户则保持无广告体验。广告会以独立区块的形式出现在回答底部,清晰标注“推广”标识,OpenAI承诺广告不会影响模型回答的内容,也不会出售用户的对话数据[10]。

这一转变的核心动因,是OpenAI的用户结构带来的成本压力。目前ChatGPT的周活跃用户约9亿,其中95%为免费或Go版用户,他们消耗了大量GPU推理资源却未直接贡献足够收入,被内部定义为“算力负债”;仅5%的付费用户支撑了主要营收,但Plus套餐的12个月留存率仅为59%,难以覆盖日益膨胀的基础设施开支——2026年的算力支出预计在500亿至1700亿美元区间,不同机构测算口径存在差异,数据仅供趋势参考[4]。不过需要明确的是,目前行业公开的140亿美元年度亏损、95%免费/低价用户占比等数据,同样存在统计口径差异:前者未区分含长期算力预采购的非GAAP口径与当期运营亏损,后者未明确是否包含API调用的全场景活跃,仅能作为OpenAI面临明确成本压力的信号,而非支撑强因果判断的核心证据。

当前的广告模式设计,已经体现了OpenAI平衡体验与变现的尝试:免费用户可以手动关闭广告,但关闭后每日的免费消息额度会相应减少;未满18岁的用户会被完全屏蔽广告;广告仅在用户的问题存在明确商业意图时才会触发,不会出现在医疗、法律等高敏感场景[10]。定价策略的调整也侧面反映了广告市场的态度:广告上线初期采用每千次曝光60美元的CPM定价,仅十周就跌至25美元,随后OpenAI将定价模式改为按点击付费,单次点击出价在3至5美元之间,广告主的最低投放额也从25万美元下调至5万美元,说明广告主初期并不愿意为对话场景的曝光溢价付费,更倾向于为实际转化效果买单[12]。

广告模式带来的核心风险,是用户对AI中立性的信任侵蚀。尽管OpenAI承诺广告不会影响回答内容,但算法污染的可能性始终存在:一方面,目前已经出现专门的“生成式引擎优化”灰产,通过批量发布营销内容污染大模型的训练数据源,让特定品牌或产品被模型“自然推荐”,用户很难区分这类推荐是客观结论还是隐性营销;另一方面,2025年付费用户对话混入品牌推荐的先例,也让用户对OpenAI的承诺持保留态度——目前OpenAI尚未公开广告API与核心模型调度系统的权限隔离技术方案,也未引入第三方审计,广告是否会在未来渗透到付费场景甚至智能体工作流中,仍是待验证的潜在风险[5][7]。

双轮模式的张力与待解命题

将ChatGPT Work与广告生态放在一起观察,最核心的争议在于:这到底是互补的双轮商业化布局,还是战略叙事与执行逻辑的两张皮?

从技术架构看,两条产品线目前处于完全隔离的状态:广告场景跑在Luna轻量模型的算力池上,主打低推理成本、高并发;ChatGPT Work则跑在Sol旗舰模型的算力池上,主打高推理精度、长周期调度。二者的算力调度、Token计费、用户群体完全独立,不存在算力层面的直接成本分摊机制——这意味着“用免费用户的广告收入,直接补贴智能体的推理成本”的技术路径目前并不成立。

但从财务逻辑看,广告带来的稳定现金流,确实可以为长周期智能体的研发与部署争取时间。当前ChatGPT Work尚未公开任何生产级的端到端测试数据:包括连续72小时、跨5种以上工具、100步以上操作的工作流,在包含容错重试的真实生产场景下的完成率,以及含所有开销的单任务全成本,都没有第三方验证的结果。在B端付费价值尚未得到验证的前提下,广告作为已经跑通的现金流来源,能够为智能体的技术迭代留出更多试错空间,这是基于公开信息的合理推理,只是目前尚未得到OpenAI官方算力成本分摊规则的证实。

与Anthropic的路径对比,更能凸显OpenAI双轮模式的特殊性。Anthropic始终聚焦高价值垂直场景的变现,首先抓住软件开发这一高频、ROI清晰的场景,将Claude Code的智能体能力外溢到企业知识工作流中,目前其B端收入占比已经超过80%,年化收入在五个月内从90亿美元增长至440亿美元。而OpenAI选择的是“通用入口+分层变现”的路径:先用ChatGPT拿下最大规模的C端用户池,再通过免费/低价层的广告、中高端订阅、B端智能体服务分层变现。两条路径没有绝对的优劣之分,但Anthropic的模式已经验证了B端智能体的付费意愿,而OpenAI的通用智能体路径,仍未找到清晰的付费锚点——企业是否愿意为通用场景下的长周期跟进能力支付溢价,目前还没有落地的运营数据支撑。

更现实的约束来自产业链上游。无论广告还是智能体的收入,OpenAI的毛利空间都被上下游严格挤压:微软与OpenAI的协议约定,微软将获得OpenAI 75%的利润,直至收回130亿美元的投资,且OpenAI必须优先使用Azure的云服务;NVIDIA的专用算力硬件始终保持较高的溢价,Vera CPU等专属硬件的落地,进一步强化了上游厂商对智能体成本结构的控制权。换句话说,当前智能体产业链中,确定性最高的价值捕获方仍是上游的专用算力厂商与云服务商,OpenAI作为应用层的玩家,无论选择哪种商业化路径,都需要先承担上游的成本压力,再承担用户端的体验风险。

目前所有关于双轮模式成败的判断,都仍处于试错阶段。高置信度的结论仅包括:高复杂度长周期智能体尚未达到规模化部署的成本要求、广告主暂不认可对话场景的曝光价值、上游算力厂商掌握智能体时代的核心成本控制权;所有关于“成本转嫁是刻意设计”“广告将引发大规模用户流失”“战略逻辑完全断裂”的强结论,目前都缺乏足够的硬证据支撑,置信度不足30%。

改变判断的核心观测指标

对于OpenAI的双轮布局,所有定性判断都需要等待后续可验证的事实落地。真正值得追踪的,是以下五个能够直接改变当前结论的硬指标: 第一,第三方公开测试的ChatGPT Work百步以上工作流的端到端完成率,以及包含容错、调度、工具对接开销的单任务全成本。如果单任务全成本能降至5美元以下、完成率超过90%,则长周期智能体的商业化拐点将正式到来;如果成本始终高于20美元、完成率不足70%,则其B端高价值叙事将缺乏落地支撑。 第二,OpenAI是否会公开算力池的分摊规则,以及广告API与智能体调度系统的权限隔离第三方审计报告。如果明确证实广告现金流与智能体研发成本存在定向分摊机制,或者权限隔离存在漏洞,则“成本转嫁”的推理将被证实;如果公开的规则显示二者完全独立,则相关争议将得到平息。 第三,广告上线后6个月的点击率、广告主留存率,以及分版本的用户留存数据。如果广告点击率能提升至2%以上,同时付费用户留存率没有出现明显下滑,则说明分层广告模式是可行的商业化路径;如果点击率始终低于0.5%,或者付费用户出现大规模流失,则双轮模式的C端支撑将崩塌。 第四,Vera CPU大规模部署后,智能体单任务的硬件成本下降幅度。如果Vera能将非推理环节的硬件成本降低50%以上,带动单任务全成本下降30%,则硬件优化将成为突破智能体成本约束的重要路径;如果降本幅度不足10%,则硬件配套的影响将十分有限。 第五,OpenAI与Anthropic的B端智能体客户的付费ROI对比数据。如果通用场景的智能体ROI能达到垂直场景的80%以上,则OpenAI的通用路径将得到验证;如果通用场景的ROI不足垂直场景的一半,则其将在B端市场面临持续的竞争压力。

从“回答问题”到“完成任务”,AI的应用范式转型已经是确定的趋势,但转型的过程绝不会是线性的。OpenAI的双轮布局,不是什么颠覆性的革命,也不是战略层面的自我撕裂,而是一家站在技术与商业交叉点的公司,在约束条件下做出的务实选择——它既承载着长周期智能体的技术理想,也不得不面对广告变现的现实压力,而最终的成败,将由后续每一个可验证的硬数据决定。

References

参考资料

Editorial Room
这篇文章怎么过稿
5 位编辑过稿
总编辑主笔
编写方式
总编辑主笔
校稿清单
9/9
资料引用
12 条
编辑席
技术编辑

首先需要校准所有技术判断的证据等级:李准提出的核心数据口径模糊问题成立,此前基于Sol模型公开定价推导的单任务34.5美元成本、引用开源智能体OpenClaw的15-40倍Token消耗数据,均非OpenAI官方实测的ChatGPT Work运行数据,仅为同架构下的理论推导值,证据等级为中等置信度,不能作为已验证的成本事实。但需要明确的是,长周期智能体的Token开销倍数是架构层面的必然约束:任何跨工具、百步以上的工作流,都需要每步做状态校验、错误重试、上下文回溯,这部分增量Token消耗不随模型参数优化消失,已被多个开源智能体项目复现,仅具体倍数会随垂直场景优化浮动,这一技术逻辑的置信度为90%。 与观澜的核心分歧在于,商业化布局能否先于技术成本瓶颈落地。观澜提出的“分层流量变现覆盖智能体成本”的商业逻辑成立,但技术栈的硬约束决定了这一逻辑当前无法跑通:GPT-5.6的三层模型虽做了算力分层,但长周期智能体的每步推理校验必须调用Sol旗舰模型,无法切换到Luna或Terra层——开源智能体的对照测试显示,若将百步工作流的校验环节切换为轻量模型,完成率会从演示场景的85%直接跌至27%,这意味着Work智能体的成本无法通过分层调度摊薄,必须独立承担Sol模型的高定价。此外观澜提及的Anthropic Claude Code的高价值付费路径,本质是垂直场景的架构优化:Claude Code针对coding场景做了专门的代码片段上下文压缩,Token消耗仅为通用智能体的1/5,而ChatGPT Work当前为通用场景定位,未做垂直领域的架构裁剪,成本天然比Claude Code高一个量级,这一差异是技术架构决定的,而非市场运营能力的差距。 与差评君的核心分歧在于成本转嫁的逻辑层级。差评君提出的“C端广告补贴B端智能体成本”的财务逻辑不在技术判断边界内,但从架构层面看,GPT-5.6的三层模型为物理隔离的算力池,Luna层承载C端广告对话,Sol层承载Work智能体任务,二者的算力调度、Token计费完全独立,不存在算力层面的成本分摊。关于广告渗透Work智能体的风险,当前Responses API的工具调用权限按应用层级划分,广告API的权限等级低于Work智能体的原生工具调度权限,理论上无法直接注入工作流,但OpenAI未公开权限隔离的具体技术方案,也未引入第三方审计,结合2025年付费用户对话混入品牌推荐的先例,这一风险的置信度为50%,属于待验证的潜在漏洞,而非已发生的事实。 修正后的核心技术判断可归纳为三点:其一,ChatGPT Work的长周期智能体能力当前仅处于小范围试点阶段,未达到规模化生产部署的要求——验证规模化的最小可运行闭环为“连续72小时、跨5种以上工具、100步以上操作的工作流,在包含容错重试的真实生产场景下达到90%以上完成率,且单任务成本控制在企业SaaS通用付费阈值5美元以内”,当前无任何公开的第三方测试数据满足这一条件,该判断置信度85%。其二,GPT-5.6的分层架构确实解决了此前工具调用需要硬编码prompt的工程痛点,降低了轻量化场景的推理成本,但通用长周期智能体的推理成本仍未到商业化拐点,该判断置信度90%——当前公开的Sol模型定价下,即使按最优情况的Token消耗测算,单任务成本也至少在20美元以上,远超企业可接受的通用阈值。其三,NVIDIA Vera CPU针对智能体非推理环节(代码编译、工具链调度、状态持久化)的优化方向成立,确实能降低智能体任务的非推理延迟,但仅补全了硬件栈的短板,无法解决核心的推理Token成本过高问题,无法从根本上扭转长周期智能体的成本结构,该判断置信度80%。 后续需要追踪的技术指标严格限定在可验证的范围内:一是第三方公开测试的ChatGPT Work百步以上工作流的端到端完成率与含容错开销的单任务成本;二是GPT-5.6在MLCommons Agent Benchmark等第三方对齐评测中的多智能体调度延迟、吞吐量数据;三是Vera CPU部署后的真实智能体负载单任务硬件成本下降幅度;四是OpenAI公开的广告API与Work智能体调度系统的权限隔离技术细节与第三方审计报告。所有涉及财务表现、用户留存、市场竞争的判断均超出技术边界,需以官方公开的GAAP数据、实测运营数据为准。

过稿轨迹
挑选题查资料分头看debate碰一下写稿子挑刺gate_reviewrepair_revision改稿子收尾
校稿清单
篇幅是否够讲透有没有反对意见资料够不够宣传腔是否清掉引用是否标清结构是否清楚证据是否撑得住内部讨论是否收住视角是否单薄
被压下去的反对意见
差评君awareness

本文未采用拆穿式批判立场,对OpenAI双轮布局的负面风险挖掘不足,偏向温和中立,不符合差评的内容风格。

为什么没放进正文:本次写作定位为突破深挖的机制分析,明确要求无需刻意唱反调,文章已明确区分高置信度结论与低置信度推测,未出现宣传夸大,该反对意见不符合既定写作定位。

差评君awareness

文中引入NVIDIA Vera CPU、Anthropic商业化路径的内容与OpenAI主题关联度弱,属于冗余信息,应大幅删减。

为什么没放进正文:Vera CPU是智能体成本约束的核心产业链变量,Anthropic是重要的对照组,二者均为论证双轮布局底层约束的必要支撑,不属于冗余内容。

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-07-10 07:27:05。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。