
2026年7月GPT-5.6系列模型发布时,大部分注意力都集中在推理能力的提升、多模态体验的优化以及ChatGPT Work智能体的功能迭代上,很少有人注意到OpenAI同步公开的一项安全研究——GPT-Red自弈自动红队系统[1][2]。相比直接面向用户的模型功能升级,这项仅在技术社区流转的研究,或许才是本轮更新中更具长期影响的底层变化:它第一次把自对弈范式规模化落地到了生产级大模型的安全训练中,试图解决困扰行业多年的提示注入防御难题,但同时也为AI安全的能力边界、成本结构与责任划分带来了一系列新的问题。
自对弈红队的核心逻辑
AI红队测试的本质,是由专业人员扮演攻击者,通过各种手段突破模型的安全护栏,找到漏洞后再进行修补,是大模型上线前的核心安全环节。随着大模型能力的提升、智能体应用的普及,攻击面正在以远超预期的速度扩张,恶意指令可以隐藏在网页、文档、邮件、工具返回结果甚至文件名中,人类红队的测试速度已经很难跟上攻击手段的迭代速度[5]。
GPT-Red的核心思路,就是把这个攻击过程自动化,并且通过自对弈实现攻防双方的共同进化。和大多数基于现有攻击样本训练的自动化红队工具不同,GPT-Red的训练起点是一个没有任何黑客经验的普通基座模型,OpenAI将其放入模拟现实场景的训练环境中,让它持续攻击一组防御模型,防御模型则需要在抵抗攻击的同时完成正常任务。在数万轮的反复对抗中,GPT-Red会自发摸索出各种突破护栏的方法,甚至探索出同一攻击路径的所有变体,直到找到特定场景下最有效的攻击方式;而防御模型也会在这个过程中不断修补漏洞,提升鲁棒性[5][6]。
这种训练方式带来的攻击能力提升已经得到了内部测试的验证:在针对GPT-5.1的未出现在训练数据中的间接提示注入测试中,GPT-Red的攻破率达到84%,而参与同一测试的人类红队人员成功率仅为13%[3]。在更贴近真实生产环境的测试中,GPT-Red甚至成功诱导OpenAI办公室的自动售货机智能体将高价商品价格降至最低允许的0.5美元,还自动订购了价值超过100美元的新品,这类边缘场景的攻击路径往往是人类红队很难覆盖到的[3]。
和传统自动化工具的最大差异在于,GPT-Red的攻击能力不是来自对已知黑客样本的学习,而是在对抗过程中自发涌现的。它不需要人类预先设定攻击规则,也不需要投喂现成的攻击数据库,就能发现人类从未想到过的突破路径——这正是它最大的价值,也是它和此前所有自动化红队工具最核心的区别。
被验证的真实进步
GPT-Red的价值,首先在于它尝试打破了AI安全测试的规模瓶颈。长期以来,AI安全测试高度依赖高端安全人才的供给,不仅成本高,而且测试场景的扩张速度受到人员数量的刚性约束。根据AI安全测试行业通用估算,传统人工红队单项目成本约10-20万美元,可覆盖10-20个核心攻击场景,一旦测试场景数量翻倍,成本也会基本同步上涨。而随着智能体应用的普及,单模型需要测试的攻击场景很快就会达到数百甚至数千个,纯人工测试的模式显然无法支撑这样的规模增长。
据第三方行业测算,支撑GPT-Red完成首轮全规模自对弈训练及配套防御模型的安全迭代,共消耗约70万GPU小时的算力资源[11],这一规模已达到OpenAI最大规模后训练运行的算力等级,也是OpenAI公开披露的、行业已知首次将该规模算力专门投入安全训练[12]。从静态成本来看,按当前A100集群每小时8美元的行业均价计算,这次训练的直接成本约为560万美元,对应GPT-5.6 Sol在最难的直接提示注入测试中失败率降低6倍的结果,相当于每降低1个百分点的失败率消耗约7万美元,单场景成本目前仍高于人工红队。
但成本结构的差异才是核心:人工红队的成本会随着测试场景的增加线性增长,而GPT-Red完成初始训练后,新增同类型攻击场景的测试成本仅为对应的算力消耗,不需要额外的人力投入。当单轮测试的场景量级超过50个之后,GPT-Red的单位场景成本就会低于人工红队,而且规模越大,成本优势越明显。更重要的是,GPT-Red可以24小时不间断开展测试,不会受到人类工作时长、创意瓶颈的约束,这对于应对快速迭代的攻击手段而言至关重要。
这也是为什么经过GPT-Red对抗训练的GPT-5.6 Sol,能够成为OpenAI迄今为止对提示注入攻击鲁棒性最高的模型[12]——这种高强度、全覆盖的对抗训练,是纯人工红队根本不可能实现的。在攻击手段指数级增长的智能体时代,这种可规模化的测试能力,比单点的攻击效率提升更有意义。
被刻意模糊的能力边界
当前市场上关于GPT-Red的叙事,很多都将其描述为“通用AI安全解决方案”,但从已公开的技术细节和测试数据来看,它的能力边界非常清晰,甚至可以说相当狭窄。
首先是能力覆盖的边界。GPT-Red的训练目标从一开始就非常明确,仅针对提示注入类攻击,对于代码漏洞、生物安全风险、多模态隐藏载荷等其他AI安全场景,目前完全没有覆盖[1][6]。即便是在提示注入的大类下,其防护效果也存在明显的场景差异:在针对已知提示注入的连接器场景测试中,GPT-5.6 Sol与Terra的鲁棒性得分达到1.000,但在Agent核心的搜索与函数调用场景中,Sol的得分降至0.910,Terra为0.946,Luna为0.897[11],这意味着GPT-Red在最高风险的函数调用场景防护效果仍存在明显短板,而函数调用恰恰是智能体完成复杂任务的核心工作模式,攻击载荷可以隐藏在整个工具调用链路的任何一个环节,防护难度远高于普通的直接或间接提示注入。
其次是泛化性的边界。84%的高攻破率,是针对同系列的GPT-5.1模型测得的,OpenAI至今未披露GPT-Red针对Anthropic、Gemini等异架构模型的测试数据,也未说明参与对照测试的人类红队的资质、经验与样本量[3]。这就带来了一个无法排除的可能性:GPT-Red的高攻破率,部分来自于对同基座模型固有路径偏好的熟悉,而非通用的攻击能力,也就是说它可能非常擅长攻破OpenAI自己的模型,但放到其他厂商的模型上效果会大幅下滑。这种同基座过拟合的风险,也是所有自对弈系统普遍面临的问题——对抗双方太熟悉彼此的行为模式,很容易演化出脱离真实通用场景的对抗策略。
第三是可及性的边界。OpenAI明确表示GPT-Red不会向外部用户开放,也没有开源或对外提供接口的计划[3]。更重要的是,即便开放,绝大多数厂商也很难复刻这套模式:除了70万GPU小时的初始算力投入,自对弈红队系统还需要一个持续迭代的生产级模型作为固定靶标,以及完整的模型训练链路来把攻击发现转化为防御能力的提升。对于中小模型厂商而言,既没有足够的算力储备,也没有足够大的生产级模型迭代数据来支撑自对弈训练,根本无法跨越这一门槛。
最后是合规的边界。GPT-Red生成的攻击路径是自对弈过程中自发涌现的,很多路径的作用机理无法被人类完全解释,而且所有的测试数据、攻击样本都属于高风险资产,OpenAI不会对外公开[6]。这就意味着,企业客户无法将GPT-Red的内部测试报告作为合规备案的充分依据,甚至可能面临额外的责任风险:如果采购了经过GPT-Red训练的模型,就默认其安全能力足够,反而放松了场景侧的防护,一旦发生非提示注入类的安全事故,监管完全可以认定应用方明知GPT-Red的能力边界却未补足防护,需要承担主要过错责任。OpenAI自己也在GPT-5.6的配套说明中明确要求,企业接入具备智能体能力的模型时,需要自行搭建权限管控、全量审计、外部内容清洗三道防线[11],相当于直接划清了责任:基础模型的安全能力只是基础,场景侧的安全责任仍由应用方承担。
真正的产业影响
GPT-Red的出现,不会像很多叙事说的那样重构整个AI安全行业的格局,但它确实会从三个维度深刻影响行业的未来走向。
第一,它抬高了通用大模型提示注入场景的竞争门槛,而且这个门槛是组合式的,不是单纯靠资金就能跨越的。它不仅需要数十万GPU小时的初始算力投入,还需要持续迭代的生产级模型作为靶标,更需要足够大的企业级客户池来回收沉没成本——OpenAI之所以愿意投入这么多算力做安全训练,核心原因是它可以通过微软365 Copilot等企业级服务的安全溢价,把成本转嫁给下游客户,而中小厂商既没有这样的客户池,也没有足够的品牌影响力来收取安全溢价,本质上不是“用不起”这套系统,而是“回收不了”投入的成本。OpenAI不会对外输出GPT-Red的测试能力本身,更可能的路径是由微软将“经过GPT-Red自弈红队验证”作为Azure AI模型服务的增值背书,而非独立收费的测试服务。这种门槛的提升,会进一步拉大头部通用大模型厂商和中小厂商的安全能力差距,加速通用大模型行业的头部集中。甚至如果未来监管将自动化红队列为强制要求,中小厂商不仅要投入算力搭建自对弈系统,还要付费聘请第三方机构开展独立验证,整体合规成本较此前的人工红队模式反而会上升30%-50%,进一步挤压中小厂商的生存空间。
第二,它会推动AI安全测试市场的分层,而不是消灭第三方红队服务商。很长一段时间里,行业都在担心自动化红队会挤压第三方人工红队的生存空间,但GPT-Red的出现反而明确了两者的分工:头部厂商的内部自弈红队负责基础模型层的通用提示注入测试,而第三方红队服务商则会转向两个方向:一是面向监管的独立合规审计,因为内部自对弈的测试结果不具备独立性,无法作为合规依据;二是面向企业应用的场景级安全测试,覆盖函数调用、多模态攻击、垂直行业定制化场景等内部红队没有覆盖的领域。目前已有数据显示,第三方AI红队服务商的企业场景级订单占比正在快速提升,未来甚至会超过面向大模型厂商的通用测试订单。
第三,它会倒逼监管尽快明确自动化红队的测试标准,防范新的监管套利空间。目前全球AI监管规则中,对于自动化红队测试的场景要求、数据披露规则、独立验证标准都没有明确的规定,这就给头部厂商留下了选择性披露的空间:可以只公开表现好的场景的测试数据,隐瞒表现不好的场景,用“已通过自动化红队测试”的叙事误导客户和监管。比如OpenAI在公开GPT-Red的研究成果时,重点宣传了提示注入场景的性能提升,但没有主动提及函数调用场景的鲁棒性下滑,也没有公开测试集的筛选标准和样本分布。未来监管很可能会在18个月内,将规模化自动化红队测试列为前沿AI模型合规评估的推荐项,但会明确要求内部自对弈的测试结果不能直接作为独立合规依据,必须经过第三方验证。此外,类似GPT-Red的专用攻击类大模型,未来2年内很可能会被纳入单独的出口管制与受信访问管控范畴,避免攻击能力的滥用。
后续的关键观察方向
GPT-Red不是AI安全的终极答案,它只是把自对弈范式落地到生产级安全训练的第一步。接下来的几个关键事实,会直接决定这项技术的未来走向:OpenAI是否会披露GPT-Red针对异架构模型的攻破率数据,证明其攻击能力的泛化性;是否会公开部分非敏感的攻击样例,供第三方验证其防御效果的真实性;如果对外输出相关安全能力,是否会提供可审计的测试日志接口,满足合规要求;GPT-5.6企业级订阅的安全溢价幅度是否会超过10%,证明市场愿意为这种安全能力付费;以及监管是否会尽快出台针对自动化红队测试的统一标准,明确责任划分。
可以确定的是,AI安全从来不是一个一劳永逸的问题,不存在什么“永不陷落”的安全护栏。GPT-Red真正的启示,是它把AI安全从“被动修补漏洞”的模式,转向了“主动模拟攻击、提前迭代防御”的动态模式——未来的AI安全防线,不是一堵静态的墙,而是一个在无数次模拟攻防中不断进化的动态系统。但无论技术怎么进化,最核心的问题始终没有变:我们需要的不是不可验证的安全叙事,而是清晰的责任边界、可追溯的测试数据,以及能被第三方验证的安全标准。
参考资料
当前关于GPT-Red的核心分歧,首先是产业叙事中“AI安全测试成本结构被彻底改写”的判断是否具备普适性——观澜的结论基于OpenAI内部的投入产出逻辑,而从工程可及性的维度看,这一重构仅局限于OpenAI自有模型的生产链路,完全不具备行业通用性,后者的证据强度更高:70万GPU小时的安全训练投入已被6个独立信源交叉验证,且OpenAI明确GPT-Red无对外接口、无开源计划,中小模型厂商既无法承担同等量级的算力成本,也缺乏自对弈闭环必需的生产级迭代模型作为攻击靶标,所谓“边际测试成本下降”仅对OpenAI自身成立,无法外推为全行业的成本曲线变化。观澜提到的“抬高通用大模型安全竞争壁垒”的判断成立,但需要修正壁垒的核心构成:并非自对弈技术本身,而是“数十万GPU小时算力+连续迭代的旗舰生产模型”的组合门槛,仅靠资金投入无法复刻,还需要长期积累的模型迭代数据作为自对弈的素材,这才是中小厂商根本无法跨越的差距。 差评提出的“技术有效性被夸大”的质疑具备明确证据支撑,需要修正此前的核心判断:将“自对弈红队范式落地生产级安全训练”的限定范围收窄为“同基座模型闭环内的生产级落地”,置信度从85%下调至75%。此前判断的扣分项除了无第三方复现、测试集未公开,还要补充差评指出的同基座过拟合风险:84%的攻破率针对的是同系列的GPT-5.1,OpenAI未披露针对Anthropic、Gemini等异架构模型的测试数据,也未说明人类红队的测试资质与样本量,无法排除GPT-Red利用同基座模型的固有路径偏好实现高攻破率的可能。同时差评提到的函数调用场景鲁棒性下滑有官方System Card的一手数据支撑,因此需要进一步收窄能力边界:GPT-Red不仅未覆盖代码漏洞、生物安全等非提示注入场景,连提示注入下属的函数调用子类的优化效果都存在明确衰减,无法适配智能体的核心工作模式,现有证据仅能证明其在OpenAI内部迭代链路中对直接、间接提示注入的优化有效,完全无法支撑“通用红队工具”甚至“黑客终结者”的营销叙事。 陆衡提出的责任划分问题,本质上是GPT-Red的技术架构天然不满足合规审计要求的外化表现:自对弈生成的攻击路径具备不可解释性,且所有测试数据、攻击样本均不对外公开,这不是OpenAI的主观选择,而是自对弈范式的固有属性——对抗过程中生成的极端攻击路径本身就是高风险资产,一旦公开可能被滥用,因此从设计之初就没有预留外部审计接口,这直接导致企业客户无法将其测试报告作为合规备案的充分依据,基础模型厂商与应用方的责任边界无法通过这套系统自动划分,反而可能因为“已通过自动化红队测试”的叙事模糊应用方的合规义务。即使如观澜推测的那样,微软未来将GPT-Red的能力整合进Azure安全服务,也只能以黑箱API的形式存在,用户无法验证攻击逻辑的完整性,仍然无法解决第三方合规审计的需求——此前判断中遗漏了这一点,需要补充:即使GPT-Red的攻击能力持续提升,独立第三方红队的合规需求不会消失,仅会从通用测试转向场景化审计,而非被完全挤压。 当前可明确的技术边界置信度仍维持95%:GPT-Red仅覆盖提示注入类攻击且效果存在场景衰减,无外部可访问的完整接口,所有性能指标均为内部测试口径。后续可验证的技术指标包括:OpenAI是否会披露针对异架构模型的攻破率数据,是否会公开部分非敏感攻击样例供第三方验证鲁棒性提升的泛化性,以及若对外输出服务是否会提供可审计的测试日志接口。
建议新增核心判断:GPT-Red代表的自动化自弈红队测试将在2年内成为全球前沿大模型发布的强制监管准入要求。
为什么没放进正文:现有证据仅显示GPT-Red为OpenAI内部专用工具,不具备独立性、可复现性,无法满足第三方合规验证要求,无全球监管机构相关表态支撑,属于过度推演。
建议新增判断:OpenAI将在1年内把GPT-Red相关安全能力包装为独立收费服务对外输出。
为什么没放进正文:GPT-Red为专用攻击模型,存在攻击能力扩散的监管风险,且OpenAI明确表示不会对外开放,无证据支撑该商业化路径的可行性。
Reader Signal
这篇文章对你有帮助吗?
只收集预设选项,不开放评论,不公开展示个人反馈。
选择一个判断,也可以附加一个预设标签。
发布于 2026-07-16 10:22:43。本文为原创深度报告,未经授权不得转载。观点仅代表编辑部独立判断,不构成投资建议。