返回深度
论文与评测2026-10-02 07:01:566 min readAione Editorial V4

谷歌Gemini 4 Argon登顶多项基准 百万Token输出先向网安伙伴开放

谷歌发布Gemini 4 Argon旗舰模型,输出Token上限提至100万并在多项基准测试登顶,将先面向可信网络安全合作伙伴开放,影响企业级长流程任务的AI选型。

Aː
Aione AI 编辑部
Research · Writing · Review · Publishing
2026-10-02 07:01:56 6 分钟

发布背景与产品定位

谷歌于2026年9月30日正式推出新一代旗舰模型Gemini 4 Argon,这是Gemini 4系列的首款旗舰模型,定位为面向复杂、长流程工作流的前沿智能模型,重点覆盖软件工程、法律与金融等企业知识工作,以及网络安全防御场景[S1][S3][S7]。伴随新模型落地,谷歌正式取消了原定6月发布的Gemini 3.5 Pro迭代计划,转向Gemini 4系列与Flash系列模型并行的产品布局[S3][S8][S9]。

核心技术突破

Gemini 4 Argon最显著的升级是将单次输出Token上限从此前的6.4万大幅提升至100万,相当于约75万个英文单词,是当前主流旗舰模型12.8万输出上限的近8倍[S2][S5][S8]。谷歌表示,当模型拥有足够的推理余量并能在单次运行中生成数十万Token时,便可在更少人工中途接管的情况下,处理跨越多个步骤的复杂问题,一次性完成深度分析或大规模代码生成[S7][S9]。

除长输出能力外,模型在多模态长视频理解方面也表现突出,在LVBench长视频理解测试中得分91.7%,优于GPT-6 Astra的87.5%与Claude Opus 5.5的83.7%[S2][S5][S11]。在综合能力层面,Artificial Analysis智能指数中Gemini 4 Argon得分53,与GPT-6 Astra持平,高于GPT-6.1 Sol的52,且幻觉率仅15%,为同级别模型中最低[S2]。

基准测试表现

在真实软件工程能力测试DeepSWE v1.1中,Gemini 4 Argon取得77.9%的成绩,超越Claude Opus 5.5的74.2%与GPT-6 Astra的74.1%,位居榜首[S2][S5][S8][S11]。在企业知识工作领域,Vals Index综合榜(覆盖金融、编程、法律、税务并按GDP贡献加权)中该模型得分68.9%排名第一;Harvey法律智能体测试中得分19.6%,大幅领先其他竞品5.4%至6.7%的水平[S2][S7][S11]。

端到端业务执行方面,Zapier AutomationBench基准测试中Gemini 4 Argon以51.3%的得分排名第一[S2][S5][S9]。网络安全领域,CWE-bench v1漏洞修复测试中该模型得分68%,与GPT-6 Astra并列第一[S2][S6][S12]。不过在FrontierSWE v2测试中,Argon仅获得55.0%,为参与对比的四家模型中最低,显示其在部分极端软件工程场景仍有短板[S2]。

内部落地验证

在正式对外发布前,Gemini 4 Argon已在谷歌内部大规模使用,数千名员工将其应用于专项编程、深度研究和写作等任务[S2][S4][S7]。其中最具代表性的内部成果集中在三个方向:一是数据中心内存优化,Argon智能体通过分析集群性能遥测数据并自动执行优化操作,已释放超300TiB内存,预计最终可节省500TiB至1PiB[S2][S5][S7][S9]。

二是大规模代码迁移,Argon已参与谷歌内部C/C++向Rust的迁移工作,覆盖re2、libgav1等核心开源库及Fuchsia Zircon内核,涉及超80万行代码[S2][S4][S7][S9]。以开源视频解码器libgav1为例,Argon智能体对既有Rust移植版进行多轮优化,用安全Rust重写约3.2万行SIMD代码,最终版本在保持视频输出一致的前提下,比原Rust移植版提速2.7倍,性能接近优化后的C++实现[S5][S7]。

三是量子算法优化,在谷歌量子计算团队的测试中,Argon在数分钟内便找到了一种量子算法子程序的新优化方案,以量子比特与门的乘积衡量计算成本,相比已发表的基线结果提升40%[S5][S6][S7][S12]。

定价与分阶段开放

定价方面,Gemini 4 Argon初始推广价为每百万输入Token 2美元、每百万输出Token 10美元,缓存输入享95%折扣,与GPT-6.1 Sol处于同一价格带[S2][S3][S5][S10]。优惠期结束后,定价将恢复为每百万输入Token 4美元、输出Token 20美元,与Claude Opus 5.5相当[S2][S10]。

开放路径上,谷歌采取了分阶段推进策略。首批通过Fairwind计划向受信任的网络安全防御人员开放,后续将依次面向付费API客户、Google AI Ultra订阅用户开放,普通消费者的开放时间暂未公布[S1][S2][S6][S9]。谷歌表示,在全面开放前将继续加强防滥用、提示注入防护、模型行为监控和安全沙箱等安全措施,并参与美国政府的模型发布前自愿访问程序[S6][S9][S12]。

网络安全优先开放逻辑

选择网络安全领域作为首发场景,与Fairwind计划的定位直接相关。该计划旨在让政府、医疗机构和电信服务商等重要基础设施防御方,提前使用先进模型发现和修复漏洞,目前拥有超过650家全球合作伙伴[S9]。获得Argon使用权的组织,只能向内部网络安全、事件响应或渗透测试团队提供访问权限,并须记录员工使用情况,不能转售或向外部重新分发模型访问权限[S9]。

谷歌Gemini模型产品负责人表示,以网络安全为起点推广新模型,既能让防御方尽快获得强大工具,也能在受控环境中进一步验证模型安全边界,为后续更大范围开放积累经验[S12]。对企业用户而言,这一策略意味着网络安全、代码审计等场景将最先体验到百万Token输出带来的长程推理能力,而通用办公、消费级场景仍需等待安全评估完成。

Editorial dossier

制作记录

公开编辑轨迹,不含隐藏推理。

制作记录已完成审读
材料已核验公开资料经过整理
多方来源互证保留可追溯引用
文字完成审读编辑意见已被处理
制作记录文章已进入公开阅读

正在整理制作记录…

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-10-02 07:01:56。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。