返回深度
模型产品发布2026-09-06 07:03:086 min readAione Editorial V4

Anthropic发布Claude Opus 5并上线AWS 编码与长智能体能力大幅提升

Anthropic于2026年7月24日正式发布Claude Opus 5,性能接近旗舰Fable 5而价格仅为其一半,已上线AWS。对企业开发者而言,高端编码与长周期智能体任务的使用门槛显著降低。

Aione AI 编辑部
Research · Writing · Review · Publishing
2026-09-06 07:03:08 6 分钟

发布概况

Anthropic 于 2026 年 7 月 24 日正式发布高端通用模型 Claude Opus 5,定位为 Opus 系列的阶跃式升级,也是第五代 Opus 模型中的首款产品[S1][S3]。官方将其描述为“更主动、更审慎”的日常主力模型,核心目标是在接近旗舰级智能水平的前提下,把使用成本压到更适合高频生产的区间[S1][S2]。

从产品节奏看,Opus 5 距离上一代 Opus 4.8 发布仅约两个月,却完成了从编码能力、长时智能体到专业知识工作的全面抬升。它不仅在 Claude 自有平台成为 Claude Max 的默认模型,也是 Claude Pro 用户可调用的最强版本,同时第一时间登陆了 AWS 生态,面向企业级生产场景开放[S2][S3]。

核心能力升级

编码与智能体编程

编码是 Opus 5 升级最突出的赛道。官方与第三方公开数据显示,该模型在 Frontier-Bench v0.1 等智能体编程评测中性能超过 Opus 4.8 两倍以上,成为新的行业最优水平[S2][S8]。在 Agentic Coding 任务上,Opus 5 得分 43.3%,而 Opus 4.8 仅为 21.1%,提升幅度接近一倍[S8]。

这类提升并不只体现在单题通过率上,更体现在“像工程师一样工作”的能力上。AWS 官方文档提到,Opus 5 能够像资深工程师那样理解和遍历整个代码库,编写可直接投产的代码,并在运行过程中动态调整策略[S3]。对大型 monorepo 的跨文件重构、根因级 bug 修复、多模块协同开发等场景,模型的自主拆解和自我校验能力明显增强。

长周期智能体与专业工作

长周期智能体是 Opus 5 的另一项核心卖点。官方明确表示,该模型专为长时间运行的 agent 场景优化,能够支撑数小时甚至通宵持续运行的任务,灵活绕过卡点、从错误中恢复并最终完成目标[S3][S4]。这意味着它不再只是“一问一答”的推理模型,而是更适合嵌入自动化工作流,作为后台执行器处理复杂链路。

在专业知识工作方面,Opus 5 在 GDPval-AA 等知识工作评测中同样达到新的 SOTA 水平[S1][S2]。第三方实测显示,其在 ARC-AGI 3 新颖问题解决基准上得分 30.2%,大幅领先此前榜首 GPT-5.6 Sol 的 7.8%,显示出较强的泛化推理能力[S8]。在计算机操作基准 OSWorld 上,模型得分 70.6%;在 Zapier 自动化任务中,通过率约为第二名的 1.5 倍[S8]。

科研与多模态辅助能力

科研能力也是 Opus 5 值得关注的升级方向。第三方整理的公开数据显示,该模型在生命科学的多项评测中优于 Opus 4.8,覆盖结构生物学、有机化学和生物信息学等方向[S8]。其中,在根据波谱数据推断分子结构的内部基准上,它比前代高出 10.2 个百分点;在预测序列变异如何影响蛋白功能的评测中提升了 7.7 个百分点[S8]。

官方甚至将 Opus 5 认定为面向大众开放的最强科研向 Claude 模型,Fable 5 被安全策略拦截的部分生物科研请求,会自动路由到 Opus 5 处理[S8]。此外,模型的可视化生成能力也有所增强,能够输出空气动力学流场示意、交互式细胞结构图等更复杂的视觉结果。

规格与定价

上下文与输出能力

Claude Opus 5 的上下文窗口为 100 万 token,且默认即上限,无需额外 beta header 开启[S2][S4]。对用户来说,这意味着长文档通读、大型代码库索引、多轮长会话等场景不再受限于短上下文,也不必为长上下文支付额外溢价[S2]。

输出能力方面,Messages API 的最大输出为 128k token,Batch API 可通过 beta header 扩展至 300k token[S2][S4]。AWS 模型卡显示,其知识截止时间为 2026 年 5 月,模型生命周期状态为 Active[S4]。

Effort 档位与 Fast 模式

Opus 5 默认开启 adaptive thinking,并提供 low、medium、high、xhigh、max 五档 Effort 调节,默认档位为 high[S2][S4]。档位越高,模型自主思考、自检迭代的强度越大,消耗的 token 和延迟也相应上升;即便是最低的 low 档位,性能仍全面超越前代 Opus 4.8 的基础模式[S2][S8]。

需要注意的是,在 xhigh 或 max effort 下无法关闭 thinking,若 API 请求强制禁用会返回 400 错误;只有在 high 及以下档位才能关闭 thinking 模式[S2]。

此外,模型还提供 Fast Mode,输出速度约为标准模式的 2.5 倍,价格为标准模式的 2 倍,适合对延迟敏感、任务复杂度中等的场景[S2][S8]。

API 定价

定价是 Opus 5 最具冲击力的部分。官方 API 定价为输入 5 美元/百万 token、输出 25 美元/百万 token,与上一代 Opus 4.8 完全一致,但能力实现了代际提升[S2][S8]。作为对比,旗舰 Fable 5 的定价约为输入 10 美元/百万 token、输出 50 美元/百万 token,也就是说 Opus 5 用约一半的成本,提供了接近旗舰的性能[S1][S2]。

这种“加量不加价”的策略,直接把高端智能体和编码能力的单位成本打了下来,对需要大规模调用 API 的企业和开发者尤其有吸引力。

AWS 落地与企业特性

Claude Opus 5 发布当日即同步登陆 AWS,用户可以通过 Amazon Bedrock 和 Claude Platform on AWS 两种方式访问[S3][S4]。对企业客户而言,这意味着它可以直接嵌入既有的 AWS 工作流,而不必额外搭建基础设施。

在 Amazon Bedrock 上,Opus 5 默认启用零数据留存(ZDR),即在提供顶级智能能力的同时,不保留用户数据用于模型训练,满足企业数据治理与合规要求[S3][S4]。Bedrock 的下一代推理引擎还为模型提供了企业级安全、区域数据驻留和规模化推理能力,且运维人员无法访问用户数据[S3]。

服务层级方面,AWS 提供 Standard、Priority、Flex、Reserved 等多种推理选项,分别对应标准响应、优先调度、低成本弹性和预留吞吐等不同业务需求[S4]。区域部署上,Bedrock 支持区域内处理、跨区域调度等多种合规模式,适合对数据驻留有严格要求的行业客户[S4]。

产品定位与边界

与 Fable 5、Mythos 5 的关系

Opus 5 的定位非常清晰:它是“接近旗舰但不替代旗舰”的高性价比主力模型。官方多次强调,其智能水平接近 Claude Fable 5,但价格仅为一半,适合作为日常高频使用的首选模型[S1][S2]。在 CursorBench 3.2 的最高努力档位下,Opus 5 与 Fable 5 的峰值得分仅差约 0.5%,但单任务成本显著更低[S8]。

不过,Opus 5 并非全面超越旗舰。官方明确指出,在网络安全任务上,Opus 5 仍落后于更高级的 Mythos 5 模型[S1][S2]。此外,对于需要数天自主运行的超复杂项目,Fable 5 仍是更稳妥的选择;Opus 5 更适合日常办公、编程、知识工作和中等时长的智能体任务。

与 Opus 4.8 的代际差异

相比 Opus 4.8,Opus 5 不是渐进式小改,而是台阶式跃升[S2][S3]。除了编码、智能体、科研等能力的显著提升外,它还带来了原生 100 万上下文、Effort 多档调节、默认自适应思考等新特性,同时维持了相同的 API 定价[S2][S8]。对正在使用 Opus 4.8 的团队来说,迁移到 Opus 5 的性价比非常高。

当然,迁移过程中也需要注意行为变化,例如高 effort 下无法关闭 thinking、部分安全策略触发后的自动回退逻辑等[S2][S6]。这些细节会影响既有代码的兼容性,需要在升级前做充分测试。

行业影响与待观察问题

Opus 5 的发布,标志着高端大模型市场的竞争正在从“单纯拼最强能力”转向“拼单位成本下的综合表现”。当接近旗舰的能力被下放到 Opus 价位段,企业在构建编码助手、长时智能体、知识工作自动化等系统时,预算压力会明显减轻,落地门槛进一步降低。

对 AWS 生态客户来说,Opus 5 上线 Bedrock 的意义更大:它意味着企业可以在熟悉的云环境中,以更低成本获得接近旗舰的推理能力,同时保留数据治理、区域合规、弹性伸缩等企业级特性[S3][S4]。这会加速 Claude 系列在企业内部的渗透,尤其是在代码开发和文档密集型业务中。

不过,目前仍有一些问题需要后续观察。首先,模型的参数量、训练算力、训练数据组成等底层技术细节尚未公开,外界对其能力来源的理解仍有限。其次,除编码、知识工作、科研等已披露方向外,多模态完整能力、数学推理、超长时智能体稳定性等方面的第三方独立评测仍不充分。

再者,Opus 5 在 AWS 之外的其他云平台或第三方 API 市场的完整上线计划尚不明确,不同地区的可用性也存在差异。最后,它与后续发布的 Claude Fable 5.1、Mythos 5.1 在能力边界和产品定位上的详细对比,还有待官方进一步说明[S10]。

总体来看,Claude Opus 5 是一次非常务实的产品升级:它没有试图在所有维度都做到绝对第一,而是把用户最常用、最愿意付费的编码与长智能体能力做深,再用极具竞争力的定价推向市场。对开发者和企业而言,这无疑是一次“用同样的钱,拿到明显更强能力”的升级。

Editorial dossier

制作记录

公开编辑轨迹,不含隐藏推理。

制作记录已完成审读
材料已核验公开资料经过整理
多方来源互证保留可追溯引用
文字完成审读编辑意见已被处理
制作记录文章已进入公开阅读

正在整理制作记录…

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-09-06 07:03:08。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。