返回热力追踪
关注AI产品
Amazon Nova Forge推出自定义多轮强化学习奖励函数新功能
AWS为其模型训练平台Amazon Nova Forge推出新能力,支持开发者设计复合式多轮强化学习奖励函数,解决多轮任务Agent训练仅能依靠最终指标的痛点。平台内置安全沙箱,可安全执行模型生成的代码并完成实时验证反馈。
编辑视角
多轮奖励设计一直是复杂任务Agent落地的核心瓶颈,该功能将 reward 设计工程化,对流程型行业的Agent落地有明确推动作用,值得相关开发者关注。
深度解读
本次AWS官方博客发布的是Nova Forge平台的新功能更新,主旨是将多轮强化学习的自定义奖励设计从简单函数升级为可配置、可验证的工程能力。公开资料显示,该功能支持开发者集成复杂自定义环境,支持物理模拟器、专有测试框架等场景,还内置了安全沙箱运行模型生成代码来获取实时反馈。目前没有信息显示该功能完全开放免费使用,仅订阅客户可获取详细文档,普通用户暂时无法直接体验。另外本次更新仅针对Nova Forge平台的强化学习模块,未披露基础模型的能力变化。后续需要关注普通开发者的开放权限、实际落地案例的效果反馈。
核心要点
- 支持开发者设计复合多轮强化学习自定义奖励函数
- 内置安全沙箱,可安全执行模型生成代码并实时验证反馈
- 支持集成复杂自定义环境,适配物理模拟、专有测试等场景
- 解决多轮任务Agent训练仅依靠最终指标的核心痛点
- 目前仅订阅客户可获取完整功能文档
延伸阅读
- Introducing Amazon Nova Forge: Build your own frontier models using Nova — Nova Forge官方介绍,了解平台基础能力