返回热力追踪
关注AI产品

Amazon Nova Forge推出自定义多轮强化学习奖励函数新功能

AWS为其模型训练平台Amazon Nova Forge推出新能力,支持开发者设计复合式多轮强化学习奖励函数,解决多轮任务Agent训练仅能依靠最终指标的痛点。平台内置安全沙箱,可安全执行模型生成的代码并完成实时验证反馈。

编辑视角

多轮奖励设计一直是复杂任务Agent落地的核心瓶颈,该功能将 reward 设计工程化,对流程型行业的Agent落地有明确推动作用,值得相关开发者关注。

深度解读

本次AWS官方博客发布的是Nova Forge平台的新功能更新,主旨是将多轮强化学习的自定义奖励设计从简单函数升级为可配置、可验证的工程能力。公开资料显示,该功能支持开发者集成复杂自定义环境,支持物理模拟器、专有测试框架等场景,还内置了安全沙箱运行模型生成代码来获取实时反馈。目前没有信息显示该功能完全开放免费使用,仅订阅客户可获取详细文档,普通用户暂时无法直接体验。另外本次更新仅针对Nova Forge平台的强化学习模块,未披露基础模型的能力变化。后续需要关注普通开发者的开放权限、实际落地案例的效果反馈。

核心要点
  • 支持开发者设计复合多轮强化学习自定义奖励函数
  • 内置安全沙箱,可安全执行模型生成代码并实时验证反馈
  • 支持集成复杂自定义环境,适配物理模拟、专有测试等场景
  • 解决多轮任务Agent训练仅依靠最终指标的核心痛点
  • 目前仅订阅客户可获取完整功能文档
延伸阅读
  • Introducing Amazon Nova Forge: Build your own frontier models using NovaNova Forge官方介绍,了解平台基础能力