返回热力追踪
关注Model Opensource

Noiz AI发布HelixWorld 1.0 支持音画同步实时生成世界模型

Noiz AI推出支持实时交互的音视频世界模型HelixWorld 1.0,可同步生成24FPS画面和48kHz立体声。不同于传统预生成视频模型,该模型支持用户操作后动态实时渲染场景,声场随视角操作同步变化。项目即将完全开源。

编辑视角

世界模型是当前多模态交互方向的热点,本次将音频和画面同框架实时生成,补齐了交互世界模型的音频短板,推进了可交互世界模型的落地进度,值得AI从业者关注。

深度解读

本次公开的HelixWorld 1.0是全球首个实现音画同步实时生成的可交互世界模型,解决了此前交互世界模型无动态空间声场的缺陷。模型将音频和画面纳入同一生成框架,随用户操作实时延展生成场景,声场随视角位置同步变化,区别于传统后期配音方案,也区别于预生成固定成品视频的传统视频生成模型。目前已有Google DeepMind、腾讯、蚂蚁等多家机构布局世界模型方向,该项目进一步验证了音视频一体化实时生成的可行性。

现有信息仅披露模型能力特点,未公开模型参数、技术方案细节与开源时间点,尚未有可验证的实际生成效果演示,也未披露模型训练算力与可开放调用的方式,实际落地效果待后续验证。后续需要关注开源代码放出后的技术细节复现与实际效果测试。

核心要点
  • Noiz AI发布实时可交互音视频世界模型HelixWorld 1.0
  • 支持24FPS画面与48kHz立体声同步实时生成
  • 音画同框架生成,声场随用户操作视角动态变化
  • 项目即将完全开源,目前多家机构布局该方向
延伸阅读
  • 共生知行发布人形机器人赛车Demo:以卡丁车测试双足机器人的“全身智能”同属交互智能领域最新进展,可供参考