PulseAugur
实时 11:42:30
中文(ZH) 终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

HelixWorld 1.0:发布实时交互式视听世界模型

来自Noiz AI的研究人员与香港科技大学、清华大学等机构合作,推出了HelixWorld 1.0,一个新颖的交互式视听世界模型。该模型可实时生成24FPS的视觉内容和48kHz的立体声音频,并能动态响应用户操作。与之前生成静态视频或事后添加音频的模型不同,HelixWorld的Transformer架构从一开始就统一了音频和视觉生成,确保了同步且符合上下文的感官体验。研究团队计划在未来几周内公开模型权重和代码。 AI

影响 通过同步实时音频和视觉生成,为沉浸式AI体验树立了新标杆,有望加速交互式虚拟环境的开发。

排序理由 这是一个研究团队发布的新颖交互式视听世界模型,并计划开源。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 量子位 (QbitAI) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

HelixWorld 1.0:发布实时交互式视听世界模型

报道来源 [1]

  1. 量子位 (QbitAI) TIER_1 中文(ZH) · 思邈 ·

    终于!世界模型进入“音频时代”:24FPS视频+48kHz立体声实时生成

    即将完全开源