来自Noiz AI的研究人员与香港科技大学、清华大学等机构合作,推出了HelixWorld 1.0,一个新颖的交互式视听世界模型。该模型可实时生成24FPS的视觉内容和48kHz的立体声音频,并能动态响应用户操作。与之前生成静态视频或事后添加音频的模型不同,HelixWorld的Transformer架构从一开始就统一了音频和视觉生成,确保了同步且符合上下文的感官体验。研究团队计划在未来几周内公开模型权重和代码。 AI
影响 通过同步实时音频和视觉生成,为沉浸式AI体验树立了新标杆,有望加速交互式虚拟环境的开发。
排序理由 这是一个研究团队发布的新颖交互式视听世界模型,并计划开源。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- CMU
- Genie 3
- Google DeepMind
- HelixWorld 1.0
- Hong Kong University of Science and Technology
- Jensen Huang
- LingBot-World
- Meta
- Noiz AI
- Tsinghua University
- Yann LeCun
- Zeyue Tian
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →