研究人员推出了 Wan-Streamer v0.3,这是一种新的交互模型,它将视频概念化为持久的“世界”和动态的“事件流”的组合。这种方法允许对视频数据进行通用预训练,使模型能够根据传入的输入预测世界如何随时间变化。该模型已应用于实时全双工视听交互,将多模态用户输入映射到语音和行为动作,响应延迟约为 200 毫秒。 AI
影响 引入了一种新颖的视频预训练任务,可以增强 AI 代理的多模态理解和实时交互能力。
排序理由 该集群包含详细介绍新模型和交互范式的研究论文。
- arXiv
- Audio Interaction Model
- DuplexSLA
- Hugging Face
- Lianghua Huang
- StreamChar
- VideoFDB
- Vidu S1
- Wan-Streamer v0.1
- Wan-Streamer v0.2
- Wan-Streamer v0.3
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →