实体
Audio Interaction Model
Audio Interaction Model
PulseAugur coverage of Audio Interaction Model — every cluster mentioning Audio Interaction Model across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Wan-Streamer v0.3 将视频重构为世界与事件流 · 已追踪 3 个来源
研究人员推出了 Wan-Streamer v0.3,这是一种新的交互模型,它将视频概念化为持久的“世界”和动态的“事件流”的组合。这种方法允许对视频数据进行通用预训练,使模型能够根据传入的输入预测世界如何随时间变化。该模型已应用于实时全双工视听交互,将多模态用户输入映射到语音和行为动作,响应延迟约为 200 毫秒。
-
新型音频交互模型统一实时音频任务
研究人员推出音频交互模型(AIM),这是一种新颖的大型音频语言模型(LALM),专为实时、交互式音频处理而设计。与之前的离线或单任务流式模型不同,AIM 在连续的感知-决策-响应循环上运行,使其能够动态地理解和响应环境声音和指令。该模型得到了 SoundFlow 框架(用于端到端开发)、名为 StreamAudio-2M 的新数据集以及用于评估主动音频干预的基准的支持。