实体
Lianghua Huang
Lianghua Huang
PulseAugur coverage of Lianghua Huang — every cluster mentioning Lianghua Huang across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
Wan-Streamer v0.3 将视频重构为世界与事件流 · 已追踪 3 个来源
研究人员推出了 Wan-Streamer v0.3,这是一种新的交互模型,它将视频概念化为持久的“世界”和动态的“事件流”的组合。这种方法允许对视频数据进行通用预训练,使模型能够根据传入的输入预测世界如何随时间变化。该模型已应用于实时全双工视听交互,将多模态用户输入映射到语音和行为动作,响应延迟约为 200 毫秒。
-
Wan-Streamer v0.2 提高了视听交互的分辨率,同时保持了低延迟
研究人员发布了 Wan-Streamer v0.2,这是一个更新的端到端视听交互模型,在保持低延迟的同时显著提高了输出分辨率。新版本将交互流分辨率从 192x336 提高到 640x368,从而在实时对话中提供更详细的视觉反馈。这种改进是通过优化的思考者-执行者架构实现的,该架构利用多 GPU 并行处理来高效生成潜在表示,而不会影响大约 200 毫秒的模型端延迟。
-
Wan-Streamer v0.1:统一模型实现实时视听交互
研究人员推出了 Wan-Streamer v0.1,这是一种新颖的端到端多模态基础模型,专为实时、低延迟的视听交互而设计。与传统的级联系统不同,Wan-Streamer 在单一 Transformer 架构中集成了语言、音频和视频处理,并利用块因果注意力实现增量流式传输。这种统一的方法显著降低了管道延迟和错误累积,实现了亚秒级的双向视听通信,模型端响应延迟约为 200 毫秒。