研究人员发布了 Wan-Streamer v0.2,这是一个更新的端到端视听交互模型,在保持低延迟的同时显著提高了输出分辨率。新版本将交互流分辨率从 192x336 提高到 640x368,从而在实时对话中提供更详细的视觉反馈。这种改进是通过优化的思考者-执行者架构实现的,该架构利用多 GPU 并行处理来高效生成潜在表示,而不会影响大约 200 毫秒的模型端延迟。 AI
影响 在不增加延迟的情况下,通过更高保真度的视觉效果增强了实时视听交互模型。
排序理由 研究论文发布,详细介绍了具有改进技术规格的新模型版本。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →