一款名为Prism的新模型已发布,专为高达2K分辨率的原生联合视频音频生成而设计。Prism由复旦大学和腾讯混元的研究人员开发,采用动态稀疏注意力框架来高效处理高分辨率数据。这种方法允许模型根据局部内容调整其注意力结构,与全注意力相比,训练速度提高了2.5倍,同时提高了生成质量。 AI
影响 该模型的动态稀疏注意力机制可能会影响未来高效高分辨率生成式AI训练的方法。
排序理由 该条目描述了一个新模型的发布及其相关的技术报告,详细介绍了其架构和性能。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
- Accelerate
- diffusers
- FrancisRing/Prism
- Fudan University
- Jiangfeng Xiong
- Jian Wei Zhang
- Kaihang Pan
- Prism
- PyTorch
- Qi Tian
- Shuyuan Tu
- Tencent Hunyuan
- transformers
- Weijie Kong
- Xintong Han
- Yinming Huang
- Yue Wu
- Yu-Gang Jiang
- Zuxuan Wu
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →