两篇新研究论文解决了扩散模型在图像和视频生成方面的挑战。第一篇TPD引入了一个无需训练的框架,通过恢复被抑制的后期事件信号来改进文本到视频模型,从而在不重新训练的情况下增强时序连贯性和视觉保真度。第二篇论文Dualin提出了一种用于文本到图像模型的两阶段方法,该方法联合恢复语义提示和潜在噪声,旨在提高视觉保真度并实现精确的图像编辑。 AI
影响 这些研究进展可能带来更连贯、更可控的AI生成视频和图像内容,对创意产业和AI发展产生影响。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了改进文本到视频和文本到图像扩散模型的新方法。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Denoising Diffusion Implicit Models
- Gotit.pub
- Hugging Face
- Prompt inversion
- ScienceCast
- Temporal Prior Decoupling
- Temporal Prior Suppression
- Text-to-image diffusion models
- Text-to-video diffusion models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →