研究人员开发了一种名为“Logit Refiner”的新方法,以提高视觉自回归模型(VAR)生成的图像质量。该技术解决了VAR中的一个限制,即并行解码会丢弃同一尺度内 token 之间的空间依赖性,导致图像连贯性较差。Logit Refiner 是一个轻量级模块,通过顺序采样 token 来恢复这些类内依赖性,从而在无需重新训练或显著增加参数或计算量的情况下提高生成质量。该方法在各种 VAR 模型上显示出持续的改进,并可推广到文本到图像生成。 AI
影响 该方法提供了一种以最小的开销来提高现有模型图像生成质量的方法。
排序理由 该集群包含一篇详细介绍改进 AI 模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- DagsHub
- Hugging Face
- ImageNet
- Logit Refiner
- Stefan Andreas Baumann
- Visual Autoregressive Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →