研究人员推出了 Swift-Image,这是一款紧凑且统一的文本到图像生成、单图像编辑和多图像编辑模型。该模型采用了高效的 6B 参数 Diffusion Transformer (DiT) 和渐进式训练流程,并通过并行专家强化学习和训练后多教师蒸馏得到增强。一个独立的 Prompt Enhancer 组件将用户请求转化为视觉规范,并且该模型已压缩至 3B 参数,性能损失极小。Swift-Image 在其参数类别和训练预算内的开源模型中展现了领先的综合性能。 AI
影响 这项研究表明,紧凑型模型可以通过先进的训练技术实现具有竞争力的性能,从而可能降低开发复杂图像生成工具的门槛。
排序理由 该集群描述了一篇关于新型图像生成和编辑人工智能模型的新研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →