研究人员推出 LLaDA-Image,一个使用从头开始训练的 6B Diffusion Transformer 生成高质量图像的新颖框架。该模型利用纯图像预训练和专用优化器来实现照片级真实感结果和精确编辑能力。一个蒸馏版本 LLaDA-Image-Turbo 支持快速推理。LLaDA-Image 在 Qwen-Image-Bench 上设定了开源模型中的新最先进水平(SOTA),其权重、代码和训练方法已公开发布,以促进进一步研究。 AI
影响 为图像生成和编辑设定了新的开源SOTA,鼓励生成模型领域的进一步研究和开发。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一个新的图像生成模型及其在基准测试上的性能,并发布了相关的代码和权重。
在 Hugging Face Daily Papers 阅读 →
- Diffusion Transformer
- inclusionAI/LLaDA-Image-Turbo
- LLaDA2.0-mini
- LLaDA-Image
- LLaDA-Image-Turbo
- Muon optimizer
- Qwen Image Bench
- Hugging Face
- RMSNorm
- Diffusion Transformer (DiT)
- muon
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →