PulseAugur
实时 23:03:32
English(EN) I tested Microsoft first text-to-image model: Mage-Flow-Turbo

Microsoft发布Mage-Flow-Turbo文本到图像模型

Microsoft发布了Mage-Flow-Turbo,一个拥有40亿参数的文本到图像模型,采用MIT许可,能够以高达2048像素的原始分辨率生成图像。在基准测试中,它比Flux 2 Klein 4B获得了稍高的提示遵循分数,但美学评分较低。Mage-Flow-Turbo在专业影棚和产品拍摄方面表现出色,并且在其尺寸下展现出令人惊讶的清晰文本渲染能力,在DGX Spark上大约需要4.6秒完成生成。然而,它在人类真实感、准确性和空间推理方面存在明显不足,因此可能最适合VRAM有限的用户。 AI

影响 此次发布为文本到图像生成提供了一个新的开源选项,特别是对于VRAM受限的用户,尽管其在真实感和空间推理方面的表现可能会限制其广泛采用。

排序理由 Microsoft的首个文本到图像模型发布。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 r/StableDiffusion 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Microsoft发布Mage-Flow-Turbo文本到图像模型

报道来源 [1]

  1. r/StableDiffusion TIER_2 English(EN) · /u/dh7net ·

    I tested Microsoft first text-to-image model: Mage-Flow-Turbo

    <!-- SC_OFF --><div class="md"><p>Ok so first the specs:</p> <p>It's only 4B params, MIT-licensed, native-resolution (512–2048px, any aspect), and it's a 4-step distilled turbo — so it spits out a 1024² image in about 4.6 seconds on my local box (a DGX Spark).</p> <p>I put it thr…