MiniMax H3 文本到图像模型发布了新版本 v3,该版本采用了更小的文本编码器(4B 或 8B 参数),旨在减小模型尺寸同时保持质量。这些更小的编码器通过投影矩阵映射到原始 32B 编码器的输出,使得核心 DiT 模型保持不变。性能指标显示,8B 编码器与 32B 模型相比达到了 0.9449 的余弦相似度,4B 编码器达到了 0.9381,同时在视觉标记条件化方面也有所改进。 AI
影响 降低了文本到图像生成的模型尺寸和潜在的推理成本。
排序理由 这是对现有模型的更新,而非前沿新发布,侧重于技术实现细节。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →