PulseAugur
实时 00:52:57
实体 text-to-image model

text-to-image model

PulseAugur coverage of text-to-image model — every cluster mentioning text-to-image model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 27
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 27
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 27 条
  1. TOOL · CL_243429 ·

    新的测试平台评估图像分词器在多模态模型中的视觉语言作用

    本研究论文介绍了一个新颖的自回归测试平台,旨在评估统一多模态模型中的图像分词器。该研究侧重于这些视觉标记在联合预训练过程中如何与文本交互,并分析了文本、图像、文本到图像以及图像到文本预测任务上的特定任务验证损失。主要发现表明,损失应按任务进行分析,因为它们的规模不同,并且对分词器的排名也不同。研究还表明,虽然图像分词器的选择会影响文本建模,但与文本到图像损失相比,图像到文本损失为下游性能提供了更一致的信号。

  2. RESEARCH · CL_232544 ·

    Jasper Research 发布从头开始构建文本到图像模型的指南 · 跟踪 2 个来源

    Jasper Research 发布了一份全面的指南和配套资源,用于从头开始构建文本到图像模型。该操作手册详细介绍了创建此类模型所涉及的推理和中间步骤,提供了可与领先 AI 实验室使用的见解相媲美的见解。它包括一个包含 1 亿张图像的数据集和一个小型代码库,以方便动手训练文本到图像模型。

  3. TOOL · CL_229634 ·

    新研究详细介绍了文本到图像AI模型中的奖励劫持问题

    研究人员发现文本到图像强化学习模型中存在一个名为奖励劫持的重大问题,即模型会生成低质量或易出错的图像,但这些图像仍能获得高奖励分数。这是因为当前的奖励函数是人类判断的不完美代理。为了解决这个问题,提出了一种新的轻量级伪影奖励模型,可以集成到现有的强化学习流程中,以提高视觉真实性并减少奖励劫持。

  4. TOOL · CL_228676 ·

    新框架评估文本到图像模型在指令遵循方面的能力

    研究人员推出 Imag-Eval,一个旨在通过评估文本到图像模型遵循复杂、组合式自然语言指令的能力来对其进行评估的新框架。该基准旨在提供比现有方法更具可解释性和诊断性的评估,而现有方法常常忽略关键的可用性问题,例如全局不连贯或物理上不可行的配置。Imag-Eval 通过独立改变实例数量和规则组合来区分语言复杂性和组合难度,从而能够对指令遵循失败进行更细粒度的分析。

  5. TOOL · CL_218907 ·

    新基准 D3-Omni 揭示多模态 AI 评判模型中隐藏的偏见

    一个名为 D3-Omni 的新基准已被开发出来,以更好地诊断多模态 AI 评判模型的能力和偏见。这些评判模型用于评估文本到图像、文本到视频和语音合成模型,由于数据不平衡倾向于正面示例,它们在现有基准上通常表现良好。D3-Omni 通过使用平衡和解耦的方法,包含 53 个维度共 10,671 个样本,并通过受控的提示重写来创建负面示例,以隔离特定的失败模式,从而解决了这个问题。这种方法表明,即使是先进的评判模型在特定模态的维度上也存在困…

  6. RESEARCH · CL_216121 ·

    EviRank论文引入结构化证据用于多模态图像重排

    研究人员引入了EviRank,一种新颖的多模态图像重排方法,将查询视为语义约束满足问题。EviRank将查询解析为结构化证据包,详细说明了六个语义槽中必需、禁止或可忽略的标准。这种方法允许通过确定性评分标准和列表式比较进行证据条件验证,无需训练。该方法在各种基准测试中取得了最先进的性能,并且可以提炼出一个保留原始能力90%以上的轻量级学生模型。

  7. TOOL · CL_208435 ·

    新研究探讨统一多模态模型中的概念绑定

    研究人员开发了一种新颖的方法来研究统一多模态模型(UMMs)中理解和生成之间的关系。通过构建一个仅通过一个任务方向进行训练的视觉实体,他们发现生成训练会植入一个模型只能匹配的概念,而理解训练则允许模型也能生成该概念。研究表明,跨任务可用性取决于概念绑定进入共享计算的位置,特别是在理解路径的入口点需要一个共享的语义格式。

  8. TOOL · CL_187218 ·

    新系统利用大型语言模型和图像生成技术,根据文本描述可视化梦境

    研究人员开发了一个名为梦境场景可视化器(DSV)的系统,该系统可将书面梦境描述转换为一系列四张图像。该系统首先使用大型语言模型将梦境叙事划分为四个按时间顺序排列的片段。随后,文本到图像模型为每个片段生成视觉效果,确保序列的视觉一致性,并重新生成与文本不符的图像。DSV 的有效性通过 DreamBank 的 50 个梦境可视化样本进行了评估,并利用 CLIP、DINOv2 和 Qwen2-VL 模型通过客观指标进行了评估。

  9. TOOL · CL_183427 ·

    新基准揭示文本到图像模型难以进行面向对象的空间推理

    研究人员开发了FoR-T2I,一个旨在评估文本到图像模型理解和遵循空间指令能力的新基准,特别是在参照系不同时。该基准包含1200对提示,测试模型区分摄像机视角坐标和对象内在方向的能力。在评估的22个模型中,需要面向对象参照系的提示性能显著下降,表明普遍存在此类空间推理的困难。一种VLM门控重写方法通过选择带有视觉反馈的重写提示,显示出提高准确性的潜力。

  10. RESEARCH · CL_174265 ·

    新基准MPIE-Bench解决了多人图像编辑的失败问题 · 跟踪2个来源

    研究人员推出了MPIE-Bench,这是一个旨在评估文本到图像和编辑模型准确描绘多人交互能力的新基准。该基准包含2,500个视频挖掘的编辑三元组,侧重于解剖学上的合理性和交互准确性,解决了肢体融合和身体穿透等常见失败问题。MPIE-Eval,一个新的评估指标,使用网格重建对接触时间几何进行评分,表明当前模型在解剖学和交互方面同时表现出色存在困难,在通过视觉语言模型评估时,其表现通常优于人类判断。

  11. TOOL · CL_158588 ·

    新框架支持使用扩散模型进行单步视频编辑

    研究人员开发了OSVE,一个能够使用单步文本到图像扩散模型实现单步视频编辑的新框架。该方法解决了扩散模型视频编辑通常需要耗时的多步过程的问题。OSVE利用一个可学习的编码器进行快速噪声预测,并采用新颖的统一帧编辑技术来保持帧间的时间一致性,从而在实现与现有方法相当的编辑质量的同时,显著提高了速度。

  12. TOOL · CL_156286 ·

    新的TARA框架改进了文本到图像提示优化

    研究人员引入了类型感知修复分配(TARA)框架来解决文本到图像生成器中的失败问题。TARA将语义提示优化视为一个原子修复分配过程来优化提示,其中每个失败都被路由到特定的修复算子。这种方法包括诊断、分配、编译和一个语义修复门,旨在防止语义回归。实验表明,TARA在各种生成器和数据集上的语义准确性方面优于VisualPrompter等现有方法,同时速度更快并保持图像质量。

  13. RESEARCH · CL_154463 ·

    新JAGG方法将扩散模型训练速度提高2倍

    研究人员开发了一种名为Jacobian-Aggregated Group Gradient (JAGG)的新技术,以显著加快强化学习任务中扩散模型的训练速度。目前的方法在每个采样步骤中通过高容量的Diffusion Transformer (DiT)骨干网络反向传播梯度时面临计算瓶颈,导致高分辨率图像生成的训练成本高昂。JAGG通过近似中间雅可比矩阵并聚合梯度,将反向传播次数减少了约一半,同时保持了可忽略的质量损失,这在文本到图像基准…

  14. TOOL · CL_151878 ·

    新的奖励模型可消除文本到图像评估中的文化真实性偏差

    研究人员开发了一个新的奖励建模框架,旨在通过关注文化真实性来评估和消除文本到图像生成系统中的偏差。该框架基于一个42亿参数的多模态大型语言模型构建,包含新颖的隐式文化探测器和跳跃连接交叉注意力机制,以更好地捕捉细微的文化细节。该模型在一个精选的基准测试中取得了高精度,并与现有的基于VQA的评估器相比,速度显著提升,使其适用于偏好优化流程。

  15. RESEARCH · CL_139562 ·

    新研究发现,使用合成数据进行AI训练会放大真实数据的隐私风险

    新研究表明,将真实数据和合成数据结合用于训练AI模型(一种称为真实-合成混合训练(RSMT)的做法)可能会无意中放大真实数据的隐私风险。研究提出了理论框架和RSMixLeak等方法来评估和缓解这些放大的隐私泄露。此外,一份实用指南探讨了如何生成具有差分隐私(DP)的合成数据,以平衡效用和强大的隐私保证,旨在提高DP合成数据方法的信任度和采用率。

  16. TOOL · CL_128906 ·

    新框架统一了生成模型间的成员推断攻击

    研究人员开发了一个统一的成员推断攻击(MIA)框架,该框架可应用于包括文本到文本、文本到图像和图像到文本在内的各种生成模型模态。这种新方法克服了先前将每种模态孤立处理的局限性。该框架利用了生成模型的输出分布可以近似其训练数据分布的观察结果,从而通过在共享嵌入空间中进行似然比测试来实现成员推断。在黑盒设置下的广泛实验表明,与现有的单类优化方法相比,该框架表现出优越的性能。

  17. RESEARCH · CL_117448 ·

    新框架推动真实文本到LiDAR场景生成

    研究人员开发了两个新的真实LiDAR场景生成框架,以解决当前文本到LiDAR生成能力的局限性。T2LDM++利用自条件表示引导机制来改进对象细节和可控性,并在超过100,000个文本-LiDAR样本上进行了训练。另一方面,LaGen是第一个专为逐帧、交互式LiDAR场景生成设计的自回归框架,能够使用边界框信息生成高保真4D场景,并减轻长序列中的误差累积。

  18. TOOL · CL_111804 ·

    新方法可在无需重新训练的情况下实现文本和图像到图像生成

    研究人员开发了TF-TI2I,一种新颖的文本和图像到图像生成方法,可以在无需进一步训练的情况下适配现有的文本到图像模型。该方法利用MM-DiT架构,使文本标记能够从视觉标记中隐式学习视觉信息。关键技术包括用于选择性信息共享的参考上下文掩码(Reference Contextual Masking)和用于缓解分布偏移的赢者通吃模块(Winner-Takes-All module)。该团队还引入了FG-TI2I Bench,一个旨在评估文…

  19. RESEARCH · CL_111634 ·

    新的自引导方法提高了AI图像生成的​​多样性

    研究人员开发了一种新的无需训练的方法,称为特征自引导,以解决用于图像生成的预训练流模型中的多样性崩溃问题。该技术在批量生成过程中分散内部特征,并使用流形正则化使其与数据流形保持一致,从而在不牺牲质量的情况下确保输出的多样性。这种即插即用模块的推理成本很小,并且在文本到图像和深度到图像生成等各种条件流模型的​​多样性方面显示出显著的改进。

  20. TOOL · CL_107995 ·

    新框架自动化文本到图像越狱评估

    研究人员推出 PixJail,一个新颖的代理框架,旨在自动化文本到图像(T2I)越狱技术的复现和评估。该框架解决了越狱方法快速演变以及 T2I 评估的复杂性等挑战,后者涉及单一提示之外的多个阶段。PixJail 构建了论文特定的攻击模块和可运行的评估管道,旨在以最小的错误忠实地复现原始实验结果。它还包含一个内存库来存储过去的经验,以促进未来的复现工作并减少人工劳动。