PulseAugur
实时 15:15:01
实体 text-to-image model

text-to-image model

PulseAugur coverage of text-to-image model — every cluster mentioning text-to-image model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
11
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/1 页 · 共 15 条
  1. RESEARCH · CL_154463 ·

    新JAGG方法将扩散模型训练速度提高2倍

    研究人员开发了一种名为Jacobian-Aggregated Group Gradient (JAGG)的新技术,以显著加快强化学习任务中扩散模型的训练速度。目前的方法在每个采样步骤中通过高容量的Diffusion Transformer (DiT)骨干网络反向传播梯度时面临计算瓶颈,导致高分辨率图像生成的训练成本高昂。JAGG通过近似中间雅可比矩阵并聚合梯度,将反向传播次数减少了约一半,同时保持了可忽略的质量损失,这在文本到图像基准…

  2. TOOL · CL_151878 ·

    新的奖励模型可消除文本到图像评估中的文化真实性偏差

    研究人员开发了一个新的奖励建模框架,旨在通过关注文化真实性来评估和消除文本到图像生成系统中的偏差。该框架基于一个42亿参数的多模态大型语言模型构建,包含新颖的隐式文化探测器和跳跃连接交叉注意力机制,以更好地捕捉细微的文化细节。该模型在一个精选的基准测试中取得了高精度,并与现有的基于VQA的评估器相比,速度显著提升,使其适用于偏好优化流程。

  3. RESEARCH · CL_139562 ·

    新研究发现,使用合成数据进行AI训练会放大真实数据的隐私风险

    新研究表明,将真实数据和合成数据结合用于训练AI模型(一种称为真实-合成混合训练(RSMT)的做法)可能会无意中放大真实数据的隐私风险。研究提出了理论框架和RSMixLeak等方法来评估和缓解这些放大的隐私泄露。此外,一份实用指南探讨了如何生成具有差分隐私(DP)的合成数据,以平衡效用和强大的隐私保证,旨在提高DP合成数据方法的信任度和采用率。

  4. TOOL · CL_128906 ·

    新框架统一了生成模型间的成员推断攻击

    研究人员开发了一个统一的成员推断攻击(MIA)框架,该框架可应用于包括文本到文本、文本到图像和图像到文本在内的各种生成模型模态。这种新方法克服了先前将每种模态孤立处理的局限性。该框架利用了生成模型的输出分布可以近似其训练数据分布的观察结果,从而通过在共享嵌入空间中进行似然比测试来实现成员推断。在黑盒设置下的广泛实验表明,与现有的单类优化方法相比,该框架表现出优越的性能。

  5. RESEARCH · CL_117448 ·

    新框架推动真实文本到LiDAR场景生成

    研究人员开发了两个新的真实LiDAR场景生成框架,以解决当前文本到LiDAR生成能力的局限性。T2LDM++利用自条件表示引导机制来改进对象细节和可控性,并在超过100,000个文本-LiDAR样本上进行了训练。另一方面,LaGen是第一个专为逐帧、交互式LiDAR场景生成设计的自回归框架,能够使用边界框信息生成高保真4D场景,并减轻长序列中的误差累积。

  6. TOOL · CL_111804 ·

    新方法可在无需重新训练的情况下实现文本和图像到图像生成

    研究人员开发了TF-TI2I,一种新颖的文本和图像到图像生成方法,可以在无需进一步训练的情况下适配现有的文本到图像模型。该方法利用MM-DiT架构,使文本标记能够从视觉标记中隐式学习视觉信息。关键技术包括用于选择性信息共享的参考上下文掩码(Reference Contextual Masking)和用于缓解分布偏移的赢者通吃模块(Winner-Takes-All module)。该团队还引入了FG-TI2I Bench,一个旨在评估文…

  7. RESEARCH · CL_111634 ·

    新的自引导方法提高了AI图像生成的​​多样性

    研究人员开发了一种新的无需训练的方法,称为特征自引导,以解决用于图像生成的预训练流模型中的多样性崩溃问题。该技术在批量生成过程中分散内部特征,并使用流形正则化使其与数据流形保持一致,从而在不牺牲质量的情况下确保输出的多样性。这种即插即用模块的推理成本很小,并且在文本到图像和深度到图像生成等各种条件流模型的​​多样性方面显示出显著的改进。

  8. TOOL · CL_107995 ·

    新框架自动化文本到图像越狱评估

    研究人员推出 PixJail,一个新颖的代理框架,旨在自动化文本到图像(T2I)越狱技术的复现和评估。该框架解决了越狱方法快速演变以及 T2I 评估的复杂性等挑战,后者涉及单一提示之外的多个阶段。PixJail 构建了论文特定的攻击模块和可运行的评估管道,旨在以最小的错误忠实地复现原始实验结果。它还包含一个内存库来存储过去的经验,以促进未来的复现工作并减少人工劳动。

  9. RESEARCH · CL_107583 ·

    DiffusionBench 基准和 NanoGen 框架挑战图像生成评估

    研究人员推出了 DiffusionBench,这是一个旨在全面评估用于图像生成的扩散 Transformer (DiTs) 的新基准。该基准强调,目前主要关注 ImageNet 上类别条件生成的评估方法,与文本到图像生成任务的性能相关性不佳。为了促进这种更广泛的评估,他们还开发了 NanoGen,这是一个用于训练和评估 DiTs 的统一框架,使得文本到图像生成在计算上可与基于 ImageNet 的评估相媲美。研究结果表明,在 Imag…

  10. TOOL · CL_105251 ·

    新基准揭示文本到图像模型在地理街景准确性方面存在困难

    研究人员开发了GeoFidelity-Bench,这是一个旨在评估文本到图像模型在生成街景图像时的地理准确性的新基准。该基准使用来自Mapillary的7,117张图像的精选数据集,涵盖全球25个城市的109个特定道路片段,数据源自OpenStreetMap。对六个开源模型的初步评估显示,与仅提供城市名称的提示相比,提供街道和社区名称可将检索准确性提高约5.5个百分点,但模型在生成与特定道路片段精确匹配的图像方面仍存在困难,这表明在生…

  11. RESEARCH · CL_104687 ·

    新框架统一图像生成能力;研究解决蒸馏挑战

    研究人员推出了一种新颖的 on-policy 生成场蒸馏框架 DanceOPD,旨在将文本到图像、局部编辑和全局编辑等多种图像生成能力统一到单个模型中。该框架解决了将这些能力结合起来可能导致性能下降的常见问题。DanceOPD 将样本路由到特定的能力场,并使用速度 MSE 目标进行训练,从而在保持整体生成质量的同时组合专家能力。此外,其他研究还探索了 on-policy 蒸馏技术,包括缓解输出多样性减少和解决长推理任务中的位置偏差的方…

  12. RESEARCH · CL_86897 ·

    新的模态强制技术增强图像和深度生成

    研究人员开发了一种名为模态强制的新型训练后技术,该技术使文本到图像模型能够同时生成图像和深度图。该方法仅需要稀疏的深度数据,并且可以应用于现有的 Diffusion Transformer 模型。该技术表明,在更多图像数据上训练的更大模型可以产生更准确的深度预测,其中最强的模型在与最先进的单目深度估计器相比时取得了有竞争力的结果。

  13. TOOL · CL_65374 ·

    OctoT2I框架通过自进化路由增强文本到图像生成

    研究人员推出了OctoT2I,一个旨在通过优化质量和效率来改进文本到图像生成的新型代理框架。该系统采用多轮路由策略,根据其通过新颖的自进化机制构建的知识和记忆,自适应地选择最佳工具。该机制自主定义概念维度,并使用迭代循环在没有人为监督的情况下发现工具能力,从而带来显著的推理速度和能源效率提升。

  14. TOOL · CL_59105 ·

    新的 GASS 方法通过几何采样提升文本到图像生成的多样性

    研究人员开发了一种名为几何感知球面采样(GASS)的新方法,以提高文本到图像模型的图像生成多样性。GASS 通过显式控制变异源来解决这些模型生成语义一致但视觉相似的图像的常见问题。该技术将图像嵌入的变异分解为依赖于提示和独立于提示的组成部分,引导生成过程沿着这些轴扩展嵌入的几何范围。实验表明,GASS 在不同生成模型架构上,对图像质量和语义准确性的影响极小的情况下,增强了多样性。

  15. RESEARCH · CL_06550 ·

    LLM驱动的文本提示生成多样化的边缘案例图像用于AI训练

    研究人员开发了一种自动化的方法来生成具有挑战性的边缘案例,用于训练深度神经网络,从而解决了手动数据整理的瓶颈。该流程使用一个通过偏好学习精炼的大型语言模型(LLM),将图像标题转换为提示。这些提示随后指导文本到图像模型创建困难的视觉场景,从而增强模型的鲁棒性。在FishEye8K目标检测基准上进行测试,该方法与标准增强和手动提示工程相比,表现出更优越的性能。