ImageReward
PulseAugur coverage of ImageReward — every cluster mentioning ImageReward across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
CachedSearch 通过新颖的缓存加速视频扩散模型搜索
研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…
-
新技术通过多视图蒸馏提升2D扩散模型生成的3D模型质量
研究人员开发了一种名为多视图聚合分数蒸馏(MV-SDI)的新技术,以提高从2D扩散模型生成的3D模型的质量。该方法通过在生成过程中聚合来自多个视图的信息来减少梯度的方差,而不是依赖于单个随机视图。MV-SDI保留了原始的2D扩散模型,无需重新训练或多视图数据,从而显著提高了模型的一致性并减少了所需的优化步骤。
-
AI 图像模型因强制统一审美而有缩小艺术表现范围的风险
来自不列颠哥伦比亚大学和 Weathon Software 研究人员的一篇新论文认为,当前 AI 图像生成模型因过度对齐狭隘的人类审美定义,实际上正在扼杀艺术表现。该研究表明,为生成普遍令人愉悦的图像(通常被描述为“糖果色”或“网红风格”照片)而训练的模型,正在边缘化多样的艺术风格,并可能通过将自身审美偏好强加给用户来逆转对齐过程。研究强调了这种趋势可能导致艺术同质化并限制创作可能性的担忧。
-
OrbitForge 通过视频合成和高斯溅射从文本生成 3D 场景
研究人员开发了 OrbitForge,一种利用文本到视频模型和高斯溅射从文本提示生成 3D 场景的新方法。OrbitForge 通过使用 3D 重建作为锚点来提高时间和空间一致性,将文本生成的视频转换为一致的 3D 场景。这种方法避免了特定任务的微调和每个提示的优化,同时还解决了 3D 场景生成中覆盖感知评估的需求。
-
SoftCap 通过新颖的控制层加速扩散 Transformer
研究人员推出 SoftCap,这是一种新颖的无需训练的控制层,旨在加速扩散 Transformer (DiTs)。该方法通过智能管理昂贵的完整 Transformer 评估的执行来优化推理过程。SoftCap 采用轨迹漂移观察器来评估缓存风险,并使用软预算 PI 控制器动态调整完整步骤的阈值,从而在不牺牲视觉质量的情况下提高效率。
-
Oracle Noise 框架通过更快的语义对齐来增强文本到图像模型
研究人员推出了一种名为 Oracle Noise 的新颖框架,旨在通过优化初始噪声输入来改进文本到图像扩散模型。该方法将噪声初始化重构为受语义驱动的、约束在超球体内的优化过程,从而防止范数膨胀并保留高斯先验。Oracle Noise 可有效识别提示中的关键结构词,以引导优化能量,从而在不依赖外部代理模型的情况下实现更快的收敛和更高的图像质量。实验表明,在 2 秒的优化窗口内,人类偏好、语义对齐和样本多样性均得到显著改善。