Flow-GRPO
PulseAugur coverage of Flow-GRPO — every cluster mentioning Flow-GRPO across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究探索离散流匹配和强化学习在生成模型中的应用
两篇研究论文探讨了生成模型方面的进展,重点关注离散结构和基于流的模型。第一篇论文引入了上下文加权离散流匹配,通过考虑局部上下文来提高离散数据上的生成质量,在OpenWebText上将生成困惑度降低了高达63%。第二篇论文(已被撤回)提出了SuperFlow,一个使用强化学习的框架,用于提高文本到图像生成流模型的训练效率和性能,显示出训练时间的显著缩短和优于现有模型的性能。
-
新框架SpatialFlow-GRPO通过细粒度奖励增强图像编辑
研究人员推出了一种新颖的训练框架SpatialFlow-GRPO,旨在通过解决强化学习中全图奖励信号的局限性来提高图像编辑质量。该新方法结合了空间细粒度奖励反馈,将区域感知奖励转换为与策略更新期间特定潜在位置对齐的优化信号。该框架还包括一个名为SFReward的区域感知奖励模型、一个名为SFReward-14K的数据集,以及一个名为MultiEditBench的基准套件,用于评估多区域编辑能力。在OmniGen2和FLUX.2-kle…
-
新方法通过改进的奖励和简化的模型增强文本到图像生成
研究人员开发了改进文本到图像生成模型的新方法。DiT-Reward,一种新颖的方法,利用预训练的Diffusion Transformers创建奖励模型,该模型在偏好基准测试中优于现有方法,同时还提供更快的推理速度。此外,RubricRL引入了一个更具可解释性和可定制性的强化学习对齐框架,使用结构化的视觉标准清单而不是单一标量奖励。另外,MiniT2I证明了可以使用简化的架构和可管理的计算资源实现具有竞争力的文本到图像生成。
-
新的 MoTiF 框架改进了多模态模型中的交错推理
研究人员开发了一个名为 MoTiF 的新框架,以解决交错推理模型中的“模态隔离”问题,即文本和图像生成会断开连接。MoTiF 采用两阶段训练过程,包括反思性 SFT 和 Flow-GRPO,以直接优化文本推理和视觉生成之间的转换。这种方法侧重于在每个边界处提高跨模态的连贯性,与仅依赖最终任务准确性的方法相比,在视觉谜题基准测试上表现更好。
-
Stable-Layers 使用 VLM 反馈改进图像层分解
研究人员开发了 Stable-Layers,一个旨在改进图像层分解模型的新型强化学习框架。该系统通过利用视觉语言模型 (VLM) 的反馈,绕过了对配对训练数据的需求。通过采用 Flow-GRPO 和 LoRA 适配,Stable-Layers 优化了策略训练,并在 Crello 数据集上与基础模型相比,展示了增强的层分离和减少的重建误差。
-
AI模型利用新的强化学习和视角偏差技术解决3D生成一致性问题
研究人员开发了World-R1,一个新颖的框架,它使用强化学习来改进文本到视频生成中的3D一致性,而无需改变核心架构。该方法利用了预训练的3D和视觉语言模型的反馈,以及一个专门用于世界模拟的文本数据集。此外,ConsDreamer通过改进评分蒸馏过程来解决文本到3D生成中的视角偏差问题,缓解了多面Janus问题等问题,并增强了几何一致性。