PulseAugur
实时 08:16:10
实体 PickScore

PickScore

PulseAugur coverage of PickScore — every cluster mentioning PickScore across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_210612 ·

    新的PALATE框架可根据个人品味定制AI肖像修饰

    研究人员开发了PALATE,一个用于个性化肖像修饰的新颖框架,该框架无需广泛的用户特定训练即可适应个人用户品味。该系统采用共享奖励演化方法,在维护固定图像编辑器的同时,个性化修饰图像的选择。PALATE将用户奖励分解为全局主干、类别级残差和轻量级用户适配器,在PPR10K数据集上预测用户偏好的准确率达到72.83%,显著优于PickScore等现有基线。

  2. TOOL · CL_193549 ·

    新的RL原生蒸馏框架提升图像生成效率

    研究人员开发了一个名为REST(Reward-Enhanced Scored-Trajectory Distillation)的新框架,该框架将强化学习(RL)与少步蒸馏相结合,以实现更高效的文本到图像生成。该方法允许学生模型从RL教师轨迹的中间状态进行学习,避免了顺序训练成本。此外,引入了优势调制蒸馏(AMD)来将监督集中在首选轨迹上,从而提高学生模型的性能。实验表明,REST在训练量显著减少的情况下,可以达到或超过其40步RL教师的质量。

  3. TOOL · CL_202789 ·

    新的RL原生蒸馏框架提升文本到图像生成效率

    研究人员开发了一个名为奖励增强评分轨迹蒸馏(REST)的新框架,该框架将强化学习(RL)与少步蒸馏相结合,以实现更高效的文本到图像生成。与之前顺序训练这些组件的方法不同,REST在一个阶段内共同训练它们。这种方法利用RL教师生成的奖励评分轨迹来监督学生模型,防止在压缩过程中损失奖励增益。一种额外的技术,优势调制蒸馏(AMD),通过利用不同轨迹的优势来调节蒸馏监督,从而进一步完善这一过程,加强从首选输��学习并抑制不太理想的输出。实验表…

  4. TOOL · CL_167669 ·

    新的FlowCTS方法在关键基准测试中提升了流模型的性能

    研究人员推出了一种用于流模型的策略内连续轨迹监督的新颖方法FlowCTS。该技术旨在通过匹配从同一学生访问状态初始化的学生轨迹和参考轨迹来提高性能。FlowCTS在GenEval、光学字符识别(OCR)和PickScore等基准测试中取得了显著改进,其表现优于现有的基于KL的策略内蒸馏和标准监督微调等方法。

  5. RESEARCH · CL_164780 ·

    新的摊销矩匹配技术增强视觉生成模型

    研究人员引入了摊销矩匹配(AMM),一种使用神经网络从数据矩学习分布训练信号的新技术。该方法实例化为摊销弗雷歇距离(AMFD)损失,提供了比精确统计匹配更鲁棒的训练动态,并显著提高了在ImageNet和FDr$^6$等基准测试上的性能。AMM在文本到图像生成方面也显示出潜力,增强了指令遵循能力,并在GenEval基准测试上超越了多步教师模型。

  6. RESEARCH · CL_167450 ·

    新的策略内蒸馏方法提升LLM推理能力和效率 · 跟踪10个来源

    多篇研究论文探讨了语言模型策略内蒸馏(OPD)技术的进展,旨在提高推理能力和训练效率。包括SimpleOPD、S$^2$VOPD、LOPD、CROP、DAPD和REOPD在内的几种方法,引入了新颖的策略来解决分词器不匹配、特权幻觉和选择性监督等挑战。这些方法旨在提高数学推理、代码生成和细粒度感知等任务的性能,其中一些方法展示了相对于现有方法的显著提升,甚至超越了Gemini-2.5-Pro和GPT-5.4等大型模型。

  7. RESEARCH · CL_123210 ·

    新方法增强视觉生成模型,提高图像质量和多样性 · 跟踪 6 个来源

    研究人员开发了新的方法来优化视觉生成模型,解决了奖励欺骗和模式崩溃等问题。一种方法在强化学习中使用逐分布奖励来提高图像多样性和质量,在 SiT 和 EDM2 等模型的 FID-50K 分数上显示出显著的改进。另一种方法,表示分布匹配 (RDM),通过匹配冻结编码器下的特征分布来训练单步图像生成器,在 ImageNet 上取得了新的最先进成果,并改进了 FLUX.2 等现有模型。

  8. RESEARCH · CL_95837 ·

    新的STAR方法通过自适应奖励分配增强文本到图像生成

    研究人员开发了一种名为时空自适应奖励(STAR)分配的新方法,以改进文本到图像生成模型。该技术通过在不同生成阶段动态地将奖励分配给图像的特定区域,解决了现有强化学习后训练方法中的粒度不匹配问题。通过专注于与用户提示直接对齐的内容,STAR增强了组合语义对齐和文本渲染能力。该方法使用Stable Diffusion 3.5 Medium进行了评估,并在GenEval、OCR文本渲染和PickScore等任务中显示出显著的改进。