PulseAugur
中
实时 08:28:18
实体 PatternRL

PatternRL

PulseAugur coverage of PatternRL — every cluster mentioning PatternRL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_215738 ·

    新的基准测试 PatternEval 突出了多模态大语言模型中的响应模式失败

    一项名为 PatternEval 的新诊断基准测试已被开发出来,用于识别混合思维多模态大语言模型(MLLMs)中响应模式的不对齐。当模型的审慎思考模式和其更快的非思考模式产生不同类型的错误时,就会发生这种不对齐,例如思维链泄露或逻辑矛盾。研究人员还引入了 PatternRL,一种具有模式特定惩罚的强化学习方法,该方法已被证明可以减少 Qwen3-VL-4B 和 Qwen3-VL-8B 等模型中的这种跨模式失败,同时对整体任务性能的影响很小。

  2. TOOL · CL_200240 ·

    新基准PatternEval识别混合思维多模态大语言模型的响应失败

    研究人员开发了一个名为PatternEval的新基准,用于评估采用混合思维方法的多模态大语言模型(MLLMs)。该基准识别出常见的失败模式,如思维链泄露、响应重复、逻辑矛盾和表现性推理。研究发现,这些响应模式失败普遍存在,尤其是在非思维推理模式下,导致不同推理策略之间存在不一致。为解决此问题,研究团队引入了PatternRM(一种奖励模型)和PatternRL(一种结合了模式特定惩罚的强化学习技术),并证明了其在缓解Qwen3-VL模…