PulseAugur
实时 08:54:11
English(EN) On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

苹果研究人员发现RL微调的视觉语言模型(VLMs)易受文本扰动影响

来自Apple Machine Learning Research的研究人员发现,经过强化学习(RL)微调的视觉语言模型(VLMs)存在显著的漏洞。虽然RL微调可以提高在视觉推理基准上的性能,但这些模型对文本扰动(如误导性标题或错误的思维链(CoT)追踪)表现出明显的易感性。研究发现,闭源模型尽管存在类似的失败模式,但与开源模型相比,其鲁棒性和推理一致性更强。这表明当前开源RL微调技术存在局限性,而非固有的任务限制,并突显了准确性-忠实性之间的权衡,即基准准确性收益可能会侵蚀CoT推理的可靠性。 AI

影响 强调了当前开源RL微调视觉语言模型(VLMs)的局限性,表明需要制定兼顾准确性、忠实性和鲁棒性的训练和评估协议。

排序理由 该集群包含一篇研究论文,详细介绍了关于RL微调的视觉语言模型(VLMs)的鲁棒性和一致性的发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 Apple Machine Learning Research 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

苹果研究人员发现RL微调的视觉语言模型(VLMs)易受文本扰动影响

报道来源 [1]

  1. Apple Machine Learning Research TIER_1 English(EN) ·

    关于 RL 微调的视觉语言模型 (VLM) 的鲁棒性和思维链一致性

    Reinforcement learning (RL) finetuning has become a key technique for enhancing large language models (LLMs) on reasoning-intensive tasks, motivating its extension to vision language models (VLMs). While RL-tuned VLMs improve on visual reasoning benchmarks, they remain vulnerable…