一篇新的研究论文探讨了动作后训练如何影响视觉语言模型(VLM)的深度感知能力。研究发现,与基础 VLM 相比,用于构建视觉语言动作(VLA)模型的这种后训练过程会显著降低所有层的深度可解码性。这种退化在晚期层尤为明显,这种现象被称为“悬崖”,它与晚期层 MLP 内部的干扰有因果关系。 AI
影响 这项研究突显了 VLM 训练中潜在的权衡,表明面向动作的微调可能会损害核心的空间理解能力。
排序理由 该集群包含一篇详细介绍 VLM 能力研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Molmo2-ER
- MolmoAct2-LIBERO
- multilayer perceptron
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →