研究人员发现,多模态大语言模型(MLLMs)在处理序数回归任务(如年龄估计或图像质量评估)时存在显著差距。尽管内部模型状态与有序标签显示出很强的相关性,但最终的 token 输出未能反映这种序数证据。为解决此问题,开发了一种名为序数镜头对齐(Ordinal Lens Alignment, OLA)的新方法。OLA 使用在解码器层上训练的轻量级镜头来融合序数信息,并在生成过程中纠正最终的 token logit,其性能优于现有方法,同时保持主要的 MLLM 冻结。 AI
影响 提高了多模态大语言模型在需要有序输出的任务上的准确性,有可能增强其在医学成像和内容评估等领域的效用。
排序理由 研究论文,详细介绍了一种对齐多模态大语言模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →