研究人员开发了InfluenceField,这是一种新颖的可微分场,旨在增强大型语言模型中的多模态世界建模。该系统旨在通过在视觉编码器和语言解码器之间插入一个感知干预的潜在场,来改进视觉干预如何影响下游答案的预测。InfluenceField将图像块特征提升为连续的空间表示,通过多个步骤传播影响,并通过共享的转换算子预测干预效果。该模型在CausalVQA基准测试中准确率显著提高了13.1个百分点,尤其是在规划和假设推理任务中。 AI
影响 引入了一种新的多模态大语言模型架构,提高了因果推理能力和对干预的鲁棒性。
排序理由 这是一篇研究论文,详细介绍了新的模型架构及其在基准测试上的性能。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →