实体
IMAVB
IMAVB
PulseAugur coverage of IMAVB — every cluster mentioning IMAVB across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
全模态大语言模型难以检测感官与文本信息冲突
研究人员在全模态大语言模型中发现了一个“表征-行动鸿沟”,即模型能够编码文本声明与其感官输入之间的不匹配,但在其输出中却无法基于此信息采取行动。研究人员使用电影片段开发了一个新的基准测试IMA VB,以测试这种冲突检测能力。在八个开源模型和Gemini 3.1 Pro上进行的研究发现,模型要么低估拒绝错误声明,要么过度拒绝,从而影响理解准确性。这种鸿沟在音频方面比在视觉方面更明显,并且对提示具有抵抗力,尽管一种探针引导的logit调整…
-
Omnimodal LLMs 无法对检测到的感官矛盾采取行动
研究人员在全模态大型语言模型中发现了一个“表征-行动鸿沟”,即模型能够内部识别文本声明与其感官输入之间的矛盾,但无法在其输出中反映出来。使用电影片段创建了一个新的基准 IMAVB 来测试此能力,结果显示当前模型要么接受错误的假设,要么拒绝过多的标准声明。研究表明,这些模型中基础化的瓶颈在于将感知转化为行动,而不是感知本身。