PulseAugur
中
实时 15:02:40
实体 transformer-based judges

transformer-based judges

PulseAugur coverage of transformer-based judges — every cluster mentioning transformer-based judges across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_196086 ·

    研究发现 LVLM 在图像序列时间推理方面存在困难

    一项新的研究论文强调了当前大型视觉语言模型(LVLM)评估图像序列中时间推理能力的一个关键缺陷。研究表明,这些模型表现出显著的偏见,例如首因效应和近因效应,其中图像帧的位置不成比例地影响它们对叙事连贯性而非语义一致性的判断。这表明现有的基于 Transformer 的裁判模型不适合评估视觉叙事的时间流程,因此有必要开发新的评估范式,将序列视为统一的逻辑结构。

  2. TOOL · CL_201669 ·

    LVLMs 因位置偏差而在图像序列时间推理方面遇到困难

    一篇新论文强调了大型视觉语言模型(LVLMs)在评估图像序列中的时间推理方面存在一个关键缺陷。目前用作裁判的 LVLMs 表现出显著的偏差,倾向于帧的位置(优先效应和近因效应)而非其语义一致性。这种结构性限制,可能源于 transformer 架构,意味着这些模型难以区分连贯的叙事与混乱或矛盾的叙事。该研究呼吁开发将视觉序列视为统一逻辑结构的、具有时间意识的评估范式。