PulseAugur
实时 09:36:46
实体 ViSTR-Bench

ViSTR-Bench

PulseAugur coverage of ViSTR-Bench — every cluster mentioning ViSTR-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_160947 ·

    新的ViSTR-Bench评估多模态大语言模型动态场景推理能力

    一个名为ViSTR-Bench的新基准被引入,用于评估多模态大语言模型(MLLMs)的空间-时间推理能力。该基准侧重于从动态场景的连续视觉线索中进行定性推理,弥补了现有评估通常关注静态场景或需要精确量化预测的不足。ViSTR-Bench包含15个子任务和1300多个视频问答对,评估运动感知、空间关系、结果预测和物理动力学。初步评估显示,当前最先进的MLLMs在复杂空间-时间推理方面仍远落后于人类表现。