一项名为GTPred的新基准已被引入,用于评估多模态大语言模型(MLLMs)的地理时间预测能力。该基准包含来自120多年的370张图像,并评估MLLMs推断拍摄地点和时间的能力。对15种不同MLLMs进行的实验显示,尽管当前模型在视觉感知方面表现出色,但在世界知识和地理时间推理方面存在困难。研究还表明,整合时间信息可以显著提高位置推断的准确性。 AI
影响 突出了当前MLLMs在世界知识和地理时间推理方面的局限性,指出了未来发展的方向。
排序理由 该集群描述了一个新的学术基准和对现有模型的评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →