引入了一个名为 EgoMonth 的新基准,用于评估多模态大语言模型(MLLM)的长期时空记忆。该基准包含来自 20 名参与者的超过 300 小时的第一人称视频记录,跨度长达 120 天,并包含 1,443 个由人类精心设计的问题。包括 Gemini 2.5 Pro 在内的当前最先进模型,与人类基线相比表现出显著的性能差距,尤其是在需要路线推理和空间判断的任务中。研究结果表明,现有的 MLLM 更像是会丢失信息的摘要器,而不是忠实的记忆者,这表明需要具有改进长期记忆能力的架构。 AI
影响 凸显了当前 MLLM 在需要持续记忆的任务中的局限性,表明需要新的架构。
排序理由 该集群描述了一个新的学术基准和对现有模型的评估。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Cross-view Spatial Reasoning
- Direction Judgement
- EgoMonth
- Gemini 2.5 Pro
- Multimodal Large Language Models
- Route Reasoning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →