PulseAugur
实时 11:49:57
English(EN) EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

新的 EgoMonth 基准揭示 MLLM 在长期记忆方面存在困难

引入了一个名为 EgoMonth 的新基准,用于评估多模态大语言模型(MLLM)的长期时空记忆。该基准包含来自 20 名参与者的超过 300 小时的第一人称视频记录,跨度长达 120 天,并包含 1,443 个由人类精心设计的问题。包括 Gemini 2.5 Pro 在内的当前最先进模型,与人类基线相比表现出显著的性能差距,尤其是在需要路线推理和空间判断的任务中。研究结果表明,现有的 MLLM 更像是会丢失信息的摘要器,而不是忠实的记忆者,这表明需要具有改进长期记忆能力的架构。 AI

影响 凸显了当前 MLLM 在需要持续记忆的任务中的局限性,表明需要新的架构。

排序理由 该集群描述了一个新的学术基准和对现有模型的评估。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 EgoMonth 基准揭示 MLLM 在长期记忆方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi ·

    EgoMonth:一个用于长期时空记忆的月度级别自中心视频基准

    arXiv:2608.13113v1 Announce Type: cross Abstract: Recent advances in Multimodal Large Language Models (MLLMs) have led to substantial progress in video understanding, accompanied by a growing number of long video benchmarks. However, existing benchmarks rely predominantly on web-…