研究人员推出了 Life-Bench,这是一个旨在评估大型语言模型多模态个性化能力的新基准。该基准包含 10 个任务中的 11,800 多个问答对,侧重于概念识别、事件理解和个人历史中的聚合推理。该研究还提出了 LifeGraph,一个个人知识图谱框架,用于辅助结构化检索源视觉证据,并表明当前的检索方法在复杂推理任务中存在困难,在聚合推理上的准确率低于 0.40。 AI
影响 为评估大型语言模型的多模态推理能力树立了新标准,突出了当前在复杂个人数据分析方面的局限性。
排序理由 该集群描述了一个用于评估人工智能能力的新学术基准和框架。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →