研究人员推出SYNCR,这是一个用于评估和训练多模态大语言模型(MLLM)跨视频推理能力的新框架。SYNCR使用Habitat、Kubric和CLEVRER等模拟引擎构建,提供了一个受控环境,包含数千个跨八种不同推理任务的问题和训练示例。对当前MLLM的评估显示,它们在物理比较和场景整合方面存在显著弱点,即使是最好的模型也无法达到人类水平。然而,使用SYNCR数据进行微调已显示出显著的改进,尤其是在时间顺序方面,即使在训练期间未见过的数据上也能观察到提升。 AI
影响 为诊断和改进MLLM的跨视频推理能力建立了一个受控环境,有可能加速复杂AI理解方面的进展。
排序理由 该集群描述了一个用于评估AI模型的新基准和框架,该基准和框架在学术论文中发表。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →