研究人员推出了CaliBench,这是一个旨在评估视频世界模型物理校准的新基准。与评估生成结果的现有方法不同,CaliBench在离散的、物理上可解释的空间(如掷骰子或转轮盘)中对结果进行评分。这使得可以直接衡量模型准确表示特定现象不确定性的能力。该基准应用于九个场景和六个领先的视频模型,结果显示大多数模型在校准方面存在困难,通常将概率质量集中在少数几个结果上,或得分较低,尤其是在处理模糊结果时。 AI
影响 为视频生成模型引入了新的评估方法,有可能推动其物理真实性和不确定性建模的改进。
排序理由 一篇介绍用于评估视频世界模型的新颖基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →