引入了一个名为 KITScenes LongTail 的新数据集,用于评估自动驾驶模型的推理能力。研究人员发现,当前模型经常未能将其陈述的推理与其执行的动作保持一致,这种现象被称为语义推理-行动不一致。有趣的是,当推理和行动不一致时,推理本身通常更准确,这表明模型拥有潜在的推理能力,但并未完全体现在其行动中。这项工作强调了模型需要连贯地依据其陈述的推理进行行动,以实现值得信赖的自动驾驶。 AI
影响 突出了当前自动驾驶人工智能的一个关键差距,表明提高推理-行动一致性对于值得信赖的部署是必要的。
排序理由 该集群基于一篇在 arXiv 上发表的研究论文,该论文详细介绍了一个新的数据集和评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →