大连理工大学开发的新基准VA-Bench,用于评估多模态AI模型在机械臂任务上的表现。表现最佳的模型Qwen3.8-max仅完成了略多于一半的任务,凸显了AI在复杂、长时序操作方面的当前局限性。 AI
影响 凸显了多模态AI在复杂机器人任务中的当前局限性,指明了未来发展的方向。
排序理由 该集群描述了一个新的基准测试及其评估AI模型的结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →