引入了一个名为V-ICAL的新基准,用于评估多模态智能体在交互式环境中从视频演示中学习的能力。该基准包含37个环境中的342个任务,评估智能体将视频示例转化为可执行策略以及适应新情况的能力。包括Seed-2.1-Pro、Gemini-3.1-Pro和GPT-5.6在内的当前最先进的智能体显示出显著的局限性,表现最佳的智能体得分仅为54.4,表明这些智能体在基于视频的上下文学习能力方面存在重大差距。 AI
影响 突出了多模态智能体能力方面的重大差距,有必要在基于视频的上下文学习方面取得进展。
排序理由 该集群描述了一个新的学术基准和对现有模型的评估,符合研究类别。
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Few-shot learning
- Gemini-3.1 Pro
- Gotit.pub
- GPT-5.6
- Hugging Face
- Influence Flower
- ScienceCast
- Seed-2.1-Pro
- V-ICAL
- V-ICAL Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →