一个新的基准OmniAssistBench已被开发出来,用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手的性能。该基准通过逆向工程互联网视频构建而成,揭示出当前模型在视觉提示、多轮交互中保持上下文以及及时响应方面存在困难。在评估中,Google的Gemini 3-Pro得分66.4,而开源的Qwen3-Omni-Instruct得分51.2,这表明在这些模型能够可靠地作为交互式助手运行之前,仍有很大的改进空间。 AI
影响 该基准突显了全模态大语言模型在视觉理解和上下文交互方面的关键改进领域,而这些是开发有效AI助手的关键。
排序理由 该集群描述了一个用于评估全模态大语言模型的新学术基准的发布。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gemini 3-Pro
- Gotit.pub
- Hugging Face
- OmniAssistBench
- Omni-LLMs
- Qwen3-Omni-Instruct
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →