研究人员开发了 Video-DeepResearch (Video-DR),这是一种能够处理连续视频流以完成复杂研究任务的多模态代理。该新框架通过采用解耦的感知-探索管道和两阶段训练过程,解决了模态偏差和参数知识泄露问题。在评估中,Video-DeepResearch-35B-A3B 模型在一个具有挑战性的视频问答基准测试上取得了 64.0% 的新最先进准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro 等领先的专有模型。 AI
影响 为基于视频的人工智能研究代理树立了新的基准,有望推动多模态理解和工具使用的进步。
排序理由 该集群描述了一篇介绍新型多模态代理和基准的研究论文,并与现有模型进行了性能比较。
在 Hugging Face Daily Papers 阅读 →
- Claude-4.5-Sonnet
- Gemini 2.5 Pro
- GPT-5
- Group Relative Policy Optimization
- Video-DeepResearch
- Video-DR-Bench
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →