开源的 Video-DeepResearch 35B 模型在新视频推理基准上取得了 64% 的得分,超过了 GPT-5 的 52.5%。该模型也超越了 Claude 4.5 Sonnet,尽管研究团队对他们自己的基准测试结果进行了评分。 AI
影响 这一基准测试结果表明 AI 在视频推理能力方面可能取得进展,对现有顶级模型构成了挑战。
排序理由 该集群报告了一个开源模型的新基准测试结果,这是一个研究里程碑。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →