一项名为HybridDeepResearch的新基准测试已被引入,用于评估AI代理结合来自网络搜索和结构化数据库查询的信息的能力。该基准测试包含380个任务,旨在解决现有评估将这些模态孤立评估的局限性。初步结果显示,即使是GLM-5.2、Claude Sonnet 4.6和GPT-5等先进模型,在挑战性任务上的成功率也仅在50-54%左右,这表明有效连接结构化和非结构化数据仍然是AI代理面临的重大障碍。 AI
影响 突出了AI代理开发中的一个关键挑战:有效整合多样化的数据源。
排序理由 该集群包含一篇介绍AI代理新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →