DeepResearch Bench
PulseAugur coverage of DeepResearch Bench — every cluster mentioning DeepResearch Bench across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
DeepWeaver框架增强了LLM在开放式问答中的证据综合能力
研究人员推出DeepWeaver,一个旨在提高大型语言模型(LLM)在开放式问答中证据综合能力的新框架。该框架解决了LLM在组织和整合检索信息以生成全面、引用准确的答案时遇到的“证据综合差距”问题。DeepWeaver利用“思维块链”(TBCs)来构建论点、证据和关键词,从而在最终生成前进行迭代优化。在LoQA和DeepResearch Bench等基准测试上的评估表明,DeepWeaver在各种LLM上都能提高内容的充分性、引用的准…
-
新研究增强了 AI 代理的记忆、推理和有根据能力
研究人员正在开发先进的方法,使 AI 代理能够有效地利用长期记忆并提高其推理能力。一种名为查询条件重用 (QCR) 的方法侧重于代理如何将过去的轨迹适应新环境,在各种基准测试中显示出成功率和令牌效率的显著提高。另一个研究领域通过使用步级自蒸馏和证据锚来指导学习,解决了深度搜索代理强化学习中奖励稀疏的问题。此外,SynWeaver 等框架旨在通过与网站特定先验知识共同合成任务和轨迹来提高代理的泛化能力,而 LoongReflect 通过…
-
新的深度研究预训练框架增强了AI代理的训练
研究人员开发了深度研究预训练(DRP)框架,这是一个旨在改进深度研究代理训练的离线框架。DRP从现有证据结构(如引文图谱和超链接)中提取监督信号,将其转换为搜索-打开-写入轨迹。该方法教会模型在不需要实时检索环境的情况下有效地搜索、检查文档和综合证据。在学术引文图谱(DRP-Paper)和Wikipedia超链接(DRP-Web)上进行测试时,DRP的表现始终优于未经训练的模型,即使在数据量较少的情况下也能取得更好的结果,并在下游代理…
-
ScaffoldAgent框架动态优化研究大纲
研究人员推出ScaffoldAgent,一个旨在通过动态优化报告大纲来增强开放式深度研究的新框架。该系统采用效用引导反馈机制,通过扩展、收缩和修订操作来管理大纲演变。在DeepResearch Bench和DeepResearch Gym上的实验表明,与现有的深度研究代理相比,ScaffoldAgent提高了长篇报告生成和事实依据的准确性。
-
百度DuMate智能体在PinchBench和DeepResearch基准测试中名列前茅
百度DuMate智能体在PinchBench和DeepResearch两大关键基准测试中均取得了领先地位。在评估真实场景下多步推理和工具使用的PinchBench测试中,DuMate占据了前两名,超越了Anthropic和OpenAI的模型。该智能体的成功归功于其端到端的协作Harness架构,该架构能够智能地在本地或云端处理任务并优化上下文组装。DuMate还在专为复杂研究任务设计的DeepResearch基准测试中领先,展示了其先…
-
Hugging Face 推出可扩展的企业深度研究架构
研究人员开发了一种名为企业深度研究(EDR)的新架构,以提高企业环境中深度研究任务的质量和可扩展性。EDR 解决了信息覆盖不全、上下文信息过载和研究过早停止等常见问题。该系统通过将请求分解为可管理的目标、通过依赖性指导控制信息流以及实施基于证据的终止标准来确保收集到足够的信息来实现这一点。
-
新的EDR架构可防止企业深度研究过早停止
研究人员推出了一种新的企业深度研究(EDR)架构,旨在提高研究报告的质量和一致性。该系统通过将请求分解为可管理的目标来解决信息覆盖不完整和过早停止等常见问题。它通过大纲生成与反思、本地化上下文管理以及基于证据的完成标准来实现这一点,确保代理在得出结论前收集到足够的信息。