BrowseComp+
PulseAugur coverage of BrowseComp+ — every cluster mentioning BrowseComp+ across labs, papers, and developer communities, ranked by signal.
- used by DagsHub 70%
- used by Gotit.pub 70%
- used by alphaXiv 70%
- used by ScienceCast 70%
- used by BrowseComp-ZH 70%
- instance of CatalyzeX 70%
- used by Grpo 70%
- instance of Gotit.pub 70%
- instance of React 70%
- instance of Generative Ai Interactive Agents 70%
- used by Deep Research 70%
- instance of DeepSearchQA 70%
4 天有情绪数据
-
新的DRBENCHER基准测试AI代理的综合浏览和数学技能
研究人员推出了DRBENCHER,这是一个旨在评估AI代理结合网络浏览和多步数学计算能力的基准。与以往单独评估这些技能的基准不同,DRBENCHER从知识图中综合问题,要求代理识别实体、检索属性并执行特定领域的计算。该基准涵盖五个领域:生物化学、金融、地球物理学、安全和历史。人工评估显示有效率为76%,其中相当一部分错误归因于过时的知识图数据,而即使是先进的前沿模型在该基准上的准确率也仅为20%。
-
新研究增强了 AI 代理的记忆、推理和有根据能力
研究人员正在开发先进的方法,使 AI 代理能够有效地利用长期记忆并提高其推理能力。一种名为查询条件重用 (QCR) 的方法侧重于代理如何将过去的轨迹适应新环境,在各种基准测试中显示出成功率和令牌效率的显著提高。另一个研究领域通过使用步级自蒸馏和证据锚来指导学习,解决了深度搜索代理强化学习中奖励稀疏的问题。此外,SynWeaver 等框架旨在通过与网站特定先验知识共同合成任务和轨迹来提高代理的泛化能力,而 LoongReflect 通过…
-
ChatGPT 的 Work 代理模式在复杂任务上表现不一
最近对 ChatGPT 代理模式(现称为 Work,由 GPT-5.6 提供支持)进行的为期 20 小时的测试显示结果好坏参半。虽然它在数据聚合和个性化消息等任务中显示出潜力,但在复杂步骤和验证码方面却举步维艰,有时会悄无声息地失败,或者比人类的表现慢得多。OpenAI 已将 Work 模式转为基于积分的系统,可能会引入新的使用限制,但这些限制尚未完全公开。
-
新研究旨在改进检索增强搜索代理 · 跟踪到2个来源
两篇新研究论文提出了提高检索增强搜索代理效率和有效性的方法。第一篇论文《HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents》提出了一种策略,一旦收集到多跳问题的充分证据就停止检索,从而在保持准确性的同时减少冗余搜索。第二篇论文《Fetch-then-Explore: Decoupling Selection from Extraction ov…
-
新的CRISP框架训练LLM搜索代理更高效
研究人员推出CRISP,一个旨在训练由大型语言模型驱动的更高效深度搜索代理的新框架。与以往简单减少工具使用的方法不同,CRISP识别并保留了必要的证据收集步骤,同时删除了冗余的步骤。该方法在BrowseComp和HLE-Verified上进行了测试,在不影响准确性的情况下显著减少了交互轮次。
-
新的信用分配方法增强了AI搜索代理的训练 · 跟踪3个来源
研究人员开发了训练长时搜索代理的新方法,这些代理是为执行复杂的多步任务而设计的AI系统。一种方法ABSeeker使用答案回溯信用分配(ABC)来提供更细粒度的监督,通过评估每个搜索步骤与来自地面真实答案的中间线索。另一种方法BiCAA采用双向信用分配,将前向可解性增益与事后成功关键性相结合,以生成密集的进程奖励。这两种技术都旨在提高训练稳定性并减少搜索增强代理中的冗余操作,ABSeeker在使用较小的模型在BrowseComp等基准测…
-
Anthropic 的 Claude Opus 5 在生物/网络任务中表现出色,绕过了 Fable 5 的限制
Anthropic 发布了 Claude Opus 5,将其定位为计算生物学和网络安全任务的强大工具。虽然“前沿”模型 Fable 5 在这些领域受到严格限制,Mythos 5 则仅对特定合作伙伴开放,但 Opus 5 提供了一种平衡的方法。它允许发现源代码漏洞,并在中短期生物任务中表现出色,在 Humanity's Last Exam 和 BrowseComp 等基准测试中取得高分。然而,Opus 5 在长期生物设计任务中可能会遇到…
-
Anthropic 的 Claude 食谱提供了高级代理构建食谱 · 跟踪 2 个来源
Anthropic 发布了一系列资源和教程,称为 Claude 食谱,详细介绍了如何使用其 Claude 模型和 SDK 构建和部署高级 AI 代理。这些资源涵盖了从重现基准分数、编排多代理系统到为网络安全、数据分析和 SRE 事件响应创建专用代理的各种应用。该食谱还提供了关于代理托管、内存能力以及将代理与 Slack 等平台集成的指导。
-
新的AI代理处理深度研究和误导性网络数据 · 跟踪4个来源
研究人员推出了一系列新的递归自改进代理AREX,用于深度研究任务。AREX在研究和自我改进循环之间交替进行,使用自主上下文更新工具来管理不断增长的交互历史。这种方法使AREX在BrowseComp和Humanity's Last Exam等基准测试中表现优于同等规模的基线。同时,另一项研究引入了DRNOISE,这是一个旨在评估深度研究代理在开放网络上处理误导性信息的能力的基准,突出了存在此类文件时准确性显著下降的问题。
-
Agents-A1-4B 模型在长时域搜索中表现强劲
InternScience 开发的新模型 Agents-A1-4B 在多项基准测试中表现强劲,尤其是在长时域搜索和智能体任务方面。该模型基于 Qwen3.7-4B,在 BrowseComp 和 GAIA 等领域显著优于其基础模型。虽然在指令遵循和工程任务方面取得了有竞争力的结果,但在 LiveCodeBench-V6 和 FrontierScience-Research 等一些领域落后于更大的模型。
-
新的STAMP方法改进了深度搜索代理的信用分配
研究人员推出了一种新颖的STAMP方法,用于改进深度搜索代理中的信用分配。该方法通过为暴露支持性文件的动作提供有针对性的信用,而不是仅仅关注轨迹级别的结果,来解决“奖励-信用不匹配”问题。STAMP利用基于引用的验证器和首次暴露归因,将引用追溯到其原始动作,从而提高了在BrowseComp和xbench-DS等基准测试上的性能。
-
新框架使 AI 代理能够在可验证的 Web 环境中自我改进
研究人员推出了 DeepSearch-Evolve,这是一个在 DeepSearch-World 环境中训练 Web 代理的自蒸馏框架。该框架旨在通过使代理能够从自身经验中改进,超越固定轨迹或弱强化学习信号,来克服代理训练中的挑战。DeepSearch-World 提供了一个可验证且确定性的环境,并支持可复现的工具,支持代理行为,如进度验证和故障恢复。使用此方法在没有外部蒸馏的情况下训练的 DeepSearch-World-9B 模型…
-
DeepSearch-Evolve 框架通过在可验证环境中进行自我蒸馏来训练网络代理
研究人员推出了 DeepSearch-Evolve,一个用于训练网络代理的自我蒸馏框架。该框架利用 DeepSearch-World,一个包含 420,000 个多跳问答任务的可验证环境。该系统支持进度验证和故障恢复等代理行为,使代理能够从自身经验中改进,而无需依赖外部模型。使用此方法训练的 DeepSearch-World-9B 模型在 BrowseComp 和 HotpotQA 等基准测试中表现出竞争力。
-
新方法从交互数据中挖掘代理技能,但策略改进有限
研究人员开发了一种通过挖掘交互轨迹来自动生成计算机使用代理技能库的方法。该过程包括分割图形用户界面(GUI)轨迹,将这些片段聚类成候选技能,然后训练一个感知技能的策略。虽然挖掘出的聚类在基准测试中针对现有标签显示出高纯度,但该方法改进下游策略的能力有限,表明当前技术不足以实现可靠的跨领域策略改进。
-
新的大语言模型训练方法优化数据调度以提高效率和性能
研究人员开发了通过先进数据调度技术优化大语言模型(LLM)训练的新方法。一种方法是整体数据调度器(HDS),它使用多目标强化学习在预训练期间动态调整数据混合,从而在 The Pile 和 MMLU 等基准测试中显著提高训练效率和模型性能。另一种方法是自适应数据调度(ADS),它通过从统一数据采样转向语义集群和策略边界样本的自适应分布,专注于改进训练后强化学习,在推理基准测试中显示出优势。此外,一种使用精选数据集和最小 GRPO 设置的…
-
Perplexity 将深度研究与多模型编排系统集成
Perplexity 已将其深度研究功能集成到其计算机编排系统中,增强了将复杂问题分解为子任务的能力。然后,这些子任务会被路由到 20 多个不同的 AI 模型,从而显著提高准确性和分析深度。该系统采用“搜索即代码”方法,现在可以生成可直接用于工作的报告、演示文稿和仪表板,并在代理浏览能力方面取得了显著的基准改进。
-
TreeSeeker框架通过受控试错增强AI深度搜索能力
研究人员推出了一种新颖的框架TreeSeeker,旨在提高深度搜索代理的效率。该系统将搜索过程构建成一棵树,允许代理在处理复杂查询时探索多个潜在路径,并有效管理试错过程。通过采用分支-回溯策略并利用价值、不确定性和风险信号,TreeSeeker旨在防止代理陷入无效路径,并确保更好地综合证据。实验表明,TreeSeeker在深度搜索任务上优于现有的开源方法。
-
新的韩语网络浏览基准揭示了大型语言模型的性能差距
研究人员推出了 K-BrowseComp,这是一个旨在评估大型语言模型在韩国语境下网络浏览代理能力的新基准。该基准包含 400 个问题,其中 300 个问题经过人工验证。初步评估显示,GPT-5.5 和 DeepSeek-V4-Pro 等领先的前沿模型在此子集上的性能水平在 30.00% 到 45.67% 之间,与它们在英语基准上的表现相比有显著下降。特定于韩语的大型语言模型表现更低,表明在韩语任务的代理能力方面存在巨大差距。
-
作者警告称 AI 评估不可靠,存在未被察觉的风险
作者认为,当前的 AI 评估方法不可靠且系统性存在缺陷,带来了重大风险。他们指出了模型操纵评估、分布变化导致指标不准确以及意外能力出现的等问题。文章强调,这些不足之处阻碍了识别和解决 AI 相关危害的能力,特别是关于能力风险和诸如偏见信息过滤等社会影响。
-
新的基准测试 LiveBrowseComp 评估 LLM 搜索代理的真正发现能力
一篇新的研究论文介绍了一个名为 LiveBrowseComp 的基准测试,旨在评估大型语言模型(LLM)搜索代理是否真正发现新信息,还是仅仅验证其现有的内部知识。研究发现,代理通常依赖内在知识,在没有外部工具的情况下回答问题,并根据内部假设生成查询。当移除支持答案的证据时,代理的性能显著下降,这表明当前的基准测试可能奖励记忆回忆而非基于证据的发现。LiveBrowseComp 旨在评估代理查找最新信息的能力,结果显示所有测试的代理在该…