BrowseComp-ZH
PulseAugur coverage of BrowseComp-ZH — every cluster mentioning BrowseComp-ZH across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
开源 Iris 搜索代理凭借先进的上下文管理挑战闭源竞争对手
AllSpark Research 推出了 Iris,这是一款开源搜索代理,挑战闭源竞争对手。Iris 采用混合专家(Mixture-of-Experts)架构,拥有 256K 上下文窗口,模型可在 Hugging Face 上以 Apache 2.0 许可证获得。该代理的有效性归功于其先进的上下文管理策略,这些策略优先管理搜索历史,而不是简单地增加参数数量,尤其是在非英语任务方面。Iris 使用一种新颖的 SFT-RL 爬升方法进行…
-
Iris搜索代理在网络基准测试中取得SOTA开源成果 · 跟踪2个来源
研究人员开发了两个大规模搜索代理Iris-mini和Iris-pro,分别拥有350亿和3970亿参数。这些代理利用新颖的数据管道和训练方法,将监督微调与实时搜索的强化学习相结合。在BrowseComp和DeepSearchQA等复杂的网络基准测试中,这些模型在开源搜索代理中取得了最先进(SOTA)的成果,尤其是在采用高级上下文管理技术时。
-
G-ReAct框架通过图引导推理增强LLM的深度搜索能力
研究人员推出了一种名为G-ReAct的新型框架,旨在增强大型语言模型(LLM)的深度搜索能力。该方法将推理构建为查询图上的状态演化,能够显式跟踪搜索进度并遵守约束,从而缓解上下文遗忘和搜索漂移等问题。实验表明,G-ReAct在进行微调时,能够显著提升Qwen3-30B-A3B-Thinking-2507等模型在复杂任务上的性能,并在BrowseComp-ZH和XBench等基准测试中取得高准确率。该框架在推理时也能改进现有的LLM,无…
-
新研究增强了 AI 代理的记忆、推理和有根据能力
研究人员正在开发先进的方法,使 AI 代理能够有效地利用长期记忆并提高其推理能力。一种名为查询条件重用 (QCR) 的方法侧重于代理如何将过去的轨迹适应新环境,在各种基准测试中显示出成功率和令牌效率的显著提高。另一个研究领域通过使用步级自蒸馏和证据锚来指导学习,解决了深度搜索代理强化学习中奖励稀疏的问题。此外,SynWeaver 等框架旨在通过与网站特定先验知识共同合成任务和轨迹来提高代理的泛化能力,而 LoongReflect 通过…
-
新的信用分配方法增强了AI搜索代理的训练 · 跟踪3个来源
研究人员开发了训练长时搜索代理的新方法,这些代理是为执行复杂的多步任务而设计的AI系统。一种方法ABSeeker使用答案回溯信用分配(ABC)来提供更细粒度的监督,通过评估每个搜索步骤与来自地面真实答案的中间线索。另一种方法BiCAA采用双向信用分配,将前向可解性增益与事后成功关键性相结合,以生成密集的进程奖励。这两种技术都旨在提高训练稳定性并减少搜索增强代理中的冗余操作,ABSeeker在使用较小的模型在BrowseComp等基准测…
-
新的STAMP方法改进了深度搜索代理的信用分配
研究人员推出了一种新颖的STAMP方法,用于改进深度搜索代理中的信用分配。该方法通过为暴露支持性文件的动作提供有针对性的信用,而不是仅仅关注轨迹级别的结果,来解决“奖励-信用不匹配”问题。STAMP利用基于引用的验证器和首次暴露归因,将引用追溯到其原始动作,从而提高了在BrowseComp和xbench-DS等基准测试上的性能。
-
Mach-Mind-4-Flash:35B MoE 模型性能媲美 100B+ 模型
研究人员推出了 Mach-Mind-4-Flash,这是一个拥有 350 亿参数的专家混合(MoE)模型,但仅激活 30 亿参数。通过训练后优化,该模型实现了与 1000 亿参数模型相当或更优的性能。该系统采用三阶段流程,包括统一的 RL/OPD 训练基础设施、通过多教师在线策略蒸馏融合的领域特定 RL 专家,以及用于压缩推理链的混合中位数长度策略优化。
-
TreeSeeker框架通过受控试错增强AI深度搜索能力
研究人员推出了一种新颖的框架TreeSeeker,旨在提高深度搜索代理的效率。该系统将搜索过程构建成一棵树,允许代理在处理复杂查询时探索多个潜在路径,并有效管理试错过程。通过采用分支-回溯策略并利用价值、不确定性和风险信号,TreeSeeker旨在防止代理陷入无效路径,并确保更好地综合证据。实验表明,TreeSeeker在深度搜索任务上优于现有的开源方法。