research agents
PulseAugur coverage of research agents — every cluster mentioning research agents across labs, papers, and developer communities, ranked by signal.
-
新的 WANDR 基准测试用于测试 AI 代理在深度数据收集任务中的能力
引入了一个名为 WANDR 的新基准测试,用于评估研究代理在宽泛且深入的数据收集任务中的能力。WANDR 包含 500 个现实场景,要求代理发现广泛的实体集,为每个实体进行深入的网络搜索,并汇编带有支持证据的可验证记录。该基准测试使用动态的、特定任务的裁判,它们会重新抓取网页以确保准确性,并允许评估当前信息,超越了静态答案集。对六个生产研究系统的初步评估显示,即使是最强的系统,软 F1 分数也仅为 0.363,表明在处理增加的数据量和…
-
已识别出22种常见的LLM代理失败模式
无论其专业领域如何,例如编码或研究,LLM代理都会表现出22种一致的失败模式,而不是独特的bug。这些失败可以被分类,并且特定的提示词可以缓解它们。这些提示词的有效性范围从完全消除失败到仅仅标记它,具体取决于修复是模型的程序性规则还是其推理能力的真正改进。
-
Perplexity 推出 WANDR 基准测试 AI 研究代理
Perplexity 推出了 WANDR,一个旨在评估研究代理的新开放基准。该基准包含 500 个任务,要求代理查找和引用证据来支持其发现。在初步测试中,Perplexity Search as Code 以 0.363 的软 F1 分数获得最高分。
-
LLM 研究代理因策略可压缩性而表现出低过拟合
研究人员调查了机器学习(尤其是由大型语言模型 LLM 驱动的机器学习)为何尽管采用了自适应基准测试,却表现出惊人低的过拟合。他们对 LLM 驱动的研究代理的研究表明,成功的机器学习策略具有高度可压缩性。使用短提示和一比特反馈进行的输出和输入压缩实验表明,这些瓶颈对各种数据集的性能影响极小,支持了有效策略占据策略空间低复杂度区域的观点。