实体
research agents
research agents
PulseAugur coverage of research agents — every cluster mentioning research agents across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
已识别出22种常见的LLM代理失败模式
无论其专业领域如何,例如编码或研究,LLM代理都会表现出22种一致的失败模式,而不是独特的bug。这些失败可以被分类,并且特定的提示词可以缓解它们。这些提示词的有效性范围从完全消除失败到仅仅标记它,具体取决于修复是模型的程序性规则还是其推理能力的真正改进。
-
Perplexity 推出 WANDR 基准测试 AI 研究代理
Perplexity 推出了 WANDR,一个旨在评估研究代理的新开放基准。该基准包含 500 个任务,要求代理查找和引用证据来支持其发现。在初步测试中,Perplexity Search as Code 以 0.363 的软 F1 分数获得最高分。
-
LLM 研究代理因策略可压缩性而表现出低过拟合
研究人员调查了机器学习(尤其是由大型语言模型 LLM 驱动的机器学习)为何尽管采用了自适应基准测试,却表现出惊人低的过拟合。他们对 LLM 驱动的研究代理的研究表明,成功的机器学习策略具有高度可压缩性。使用短提示和一比特反馈进行的输出和输入压缩实验表明,这些瓶颈对各种数据集的性能影响极小,支持了有效策略占据策略空间低复杂度区域的观点。