PulseAugur
实时 20:33:48
实体 research agents

research agents

PulseAugur coverage of research agents — every cluster mentioning research agents across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. COMMENTARY · CL_166289 ·

    已识别出22种常见的LLM代理失败模式

    无论其专业领域如何,例如编码或研究,LLM代理都会表现出22种一致的失败模式,而不是独特的bug。这些失败可以被分类,并且特定的提示词可以缓解它们。这些提示词的有效性范围从完全消除失败到仅仅标记它,具体取决于修复是模型的程序性规则还是其推理能力的真正改进。

  2. TOOL · CL_150809 ·

    Perplexity 推出 WANDR 基准测试 AI 研究代理

    Perplexity 推出了 WANDR,一个旨在评估研究代理的新开放基准。该基准包含 500 个任务,要求代理查找和引用证据来支持其发现。在初步测试中,Perplexity Search as Code 以 0.363 的软 F1 分数获得最高分。

  3. RESEARCH · CL_82130 ·

    LLM 研究代理因策略可压缩性而表现出低过拟合

    研究人员调查了机器学习(尤其是由大型语言模型 LLM 驱动的机器学习)为何尽管采用了自适应基准测试,却表现出惊人低的过拟合。他们对 LLM 驱动的研究代理的研究表明,成功的机器学习策略具有高度可压缩性。使用短提示和一比特反馈进行的输出和输入压缩实验表明,这些瓶颈对各种数据集的性能影响极小,支持了有效策略占据策略空间低复杂度区域的观点。