一篇新论文质疑LLM智能体排行榜的有效性,认为对排名智能体的直接比较可能具有误导性。作者们强调,任务组合、数据来源、发布细节和成本规则的差异会显著影响智能体的得分。他们提出了一种可估算感知程序,以更准确地评估成对优势,并强调在解释排名差异时需要考虑不确定性和实际边际,尤其是在SWE-bench和AgentRewardBench等基准测试上。 AI
影响 突出了当前LLM智能体评估方法中潜在的缺陷,表明需要更强大、更透明的基准测试实践。
排序理由 该集群包含一篇分析LLM智能体排行榜的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →