arXiv上的一篇新论文介绍了一种方法,通过关注AI代理停止的能力而非仅仅是启动动作,来提高其在计算机任务中的可靠性。研究人员为35B代理开发了一个验证器引导的修复过程,涵盖五个环境,结果显示评估方差可忽略不计,训练种子效应很小。研究发现,成功率主要受数据抽取和运行间非确定性的影响,在更难的任务中双峰分布表明存在显著的故障模式可能性。该论文还提出了一个名为`cua_reliability`的库,用于报告跨多个种子的结果,以确保更稳健的评估。 AI
影响 引入了一个更可靠的AI代理评估框架,可能提高AI系统在复杂任务中的可信度。
排序理由 关于AI代理可靠性和评估方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →