研究人员推出了 $OneMillion-Bench ($OMB),这是一个旨在评估语言代理在复杂、真实世界专业场景中能力的新基准。与之前的基准不同,$OMB 包含 400 项由专家精心策划的任务,涵盖法律、金融、医疗保健和自然科学等领域,要求代理执行多步推理、使用工具并做出基于约束的决策。评估协议评估事实准确性、逻辑连贯性、实际可行性和专业合规性,旨在衡量代理在领域密集型应用方面的准备情况。 AI
影响 该基准测试有望推动更强大、更可靠的 AI 代理在专业领域的应用开发。
排序理由 该集群包含一篇介绍 AI 代理评估新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →