一份新报告详细介绍了求是引擎自主代理在 AstaBench E2E-Bench-Hard 基准测试上的表现,该测试使用了 DeepSeek 的 deepseek-v4pro-preview 模型。该引擎在该基准测试上得分 0.816,每任务成本为 15.209 美元。虽然其 10% 的完整任务完成率超过了之前代理性能 7 个百分点,但在 40 个任务中满足了 82.1% 的必需评分项。评估强调了在重复运行、外部依赖和消融研究等方面的局限性,尽管成功生成并验证了报告、代码和实验产物。 AI
影响 展示了自主代理在复杂研究任务方面的能力进展,并指出了未来发展的方向。
排序理由 关于在 AI 基准测试上表现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →