来自字节跳动Seed及其他机构的研究人员开发了HarnessDev,这是一个评估大型语言模型(LLM)自行设计代理框架能力的全新评估框架。与固定框架的传统基准测试不同,HarnessDev评估模型自身为框架编写的代码。在创建阶段,模型从基本原语构建框架;在演化阶段,模型利用执行反馈进行优化。初步结果显示,不同模型和领域表现各异,Opus 4.8在编写和机器学习实验方面表现强劲,而GPT-5.5在搜索任务方面表现出色。 AI
影响 这一新的评估框架可能会改变衡量大型语言模型代理能力的方式,重点关注其自我设计复杂系统的能力。
排序理由 该条目描述了一个用于大型语言模型生成的代理框架的新评估框架和基准测试,包括实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
- BrowseComp
- ByteDance Seed
- Claude Code 2.1.177
- Codex 0.144.3
- DeepSeek V4 Pro
- EQ-Bench3
- Gemini 3.1 Pro
- GPT-5.5
- HarnessDev
- MLE-bench
- Opus 4.8
- Qwen 3.7 Max
- Seed 2.0 Pro
- SWE-bench Pro
- Terminal-Bench 2.1
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →