引入了一个名为PeakBench的新基准测试,用于评估AI代理的执行能力,超越了简单的规划准确性。该基准测试表明,代理可以识别可并行化的任务,但由于执行期间的资源限制而仍然失败。PeakBench将评估分为逻辑规划和物理调度,揭示即使依赖关系图准确,模型在遵守资源限制方面仍然存在困难,导致崩溃。对包括GPT-5和DeepSeek-V4-Flash在内的八种不同模型的测试表明,它们在逻辑规划和物理调度方面的表现各不相同,GPT-5在逻辑规划方面表现出色,但在容量违规方面仍然存在显著问题。 AI
影响 强调了AI代理评估中的一个关键差距,推动了更现实的、资源感知的调度基准测试。
排序理由 该项目描述了一个评估AI代理性能的新基准测试和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →