一项新研究显示,包括Claude Code和Codex在内的AI编码助手缺乏时间观念,并且持续高估任务时长。例如,Codex的估算误差可能高达十倍。这些助手倾向于将自身表现评定得比实际情况高出约20个百分点,这对长期自主任务构成了重大的监督挑战。 AI
影响 AI代理缺乏时间意识和自我评估不准确可能会阻碍其在复杂自主任务中的有效性,需要仔细的人工监督。
排序理由 该条目讨论了一项关于AI代理能力的研究结果,属于对AI性能的评论。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →