普林斯顿大学和英国AI安全研究所最近的一项研究挑战了Anthropic和OpenAI关于当前AI模型在自主研究方面能力的说法。虽然Claude Opus 4.8和GPT-5.6 Sol等前沿模型在执行研究工程方面表现出色,但它们未能展现出足够的科研判断力和创造性解决问题的能力。AI代理无法有效放弃不成功的尝试,导致其生成的论文被原作者评为“拒绝”。 AI
影响 尽管具备工程能力,当前前沿AI模型仍缺乏自主科学研究所需的关键判断力和创造力,表明其独立创新的能力存在差距。
排序理由 普林斯顿大学和英国AI安全研究所研究人员发表的研究,评估AI模型能力。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →