一个名为LaughBench的新基准已被引入,用于评估AI模型生成新颖、有趣笑话的能力,其创建者认为这是通用智能的一个有力指标。虽然像GPT 5.6 "Sol"和Fable这样的当前前沿模型偶尔能引人一笑,但还没有模型能够持续地引人发笑。该基准旨在衡量超越可以通过记忆或计算掌握的任务的“真正的智能”,并将其与FrontierMath Open Problems和Arc Agi等基准区分开来,后者可能可以通过专业技能而非广泛的智能来解决。 AI
影响 提出了一个通过幽默评估AI通用智能的新颖基准,可能揭示当前模型的局限性。
排序理由 提出了一个用于AI通用智能的新基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →