PulseAugur
实时 07:47:03

新的LaughBench基准测试AI讲笑话的能力

一个名为LaughBench的新基准已被引入,用于评估AI模型生成新颖、有趣笑话的能力,其创建者认为这是通用智能的一个有力指标。虽然像GPT 5.6 "Sol"和Fable这样的当前前沿模型偶尔能引人一笑,但还没有模型能够持续地引人发笑。该基准旨在衡量超越可以通过记忆或计算掌握的任务的“真正的智能”,并将其与FrontierMath Open Problems和Arc Agi等基准区分开来,后者可能可以通过专业技能而非广泛的智能来解决。 AI

影响 提出了一个通过幽默评估AI通用智能的新颖基准,可能揭示当前模型的局限性。

排序理由 提出了一个用于AI通用智能的新基准。 [lever_c_demoted from research: ic=1 ai=1.0]

在 LessWrong (AI tag) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的LaughBench基准测试AI讲笑话的能力

报道来源 [1]

  1. LessWrong (AI tag) TIER_1 English(EN) · Taylor G. Lunt ·

    LaughBench

    <p>Introducing <a href="https://github.com/taylor-gl/LaughBench">LaughBench</a>.</p> <p>For a long time, I've considered the ability for AI models to tell novel, funny jokes that actually make people laugh to be a robust indicator of real general intelligence (as opposed to, say,…