一项名为“幽默竞技场”的研究评估了 20 个大语言模型生成笑话的能力,使用了包含 360 个笑话提示的数据集。Fable 5 成为最搞笑的模型,得分估计为 100 分中的 66.8 分,而 Fable 5.1 得分为 58.2 分。评估使用了自动化裁判,该裁判经过人类偏好审计,并发现与人类偏好高度相关。 AI
影响 这项研究为大语言模型生成幽默的能力提供了见解,可能影响未来模型开发和微调,以实现更具吸引力的用户互动。
排序理由 该集群描述了评估大语言模型幽默生成能力的基准研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →