PulseAugur
实时 07:48:55

新基准测试LLM和人类对社交熟悉度的推断

研究人员推出了FriendBench,这是一个旨在评估人类和多模态大型语言模型(LLM)根据简短对话片段推断两人之间熟悉度的能力的新基准。该基准使用20秒的视频、音频或文本片段的二元破冰对话。在各种模态中,来自七家公司的26个模型与人类小组进行了比较,表现最佳的模型达到了与人类无法区分的准确性。然而,出现了一个关键差异:虽然人类保持了平衡的预测,但最强的模型倾向于预测“陌生人”,这表明它们的有效先验假设存在差异,而不是区分能力。 AI

影响 该基准可以推动对人工智能社会智能的研究,可能导致更细致、更具上下文感知能力的多模态模型。

排序理由 该集群描述了一篇介绍用于评估LLM和人类在特定任务上的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准测试LLM和人类对社交熟悉度的推断

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin ·

    FriendBench:人类与多模态大语言模型二元熟悉度推理的基准测试

    arXiv:2607.29602v1 Announce Type: cross Abstract: Reading a social situation often depends on behavior, not words alone. We introduce FriendBench, a benchmark for inferring whether two people are already familiar or are meeting as strangers, from a 20-second clip of a dyadic ice-…