研究人员推出了FriendBench,这是一个旨在评估人类和多模态大型语言模型(LLM)根据简短对话片段推断两人之间熟悉度的能力的新基准。该基准使用20秒的视频、音频或文本片段的二元破冰对话。在各种模态中,来自七家公司的26个模型与人类小组进行了比较,表现最佳的模型达到了与人类无法区分的准确性。然而,出现了一个关键差异:虽然人类保持了平衡的预测,但最强的模型倾向于预测“陌生人”,这表明它们的有效先验假设存在差异,而不是区分能力。 AI
影响 该基准可以推动对人工智能社会智能的研究,可能导致更细致、更具上下文感知能力的多模态模型。
排序理由 该集群描述了一篇介绍用于评估LLM和人类在特定任务上的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →