PulseAugur
实时 08:52:15
实体 FriendBench

FriendBench

PulseAugur coverage of FriendBench — every cluster mentioning FriendBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_178348 ·

    新基准测试LLM和人类对社交熟悉度的推断

    研究人员推出了FriendBench,这是一个旨在评估人类和多模态大型语言模型(LLM)根据简短对话片段推断两人之间熟悉度的能力的新基准。该基准使用20秒的视频、音频或文本片段的二元破冰对话。在各种模态中,来自七家公司的26个模型与人类小组进行了比较,表现最佳的模型达到了与人类无法区分的准确性。然而,出现了一个关键差异:虽然人类保持了平衡的预测,但最强的模型倾向于预测“陌生人”,这表明它们的有效先验假设存在差异,而不是区分能力。