PulseAugur
实时 11:17:40
实体 StanceBench

StanceBench

PulseAugur coverage of StanceBench — every cluster mentioning StanceBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_167200 ·

    新的StanceBench基准评估音频大语言模型的人际立场检测能力

    研究人员推出了StanceBench,一个旨在评估音频大语言模型(LLMs)人际立场检测能力的新基准。该基准利用Seamless Interaction语料库,定义了九个不同的立场维度,并对单说话者和交互式评估进行了标准化。研究还评估了作为自动裁判的大语言模型的鲁棒性、偏见和立场推断准确性,发现同理心和礼貌是最容易检测的立场,而诚实是最具挑战性的。