PulseAugur
中
实时 13:25:38
实体 Kamile Dementaviciute

Kamile Dementaviciute

PulseAugur coverage of Kamile Dementaviciute — every cluster mentioning Kamile Dementaviciute across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_286848 ·

    LLM说服力评估方法间一致性较弱

    一项新近发表在arXiv上的研究评估了十五种大型语言模型(LLMs)的说服能力,发现不同的评估方法产生的结果相关性较弱。该研究将九种现有的自动化方法适配到共享设置中,并发现模型拒绝回答,尤其是在操纵任务上,显著降低了这些方法之间的一致性。通用能力也起着作用,理性说服方法能追踪通用能力,而操纵方法则不能,这表明单一的说服力分数是任务特定的,并不反映模型的整体说服力。