实体
LLMBar
LLMBar
PulseAugur coverage of LLMBar — every cluster mentioning LLMBar across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究发现:大型语言模型法官存在语言偏见
一项新研究评估了大型语言模型(LLMs)在评估响应时作为法官的功能,发现语言偏好会显著影响其判断。该研究引入了Judge-LS协议,该协议使用英语、中文以及响应对的语言切换变体来测试LLM法官。结果显示,与英语相比,中文和语言切换的呈现方式在10.7%至14.4%的案例中导致了偏好翻转,所有测试的法官在英语中的表现最佳。然而,该研究并未发现当翻译等效时存在系统性的偏向英语的偏见,因为大多数此类探测被判断为平局,而非平局的决定有时偏向中文。
-
引入LLM裁判小组校准框架
研究人员开发了一个名为有限校准小组选择(Finite-Calibration Panel Selection)的框架,用于确定LLM裁判小组的最佳校准策略。该方法根据可用的人工标注预算,帮助决定是使用低维堆叠器还是联合输出表。研究表明,对于许多当前的LLM输出,简单的标量聚合方法就足够了,但复杂的交互可能需要更复杂的联合表方法来进行准确评估。