实体
LLM Jury
LLM Jury
PulseAugur coverage of LLM Jury — every cluster mentioning LLM Jury across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的RoPoLL方法增强了大语言模型(LLM)评估的鲁棒性
研究人员推出了一种名为RoPoLL的新方法,以提高大语言模型(LLM)评估的鲁棒性。传统的大语言模型(LLM)评判员小组虽然实用,但容易受到模式崩溃或谄媚等偏见的影响,导致误差无界。RoPoLL通过用鲁棒的均值估计器(特别是几何中位数)替换标准的聚合函数来解决这个问题,该估计器具有最佳的失效点,即使在评判员严重受污染的情况下也能保持准确性。实验表明,RoPoLL的性能显著优于现有方法,在一个关键基准测试中,即使是一个小型RoPoLL委…
-
LLM陪审团在医疗AI评估中展现出作为代理的潜力
一篇新近发表在arXiv上的研究论文探讨了使用大型语言模型(LLMs)作为评估医疗AI系统的成本效益替代方案,以取代人类专家小组。该研究引入了一个由三个前沿模型组成的“LLM陪审团”,用于对真实世界医院病例的诊断和临床推理进行评分。研究结果表明,尽管未经校准的LLM得分低于专家得分,但它们保持了顺序一致性,并且严重风险错误的概率较低。至关重要的是,经过校准的LLM陪审团结合LLM生成的诊断,能够有效识别高风险错误,从而能够进行有针对性…