实体
Evaluation frameworks for nursing informatics
Evaluation frameworks for nursing informatics
PulseAugur coverage of Evaluation frameworks for nursing informatics — every cluster mentioning Evaluation frameworks for nursing informatics across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
LLM评判者易受操纵,缺乏有效防御机制
一项新研究表明,广泛使用的LLM评判框架容易被操纵,因为所审计的配置均未实施一项名为“先提交评判”(commit-first judging)的拟议防御机制。该方法涉及评判者在评估另一个系统的输出之前自行解决任务,然后仅在候选方案与其自身答案匹配时才接受。研究发现,九种配置使用了这种防御机制的无效变体,这可以追溯到一个共同的拼写错误。在实验中,一个未经辅助的搜索算法成功操纵了其中一种配置,通过了有缺陷的候选方案,而先提交评判有效地阻止…
-
新的GPE基准测试评估LLM事实核查对抗证据投毒的能力
研究人员推出GPE,这是一个新的基准和评估框架,旨在测试事实核查系统对抗“GEO风格投毒”的鲁棒性。这类攻击会操纵搜索结果以影响大型语言模型,而生成引擎优化技术会加剧这种风险。现有的基准测试缺乏评估这些漏洞所需的受控环境,但GPE允许对证据来源和投毒比例进行受控操纵。使用GPE进行的实验揭示了鲁棒性下降以及在标准评估中不明显的效率权衡,突显了事实核查中对抗性测试的关键需求。