一篇新论文介绍了 Wiggle Framework,用于在各种任务和稳定性轴线上对大型语言模型裁判进行压力测试。该框架评估了 LLM 在重新提示、单次挑战和持续压力下的判决变化情况。研究结果表明,所有经过测试的前沿模型都表现出不稳定性,判决频繁翻转,并且对抗性说服经常会破坏对事实真相的判断。 AI
影响 强调了 LLM 裁判的不可靠性,建议在使用其输出进行关键任务时需谨慎。
排序理由 该集群描述了一篇介绍 LLM 裁判评估框架的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 X — Omar Sanseviero (HF research) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →