IBM 研究人员推出 BenchDrift,一种评估 AI 模型对问题重述敏感度的方法。该技术在保持答案不变的情况下,在语言、语用和结构轴线上生成基准问题的变体,然后测量正确率的变化。研究结果表明,即使是先进的模型也存在措辞敏感性,在 GSM8K、MMLU 和 MATH-Hard 等基准测试中表现最佳的模型对特定措辞的依赖性最大。 AI
影响 强调了需要更鲁棒的 AI 评估方法来考虑语言变体,这可能会影响未来的基准设计和模型训练。
排序理由 该集群讨论了 IBM 的一项新研究论文和方法。 [lever_c_demoted from research: ic=1 ai=1.0]
在 X — Omar Sanseviero (HF research) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →