研究人员开发了HARDEN,一种新颖的约束进化搜索方法,旨在为语言模型创建更具挑战性的评估案例。该技术通过修改输入同时保留预期输出来调整现有评估场景,从而更好地反映真实企业部署的复杂性。在多个基准测试和不同规模的Qwen3.5模型上,HARDEN显著降低了任务模型准确率,凸显了当前评估方法的局限性以及进化搜索生成更鲁棒测试案例的潜力。 AI
影响 强调了需要更鲁棒的评估方法来更好地反映真实的AI性能和挑战。
排序理由 该集群描述了一篇关于语言模型评估新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →