PulseAugur
中
实时 23:09:35
English(EN) HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases

新的HARDEN方法创建了更难、更真实的LLM评估案例

研究人员开发了HARDEN,一种新颖的约束进化搜索方法,旨在为语言模型创建更具挑战性的评估案例。该技术通过修改输入同时保留预期输出来调整现有评估场景,从而更好地反映真实企业部署的复杂性。在多个基准测试和不同规模的Qwen3.5模型上,HARDEN显著降低了任务模型准确率,凸显了当前评估方法的局限性以及进化搜索生成更鲁棒测试案例的潜力。 AI

影响 强调了需要更鲁棒的评估方法来更好地反映真实的AI性能和挑战。

排序理由 该集群描述了一篇关于语言模型评估新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的HARDEN方法创建了更难、更真实的LLM评估案例

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Aditya Kumaran, Rahul Singhal, Karime Maamari, Amine Mhedhbi, Pradyumna Tambwekar ·

    HARDEN:用于更难、保留答案的评估案例的约束演化搜索

    arXiv:2609.30571v1 Announce Type: new Abstract: Language models are often evaluated on curated benchmarks that underrepresent the complexity of enterprise deployments. We introduce HARDEN, a constrained evolutionary search method to adapt the input of existing evaluation cases in…