PulseAugur
实时 09:26:04
English(EN) Winning by Peeking: Unenforced Budgets and Test-Set Selection Inflate Short-Budget AutoML Comparisons

AutoML 比较缺陷曝光:Orcetra 的性能虚高被揭露

一篇新论文指出了自动化机器学习(AutoML)系统在比较中存在的重大缺陷,尤其是在短时间预算下。研究表明,一个名为 Orcetra 的系统由于协议缺陷,包括在实际测试集上进行测试以及未能强制执行时间限制,而显得比 FLAMLAutoGluon 等竞争对手表现更好。当通过使用验证集和强制执行外部截止日期纠正这些问题后,Orcetra 的性能优势消失了,表明最初令人印象深刻的结果被方法论错误夸大了。 AI

影响 强调了评估 AutoML 系统中的关键问题,可能导致更严格的基准测试标准。

排序理由 该集群包含一篇学术论文,详细介绍了 AutoML 系统比较中的方法论缺陷。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

AutoML 比较缺陷曝光:Orcetra 的性能虚高被揭露

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Guilin Zhang, Kai Zhao ·

    靠“偷看”获胜:未执行的预算和测试集选择夸大了短预算 AutoML 的比较结果

    arXiv:2608.07303v1 Announce Type: new Abstract: Comparisons between AutoML systems at short time budgets -- tens of seconds rather than hours -- are common in tool READMEs and workshop papers, and they are easy to get wrong. We report a case study in which a simple AutoML engine,…