MLE-Bench Lite
PulseAugur coverage of MLE-Bench Lite — every cluster mentioning MLE-Bench Lite across labs, papers, and developer communities, ranked by signal.
-
Frontis-MA1 AI模型展示递归自我改进能力
研究人员推出Frontis-MA1,一个拥有350亿参数的AI模型,专为机器学习工程中的递归自我改进而设计。该模型使用OpenMLE系统进行训练,在MLE-Bench Lite基准测试中表现出显著提升,其性能从39.39%提高到60.61%,经过进一步优化后达到71.21%。Frontis-MA1的能力接近GPT-5.6 Sol和Kimi K3等更大模型的水平,同时在NatureBench Lite数据集上也表现出强大的迁移能力。
-
HASTE系统通过分层技能迁移提高了机器学习工程代理的效率
研究人员开发了HASTE,一个旨在提高机器学习工程代理效率的分层多代理系统。通过将知识组织成全局、领域和特定竞赛的层级,HASTE允许代理在不同竞赛之间迁移学习到的技能,减少了从头开始解决问题的需求。这种方法显著提高了性能,在对照测试中达到了100%的奖牌率,而平坦加载的成功率为62.5%,并在热启动场景中使用了更少的优化迭代。
-
AI框架Arbor赋能自主科学研究
研究人员开发了Arbor,一个专为自主科学研究设计的新型AI框架。Arbor利用一个名为假设树精炼(HTR)的持久知识树来连接假设、证据和见解,从而实现跨长期项目的累积学习。在六项研究任务的评估中,Arbor的表现优于Codex和Claude Code,平均相对收益是它们的2.5倍以上,并在MLE-Bench Lite上使用GPT-5.5达到了86.36%的Any Medal。
-
DataMaster框架自动化机器学习数据工程,以提高模型性能
研究人员开发了DataMaster,一个旨在自动化机器学习数据工程过程的新型框架。该系统旨在通过优化数据选择、组成和转换来提高机器学习模型性能,而不是改变学习算法本身。DataMaster集成了树状搜索、共享数据池和累积记忆,以有效地探索数据领域并从先前的尝试中学习,最终提升下游模型的成果。