PulseAugur
实时 20:35:14
实体 MLE-Bench

MLE-Bench

PulseAugur coverage of MLE-Bench — every cluster mentioning MLE-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_236015 ·

    开源PRAXIST AI系统以12倍的成本优势在MLE-bench上超越Claude Code

    一个名为PRAXIST 的开源AI研究系统在MLE-bench上取得了比 Claude Code 基线更优异的结果。PRAXIST 以约3000美元的计算成本获得了49枚金牌,而 Claude Code 基线则以38000美元的成本获得了34枚金牌。该系统的成功归因于其继承失败实验证据而非仅仅分数的方法,从而将经验教训传递给后续的迭代。

  2. RESEARCH · CL_233337 ·

    DisCo 代理将机器学习知识提炼为技能,提升研究性能 · 跟踪 2 个来源

    一篇新研究论文介绍 DisCo,一个旨在增强自主机器学习研究的技能驱动代理。DisCo 将来自 GitHub 仓库和研究论文的操作知识提炼为可重用技能。当与 GPT-5.5 主干集成时,这种提炼的知识显著提高了代理在 MLE-bench 和 PaperBench 等各种基准测试上的性能。DisCo 的一个组成部分 AREX-Skill Library 包含来自 1,000 个机器学习仓库的超过 5,000 个已验证技能。

  3. TOOL · CL_203907 ·

    ScienceFlow 智能体框架赋能长期人工智能研究

    研究人员开发了 ScienceFlow,一个旨在使人工智能智能体能够进行长期机器学习研究和科学发现的新框架。该系统将研究组织成基于可执行工作区的片段,从而能够高效地探索和修订进展。ScienceFlow 利用新颖的可执行状态转移再锚定(ESTRA)机制来管理研究轨迹,并使用证据感知控制器进行资源分配。在包括 MLE-bench 在内的基准测试中进行的评估证明了 ScienceFlow 的有效性,在 24 小时预算内取得了 70.22%…

  4. RESEARCH · CL_173458 ·

    Google AI 推出 Science One Framework 以实现可验证的科学研究

    Google AI 推出了 Science One Framework,这是一个旨在提高 AI 生成的科学研究可验证性的实验性系统。该框架及其附带的 CoE Audit 协议旨在消除幻觉,并确保 AI 撰写的论文中的主张得到可验证证据链的支持。该系统解决了当前自主研究流程中普遍存在的幽灵引用以及描述方法与实际代码之间不匹配等关键问题。

  5. TOOL · CL_66083 ·

    iML框架通过可执行、问题导向的代码增强AutoML

    研究人员推出了一种新的代码驱动的自动化机器学习(AutoML)框架iML。iML通过专注于生成可执行、问题导向且广泛探索的代码,解决了当前AutoML系统的局限性。该框架采用多智能体方法,分析任务和数据,为跨各种机器学习方法的代码生成创建结构化蓝图,并通过接口检查和迭代调试确保可靠性。

  6. TOOL · CL_64023 ·

    FML-Bench 基准测试质疑机器学习研究中的算法进展

    一个名为 FML-Bench 的新基准测试表明,近期在自动化机器学习研究(尤其是在代码编辑代理等领域)的进展,并非主要归功于算法的进步。在控制了模型能力和搜索预算等因素后,像 AIDE 这样的旧算法与现代系统表现相当。这表明观察到的进展很大程度上可归因于基础模型的改进和问题定义的转变,而非根本性的算法效率提升。

  7. RESEARCH · CL_63768 ·

    新的MLEvolve框架自动化机器学习算法发现

    研究人员开发了MLEvolve,一个新颖的、基于LLM的多智能体框架,用于自动化机器学习算法发现。该框架通过解决信息孤岛、内存限制和分层控制问题,改进了现有方法。MLEvolve利用先进的搜索机制、回顾性记忆系统和自适应编码策略,在基准任务上取得了最先进的性能,甚至超越了专业方法。