PulseAugur
实时 23:04:43
实体 CORE-Bench

CORE-Bench

PulseAugur coverage of CORE-Bench — every cluster mentioning CORE-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_128678 ·

    新AI工具VERITAS自动化科学研究复现

    研究人员开发了VERITAS,一个旨在利用AI驱动的编码代理自动化科学研究复现的新型框架。与以往特定基准的工具不同,VERITAS是一个领域无关的系统,可以处理研究论文和代码库,以提取主张、执行方法并评估发现。该框架生成一个加权的复现分数(Replication Score)以及遇到的和已解决问题的详细日志,在CORE-Bench和ReplicationBench等既定基准上展示了最先进的性能。

  2. TOOL · CL_111644 ·

    新的基准方法超越准确性评估AI代理

    一篇新的研究论文提出,即使在基准饱和的情况下,也要超越以准确性为中心的AI代理评估。该研究使用计算可复现性基准CORE-Bench Hard,通过评估代理在六个其他维度上的表现来展示其价值:构造有效性、分布外泛化性、效率、可靠性、模型与支架性能以及人机协作提升。作者们引入了一个改进的基准CORE-Bench v1.1和一个分布外任务套件CORE-Bench OOD,以促进这种更广泛的评估。他们的发现表明,即使在准确性饱和之后,这些维度…

  3. TOOL · CL_108023 ·

    新基准 CORE-Bench 测试 AI 代理的科学可复现性

    研究人员推出了 CORE-Bench,这是一个旨在评估 AI 代理执行计算可复现性任务能力的新基准。该基准包含 270 个任务,源自计算机科学、社会科学和医学领域的 90 篇科学论文,具有不同的难度级别,并包括纯语言和视觉语言挑战。开发了一个评估系统来加速评估过程,并使用 GPT-4o 和 GPT-4o-mini 模型测试了 AutoGPT 和专门的 CORE-Agent 等基线代理。表现最好的代理在最困难的任务上达到了 21% 的准…

  4. RESEARCH · CL_80489 ·

    Anthropic AI 工程师通过递归自我改进将代码交付速度提高 8 倍

    Anthropic 发布的数据表明,AI 开发取得了重大进展,其工程师在比之前基线时期快八倍的速度交付代码。该公司的人工智能模型(如 Claude)展示了快速增长的自主任务能力,每四个月性能翻一番。这些改进归因于递归自我改进,即人工智能系统越来越多地用于设计和开发其后继者,这一趋势对品牌如何在 AI 问答引擎中展示和推荐产生了深远影响。

  5. RESEARCH · CL_71530 ·

    Anthropic 详细介绍AI在其自身发展中日益增长的作用

    Anthropic 发布的研究表明,AI系统在其自身发展中的贡献日益增加,他们称之为“递归式自我改进”。这一过程,即AI协助设计和开发未来的AI模型,正在加速开发周期,工程师们比往年交付的代码量显著增加。虽然这一进步有望在各个领域带来巨大效益,但也引发了对人类如何控制日益强大的AI的担忧,并凸显了健全的安全和监控机制日益增长的重要性。

  6. RESEARCH · CL_01095 ·

    新基准显示,AI代理在复现研究方面面临挑战

    研究人员开发了AutoReproduce,一个多代理框架,旨在自动复现研究论文中的AI实验。该系统利用“论文谱系”从引用的文献中挖掘隐性知识,并采用基于采样的单元测试策略来确保代码的可执行性。此外,还引入了一个新的基准测试CORE-Bench,以评估AI在自动化计算可复现性方面的能力。初步测试表明,尽管像CORE-Agent(使用GPT-4o)这样的专用代理在处理困难任务时能达到22%的准确率,但AI在处理复杂计算环境方面的能力仍有很…