PulseAugur
实时 07:43:07
实体 PaperBench: Evaluating AI’s Ability to Replicate AI Research

PaperBench: Evaluating AI’s Ability to Replicate AI Research

PulseAugur coverage of PaperBench: Evaluating AI’s Ability to Replicate AI Research — every cluster mentioning PaperBench: Evaluating AI’s Ability to Replicate AI Research across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_228824 ·

    Super Library Agent 通过整合共享代码来简化多应用程序开发

    研究人员推出 Super Library Agent,这是一种管理相关软件应用程序组合的新方法。该代理旨在同时生成和维护多个代码库,确保共享逻辑被整合到一个中央“Super Library”中,而不是重复。该方法采用候选引导提取和上下文感知迁移,以减少冗余并防止结构侵蚀,在 WebGen-Bench 和 PaperBench 等基准测试中表现优于零样本方法。

  2. SIGNIFICANT · CL_200541 ·

    Alibaba 发布拥有 2.4T 参数的开放权重 Qwen3.8-Max

    Alibaba 发布了 Qwen3.8-2.4T-A95B,这是其 Qwen-Max 系列首次采用开放权重发布。该新模型拥有 2.4 万亿总参数,每次前向传播有 950 亿活跃参数,采用了 Gated DeltaNet 和标准注意力机制的混合架构。Qwen3.8-Max 在各种基准测试中表现强劲,尤其在 PaperBench 的学术理解和编码任务方面表现出色,同时还提供具有竞争力的价格,每百万 token 输入/输出分别为 2 美元/6 美元。

  3. TOOL · CL_192254 ·

    研究人员提出ARA格式以取代PDF,实现AI原生科学论文

    一种名为ARA(Agent-Native Research Artifacts,智能体原生研究产物)的新研究产物格式被提出,旨在取代传统的PDF格式,成为科学论文的继任者。ARA由多所机构的研究人员开发,旨在使研究更容易被AI智能体理解和复现。与PDF不同,PDF呈现的是一种经过润饰的、线性的成功叙事,而ARA则捕捉了整个研究过程,包括失败的假设、实验细节和原始数据,从而使AI更容易理解、复现和扩展研究成果。尽管初步测试表明,与PDF…

  4. SIGNIFICANT · CL_181945 ·

    阿里巴巴的Qwen3.8-Max模型在基准测试中超越GPT-5.6和Claude Fable 5

    阿里巴巴的Qwen团队发布了Qwen3.8-Max,这是一个拥有2.4万亿参数的多模态模型,据称在OSWorld-Verified基准测试中表现优于GPT-5.6 Sol Max和Anthropic的Fable 5。该模型声称能够自主完成复杂的软件项目并复现研究论文。阿里巴巴已宣布了具有竞争力的API定价,并计划下周发布开放权重,但许可条款仍未披露。

  5. SIGNIFICANT · CL_178669 ·

    阿里云发布Qwen3.8,提升编程和办公AI能力 · 追踪2个来源

    阿里云正式发布了其新的旗舰大型语言模型Qwen3.8,总参数量达到2.4万亿。该先进模型在编程和专业办公任务方面表现出显著的改进,跻身全球顶级大型模型之列。支持视觉理解和100万token上下文长度的Qwen3.8-Max,以及Qwen3.8-27B模型,将于下周开源发布。新模型提供了增强的推理能力、更快的推理速度以及具有竞争力的API服务定价。

  6. RESEARCH · CL_143666 ·

    LLM生成的评分标准在论文复现中显示出偏向高分的倾向

    一项对LLM生成的论文复现评分标准的新元评估显示,虽然这些评分标准可以提高评估的一致性,但它们常常表现出偏见。研究发现,LLM生成的评分标准往往过于细致,偏向高分,并且缺乏对特定论文领域的适应性。然而,增强的生成设置在与真实评分标准的一致性方面显示出显著的改进,接近人类基线性能。

  7. RESEARCH · CL_41832 ·

    STORM系统通过状态管理改进多智能体代码协作

    研究人员推出了一种新颖的面向状态的管理系统STORM,旨在增强在共享代码库上工作的多个AI智能体之间的协作。与依赖工作区隔离和延迟冲突解决的现有方法不同,STORM主动调解智能体交互,以确保一致的视图并在编辑点检测冲突。在Commit0和PaperBench等基准上的评估表明,STORM的性能显著优于基线方法,并在各种LLM上取得了高分。