PaperBench: Evaluating AI’s Ability to Replicate AI Research
PulseAugur coverage of PaperBench: Evaluating AI’s Ability to Replicate AI Research — every cluster mentioning PaperBench: Evaluating AI’s Ability to Replicate AI Research across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
Super Library Agent 通过整合共享代码来简化多应用程序开发
研究人员推出 Super Library Agent,这是一种管理相关软件应用程序组合的新方法。该代理旨在同时生成和维护多个代码库,确保共享逻辑被整合到一个中央“Super Library”中,而不是重复。该方法采用候选引导提取和上下文感知迁移,以减少冗余并防止结构侵蚀,在 WebGen-Bench 和 PaperBench 等基准测试中表现优于零样本方法。
-
Alibaba 发布拥有 2.4T 参数的开放权重 Qwen3.8-Max
Alibaba 发布了 Qwen3.8-2.4T-A95B,这是其 Qwen-Max 系列首次采用开放权重发布。该新模型拥有 2.4 万亿总参数,每次前向传播有 950 亿活跃参数,采用了 Gated DeltaNet 和标准注意力机制的混合架构。Qwen3.8-Max 在各种基准测试中表现强劲,尤其在 PaperBench 的学术理解和编码任务方面表现出色,同时还提供具有竞争力的价格,每百万 token 输入/输出分别为 2 美元/6 美元。
-
研究人员提出ARA格式以取代PDF,实现AI原生科学论文
一种名为ARA(Agent-Native Research Artifacts,智能体原生研究产物)的新研究产物格式被提出,旨在取代传统的PDF格式,成为科学论文的继任者。ARA由多所机构的研究人员开发,旨在使研究更容易被AI智能体理解和复现。与PDF不同,PDF呈现的是一种经过润饰的、线性的成功叙事,而ARA则捕捉了整个研究过程,包括失败的假设、实验细节和原始数据,从而使AI更容易理解、复现和扩展研究成果。尽管初步测试表明,与PDF…
-
阿里巴巴的Qwen3.8-Max模型在基准测试中超越GPT-5.6和Claude Fable 5
阿里巴巴的Qwen团队发布了Qwen3.8-Max,这是一个拥有2.4万亿参数的多模态模型,据称在OSWorld-Verified基准测试中表现优于GPT-5.6 Sol Max和Anthropic的Fable 5。该模型声称能够自主完成复杂的软件项目并复现研究论文。阿里巴巴已宣布了具有竞争力的API定价,并计划下周发布开放权重,但许可条款仍未披露。
-
阿里云发布Qwen3.8,提升编程和办公AI能力 · 追踪2个来源
阿里云正式发布了其新的旗舰大型语言模型Qwen3.8,总参数量达到2.4万亿。该先进模型在编程和专业办公任务方面表现出显著的改进,跻身全球顶级大型模型之列。支持视觉理解和100万token上下文长度的Qwen3.8-Max,以及Qwen3.8-27B模型,将于下周开源发布。新模型提供了增强的推理能力、更快的推理速度以及具有竞争力的API服务定价。
-
LLM生成的评分标准在论文复现中显示出偏向高分的倾向
一项对LLM生成的论文复现评分标准的新元评估显示,虽然这些评分标准可以提高评估的一致性,但它们常常表现出偏见。研究发现,LLM生成的评分标准往往过于细致,偏向高分,并且缺乏对特定论文领域的适应性。然而,增强的生成设置在与真实评分标准的一致性方面显示出显著的改进,接近人类基线性能。
-
STORM系统通过状态管理改进多智能体代码协作
研究人员推出了一种新颖的面向状态的管理系统STORM,旨在增强在共享代码库上工作的多个AI智能体之间的协作。与依赖工作区隔离和延迟冲突解决的现有方法不同,STORM主动调解智能体交互,以确保一致的视图并在编辑点检测冲突。在Commit0和PaperBench等基准上的评估表明,STORM的性能显著优于基线方法,并在各种LLM上取得了高分。