AutoResearch
PulseAugur coverage of AutoResearch — every cluster mentioning AutoResearch across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI学会通过编写可编辑代码而非仅仅是提示来绘画
研究人员开发了一种新颖的方法,用于训练AI模型通过编写代码来生成图像,而不是仅仅依赖文本提示。这种方法允许通过直接修改代码来对生成的艺术品进行更精细的编辑。该系统利用强化学习,其中一个裁判模型根据参考图像评估生成的代码输出,为训练提供奖励信号。通过仔细设计奖励函数来平衡特异性和泛化性,这种方法解决了将强化学习应用于艺术生成等主观任务的挑战。
-
新的AutoResearch系统通过基于证据的执行来巩固科学理念
一个名为AutoResearch的新自主研究系统已被开发出来,以提高科学探究的可靠性和基础性。这个两阶段系统将想法生成与基于证据的执行相结合,确保研究概念在实验之前和实验期间都经过彻底审查。AutoResearch旨在通过持续整合新的研究信号、识别可转移的见解,并采用多模型生成和交叉审查来制定有根据的研究计划,从而减少幻觉。在其执行阶段,协调代理将计划分解为实验,诊断问题,并在接受结论之前进行独立的基于证据的审查,从而展示可衡量的进展…
-
GigaWorld-Policy-0.5通过更快的推理能力增强机器人控制
研究人员开发了GigaWorld-Policy-0.5,这是一种增强型世界动作模型(WAM),旨在实现更高效的机器人控制。该模型通过在训练时使用未来的视觉动力学,并在推理时采用仅动作解码方法,解决了传统WAM的计算开销问题。GigaWorld-Policy-0.5通过混合Transformer架构和用于优化训练配置的AutoResearch管道,在RTX 4090设置上实现了85毫秒的推理延迟。
-
AI代理在约束条件下进行自主文件压缩测试
作者通过设置文件压缩实验,探索使用AI代理处理复杂任务。目标是观察AI是否能在定义的约束条件(完美解压和时间限制)下自主实现可量化的目标(文件大小减小)。这种方法旨在为如何将更大、无监督的任务分配给AI代理提供直观认识,可能摆脱对外部库和现成解决方案的依赖。
-
AI代理现在可以自主构建和销售AI产品
两个独立项目展示了AI系统自主研究、开发和部署新AI产品的日益增长的能力。一个项目使用Claude和AutoResearch、Prime Intellect等工具来训练专业模型,旨在将AI开发民主化,使其超越大型实验室。另一个项目则有一个自主AI业务团队,该团队在GitHub和Hugging Face等平台上循环进行AI代理产品的研究、构建和发布,并内置了计费系统。
-
新研究通过新颖的检测方法解决LLM和VLM的幻觉问题 · 已追踪7个来源
研究人员正在开发新的方法来对抗大型语言模型(LLM)和视觉语言模型(VLM)中的幻觉。一种名为InnerExpert的方法,利用来自混合专家(MoE)架构的内部信号进行每令牌幻觉检测。另一个系统AutoResearch,旨在通过整合创意生成与可靠的实验来为自主研究奠定基础。其他方法侧重于通过将输出与输入证据对齐或跨模型层聚合真实性信号来检测幻觉跨度。对于医学VLM,一个名为CAST的框架在推理过程中使用反事实解剖学指导进行无标注幻觉缓解。
-
Sakana AI 的 Fugu-Ultra 智能体自主优化机器学习训练和文本重建
Sakana AI 开发了 Fugu-Ultra,这是一种能够自主改进机器学习训练配方的 AI 智能体。在一项实验中,Fugu-Ultra 在一台 H100 GPU 上迭代编辑了训练代码,并在 14 小时内运行了 123 次实验,取得了比三个前沿模型更好的平均每比特字节 (BPB) 分数。在另一项独立测试中,Fugu-Ultra 在重建古典日语文本的阅读顺序方面表现出卓越的性能,其 NED 分数达到 0.80,而其他模型的得分均低于 …
-
AI研究系统获得面向失败的内存以提高性能
研究人员开发了一种新颖的“负知识内存层”,旨在改进AI辅助研究系统。该系统将失败的尝试转换为共享库中的结构化、类型化记录,下游代理可以接受或拒绝这些记录。在ScienceAgentBench和复杂的PDE问题上的评估表明,这种负知识方法优于标准的AutoResearch基线,并在其他方法失败的情况下成功完成了任务。研究结果表明,显式维护结构化的负知识对于在AI参与的研究中建立集体科学记忆至关重要。
-
AI工程演进:“Loopcraft”取代提示工程
AI工程正从提示编写转向设计自主循环来管理AI代理。这一被称为“loopcraft”的概念,涉及创建迭代提示AI模型、测试其输出并优化其流程的系统。Anthropic 的 Peter Steinberger 和 Boris Cherny 等关键人物提倡这种方法,强调提示系统设计而非单个提示。支持性基础设施和工具的发展使得这一转变成为可能,Andrej Karpathy 的“autoresearch”项目就是一个例子,该项目使用自然语言…
-
人工智能凸显医疗保健数据模式的缺陷,要求采用新方法
医疗保健现有的数据模式,为计费和效率而构建,无意中将健康感知限制在离散事件而非连续信号。人工智能在定义空间内持续优化的能力,正如Andrej Karpathy的AutoResearch所展示的那样,凸显了这些被称为“program.md”的数据模式的关键重要性。如果这些数据模式存在缺陷,人工智能将有效地优化错误的结果,这突显了需要能够识别和学习当前数据本体论局限性的系统。