PulseAugur
实时 07:42:08
实体 Large Language Model Agents

Large Language Model Agents

PulseAugur coverage of Large Language Model Agents — every cluster mentioning Large Language Model Agents across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 17
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 17
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. TOOL · CL_206003 ·

    新基准测试LLM智能体在航空副驾驶中的作用

    研究人员推出了AeroCopilotBench,这是一个新颖的两级基准测试,旨在评估航空场景中的大型语言模型(LLM)智能体。该基准测试包括一个名为AeroCopilot Operational Environment(ACOE)的虚拟驾驶舱环境,以及一套1200道选择题用于知识评估。第二级侧重于程序执行和安全合规性,包含73项源自飞行员操作手册的紧急和异常任务。对12个模型的初步测试显示,虽然知识可以评估,但程序执行仍然是一个重大挑…

  2. TOOL · CL_194695 ·

    AI代理被测试用于规避生物工具检测

    研究人员探索了大型语言模型代理在识别和潜在规避核酸合成中使用的生物工具方面的能力。该研究侧重于筛选规避技术,特别是检查这些代理如何用于绕过与DNA聚合酶抑制剂相关的检测方法。这项研究突显了人工智能在推动科学发现和构成安全挑战方面的双重用途潜力。

  3. TOOL · CL_195686 ·

    新的人工智能框架旨在超越现金流评估生物技术资产

    提出了一种新的多智能体人工智能框架,用于评估临床阶段、跨境生物技术公司,以解决传统现金流估值方法的局限性。该框架包含一个用于定性科学判断的估值层、一个用于国际定价的协调层以及一个用于平衡科学和监管视角的冲突融合机制。论文作者指出,该底层方法之前是手动执行的,在一个专门的生物技术基金中实现了显著的投资回报。

  4. RESEARCH · CL_191120 ·

    新研究解决 LLM 代理的信用分配问题 · 已追踪 2 个来源

    arXiv 上的两篇新研究论文探讨了大型语言模型代理的高级信用分配技术。第一篇论文《从推理到代理:大型语言模型强化学习中的信用分配》综合了现有研究,以应对在复杂的代理环境中确定哪些具体行动或推理步骤能带来预期结果的挑战。第二篇论文《Gated-BEPO:置信门控贝尔曼信用分配用于大型语言模型代理》引入了一种名为 Gated-BEPO 的新方法,该方法使用经验性滚动图和置信门来更有效地将稀疏终端结果的奖励传播到单个行动,并在各种基准测试…

  5. TOOL · CL_185314 ·

    MemFly框架利用信息瓶颈原理优化LLM内存

    研究人员推出MemFly,一个旨在优化大型语言模型(LLM)长期记忆能力的新框架。该系统利用信息瓶颈原理,在高效压缩冗余数据和精确检索复杂任务之间取得平衡。MemFly采用无梯度优化器来管理压缩熵和相关熵,创建分层内存结构。它还结合了具有迭代精炼功能的混合检索机制来处理多跳查询,在内存连贯性、响应保真度和准确性方面比现有方法有显著改进。

  6. TOOL · CL_174030 ·

    大语言模型智能体自动化化工过程PID整定

    研究人员开发了一个新颖的框架,利用大语言模型(LLMs)自动化化工过程中的PID控制器整定。该方法模仿了人类工程师的迭代工作流程,使用LLMs诊断过程响应、调整整定参数并验证结果。该框架分别使用了大型和小型语言模型进行了测试,包括DeepSeek-V4-Flash、Qwen3.7-Plus以及一个经过微调的Qwen3-0.6B。经过物理信息优化增强的微调版Qwen3-0.6B在各种测试案例中取得了94.0%的高成功率,展示了提高控制系…

  7. TOOL · CL_174368 ·

    MemHarness框架使LLM代理能够重构过往经历

    研究人员推出了一种名为MemHarness的新型框架,旨在通过使大型语言模型(LLM)代理能够重构过往经历而非简单回放,来增强其能力。这种受人类记忆启发的做法允许代理将检索到的信息适应当前情境,从而避免负面迁移并改善决策。在ALFWorld和WebShop上的实验表明,MemHarness在出分布场景下显著优于现有的强化学习和静态记忆增强基线。

  8. TOOL · CL_167225 ·

    大型语言模型代理在机器人化学实验室压力测试中失败

    一篇新发表在arXiv上的研究详细介绍了如何利用机器人化学实验室对大型语言模型(LLM)代理进行压力测试。研究人员发现,LLM代理在可靠的物理操作和根据证据进行适应方面存在困难,只有3.3%的试验产生了专家评估的可执行工作流。尽管实验反馈促使了微小调整,但代理并未展示出工作流级别的重新规划或分析方法重新设计能力。该研究旨在为LLM在科学研究中的部署就绪度提供可衡量的评估,并为改进提供一个框架。

  9. TOOL · CL_117633 ·

    LLM agents enable interpretable inverse design of MOFs

    研究人员开发了LLM4MOF,一个使用大型语言模型代理进行金属有机框架(MOF)逆向设计的框架。该系统能够自主进行化学推理,生成候选MOF,并通过模拟进行测试,在多次迭代中完善假设。LLM4MOF提出可解释的设计假设,并利用这些假设指导在各种任务中寻找高性能结构,显著减少了所需的属性评估次数。该框架还可以生成新颖的MOF并根据特定条件调整其几何形状,性能优于传统搜索方法。

  10. RESEARCH · CL_115208 ·

    研究发现:自主式AI对出行数据隐私构成可扩展威胁

    arXiv上发表的一项新研究展示了自主式AI(特别是大型语言模型)如何能够自动化从出行微数据中重新识别个人的过程。该研究提出了一种流程,AI代理能够自主搜索公开网络来源,交叉引用数据,并在极少人工干预的情况下将位置轨迹与身份关联起来。在现实世界可行性研究中,该方法成功重新识别了72%的可识别个人,凸显了隐私风险的重大转变,并对现有的统计披露控制实践提出了挑战。

  11. TOOL · CL_96097 ·

    新基准评估AI地图代理的满意度感知决策能力

    研究人员推出了MapSatisfyBench,这是一个新的基准测试,旨在评估地图代理在显式任务完成之外理解和满足用户隐式需求的能力。该基准测试从行为数据中重建完整的用户需求,识别隐式决策因素,并仅保留那些有预查询证据支持的因素。实验表明,当前代理在显式任务完成方面表现出色,但在隐式因素和主动收集支持性证据方面存在困难,这突显了将评估重点转移到满意度感知的空间决策制定上的必要性。

  12. RESEARCH · CL_84355 ·

    LLM代理指导进化式分子设计用于药物发现

    研究人员开发了“My Chemical Harness”,一个将大型语言模型(LLM)与进化算法相结合的分子设计新框架。该系统使用LLM作为高级策略控制器,指导合成路径的搜索,而不是直接生成分子。该框架确保生成的路径可以使用确定性化学工具执行,并通过分子预言机进行评分,防止LLM引起的幻觉。该方法在一个可溶性环氧化物水解酶代理任务上取得了最先进的性能,证明了受约束的LLM代理在无需广泛训练的情况下进行分子发现的潜力。

  13. TOOL · CL_63379 ·

    香港中文大学团队推出SLIM,实现大语言模型智能体的动态技能管理

    香港中文大学的研究人员开发了SLIM,一个用于管理大语言模型智能体所用技能生命周期的新框架。SLIM在训练过程中动态评估每个外部技能的贡献,保留有用的技能,淘汰影响减弱的技能,并扩展技能集以应对新的失败场景。这种方法旨在通过超越简单地累积或丢弃技能来优化智能体的性能,使其能够更有效地适应复杂任务。

  14. RESEARCH · CL_48703 ·

    MemAudit框架审计中毒的LLM代理内存

    研究人员开发了MemAudit,一个旨在识别和审计大型语言模型代理内存中恶意数据的新框架。该事后审计系统解决了对抗性用户可以将有害记录注入代理内存,从而可能操纵其行为的安全漏洞。MemAudit利用因果归因和结构异常检测来精确定位导致不良输出的特定内存,在测试场景中显著降低了攻击成功率。

  15. TOOL · CL_44858 ·

    新框架通过执行对齐提高 LLM 代理性能

    研究人员开发了一个名为“harnesses”的新框架,以提高大型语言模型代理在推理过程中的性能。该方法通过将工具函数分解为任务分解和引导执行来专注于对齐执行轨迹。研究揭示了工作流粒度和重试预算等因素如何影响成功率,并识别了过度分解和幻觉执行等失败模式。研究结果表明,仅指定初始步骤的部分工具可能优于完全结构化的工作流。

  16. RESEARCH · CL_50824 ·

    新基准测试大型语言模型代理从经验中形成技能的能力

    一项名为 SkillEvolBench 的新基准被引入,用于评估大型语言模型 (LLM) 代理将情景经验提炼成可重用程序性技能的能力。该基准包含六个环境中的 180 个任务,旨在测试在各种条件下的技能形成和重用。目前的 LLM 代理在形成健壮、可重用的技能方面表现出局限性,通常在原始轨迹重用方面表现优于提炼后的技能,这表明当前的抽象方法可能会丢弃有用的上下文信息。

  17. RESEARCH · CL_43964 ·

    DeferMem框架通过强化学习增强LLM长期记忆问答能力

    研究人员开发了DeferMem,一个旨在改进大型语言模型在处理长期对话记忆时的问答能力的新框架。该系统将过程分为初步的广泛候选检索和随后的条件查询证据蒸馏阶段。DeferMem利用一种名为DistillPO的强化学习算法,将检索到的信息提炼成简洁、相关的证据,在准确性和效率方面优于现有方法。