Language agents
PulseAugur coverage of Language agents — every cluster mentioning Language agents across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新框架应对 AI 代理的自适应提示注入攻击
研究人员开发了 CoRL,一个用于防御和模拟工具增强语言代理的自适应间接提示注入 (IPI) 攻击的新框架。IPI 攻击将对抗性指令隐藏在工具输出中,对代理执行构成重大威胁。CoRL 通过将自适应 IPI 建模为马尔可夫博弈来解决此问题,使攻击者能够发展其策略,防御者能够调整其防御。该框架包括攻击初始化、协同进化训练和防御者巩固阶段,在保持任务效用的同时显著降低了攻击成功率。
-
KV 缓存缺陷破坏语言代理回滚一致性
arXiv 上的一篇新研究论文详细介绍了一个与 KV 缓存保留相关的语言代理中的关键漏洞,该漏洞可能导致回滚不一致。这意味着,即使应用程序认为它已丢弃某些信息,模型仍可能由于残留的 KV 状态而保留并关注这些信息。研究人员在多个开源模型上展示了这个问题,并发现即使使用 Hugging Face Transformers 和 LangGraph 等标准工具也可以重现。他们提出了一种通过事务本地缓存恢复来解决此问题的方案,以弥补此状态完整性漏洞。
-
新基准揭示前沿 AI 模型在错误信息方面会灾难性地失败
研究人员开发了合成网络基准,这是一个旨在测试语言代理对错误信息易感性的新环境。该基准具有程序生成的超链接文章,并带有可信度和事实性的地面真实标签,可以隔离对抗性排名漏洞。对六个前沿模型的初步测试显示,即使可以访问真实来源,当暴露于一篇高可信度错误信息文章时,准确性会显著下降且校准失准。这些发现突显了当前模型处理冲突信息的基本局限性,并强调在高风险应用中需要更强大、更具认知谦逊性的代理。
-
新框架分析AI代理如何从游戏经验中学习
一篇新的研究论文介绍了一个名为“经验敏感型游戏学习”的框架,用于分析游戏玩法经验如何影响人类和语言代理的决策行为。研究发现,人类玩家随着重复游玩,会逐渐从贪婪策略转向更全局的策略。然而,当前自演进的语言代理在将游戏玩法经验转化为持久行为改变方面的能力有限,表现出嘈杂且暂时的改进。
-
新框架ECHO通过轮次信用分配增强语言代理的自适应性
研究人员引入了认知决策过程(EDPs),一个显式建模信息寻求行为的多轮语言代理新框架。该方法旨在通过关注在当前信念状态下有用的动作来提高代理的自适应性,而不是仅仅与最终任务成功相关联。开发了一种名为ECHO(认知历史条件优化信用分配)的新算法,使用后验敏感奖励来分配轮次信用,在新的证据寻求基准测试中,在解决度、信息增益和效率方面取得了显著的改进。
-
新研究将任务不敏感性确定为语言代理的关键弱点
研究人员已将“任务不敏感性”确定为大型语言模型作为代理时,在分布外泛化能力较弱的关键原因。当模型将学到的模式应用于新的、相似的任务时,即使指令被损坏或语义改变,也会发生这种现象。为解决此问题,提出了一种名为任务扰动 NLL 优化(Task-Perturbed NLL Optimization)的新方法,该方法作为一种正则化器,确保行为更依赖于任务指令。评估表明,此干预措施在保持对任务相关信息的关注的同时,提高了任务敏感性和泛化能力。
-
语言代理学会更有效地寻求帮助
一篇新的研究论文介绍了ACTION-RATING,一种将澄清寻求直接整合到分层语言代理动作空间中的方法。这种表述允许代理在每个决策点上竞争行动和寻求帮助,从而产生可观察到的寻求帮助行为。研究观察到从强制性澄清转向机会性澄清,显著提高了信息寻求的有效性。
-
新框架联合训练语言代理的策略和世界模型
研究人员开发了一个名为PaW的新框架来训练语言代理。该方法在强化学习过程中同时联合训练策略和世界模型组件。PaW利用现有的RL数据来提供世界模型监督,避免了对单独模拟器或额外计算的需求。
-
研究揭示模型生成的代理技能效用参半
研究人员对模型生成代理技能的生命周期进行了系统研究,涵盖了从经验生成到技能消费的整个过程。他们的发现表明,虽然这些技能通常能提高代理性能,但也可能导致负迁移,即在某些情况下反而会阻碍性能。研究强调,模型作为技能提取器的有效性与其作为技能消费者的能力不一定相关,并且技能的效用并非完全取决于模型规模。