multi-agent system
PulseAugur coverage of multi-agent system — every cluster mentioning multi-agent system across labs, papers, and developer communities, ranked by signal.
15 天有情绪数据
-
新方法使用 RLHF 将多智能体令牌使用量减少 20.5%
研究人员开发了 RGA-Designer,一种用于优化多智能体系统通信拓扑的新方法。该方法受人类反馈强化学习 (RLHF) 启发,使用奖励模型来平衡任务准确性和结构效率。通过使用此奖励模型对图生成器进行微调,RGA-Designer 在任务准确性方面达到了与 ARG-Designer 等先前方法相似的水平,同时平均令牌消耗减少了 20.5%。
-
Anthropic 研究多智能体 AI 系统的挑战
Anthropic 发布了一项研究,详细介绍了在多智能体系统中观察到的模式和问题。该论文探讨了多个 AI 智能体交互的系统所固有的复杂性和挑战。
-
GraniKV 通过非对称KV缓存分页提升AI多智能体吞吐量
研究人员开发了GraniKV,一种新颖的KV缓存分页系统,旨在提高多智能体AI系统的效率,特别是那些具有长共享前缀的系统。GraniKV采用非对称粒度方法,将共享前缀连续分配,并将每个请求的后缀进行细粒度分配。该系统集成了调度器,根据工作负载特性选择最佳后端,从而在现有生产基线之上实现了显著的吞吐量提升。例如,GraniKV在Llama-3.1-8B上实现了高达2.16倍的输出令牌吞吐量,并在传统方法表现不佳的异构多智能体服务场景中展…
-
新的ETHOS框架增强了临床AI系统的伦理监督
研究人员开发了ETHOS,一个模块化伦理框架,旨在不改变其核心架构的情况下管理临床多智能体系统(MAS)。该框架充当元代理,通过确定性检查、上下文审查和伦理批评者将伦理要求转化为运行时监督。ETHOS旨在通过持续评估系统推理和输出来增强安全性、公平性、问责制、透明度和患者信任,识别伦理风险并抑制不安全响应。在肝病学决策支持MAS中得到验证,ETHOS通过检测不完整或不一致的证据,并在无法支持安全建议时增加弃权,从而提高了决策的可靠性。
-
AI提示缓存失败通过重新排序消息上下文得到修复
一位开发者发现他们的多代理AI系统由于API调用中消息的顺序而未能从提示缓存中受益。提示缓存系统通常根据输入的某个前缀进行匹配,而将唯一的代理个性化信息放在共享文档上下文之前,导致每个代理的调用在第一个令牌处就出现分歧,从而阻止了缓存命中。解决方案是将消息重新排序,将大型、相同的上下文放在前面,然后是较小的、变化的个性化信息,这显著提高了缓存利用率并降低了成本。
-
新框架旨在标准化多代理AI协作评估
两篇新研究论文介绍了用于评估基于大型语言模型(LLM)的多代理系统(MAS)的框架。第一篇,ForestBench,提出了一个统一的图框架,将异构执行跟踪映射到共享空间,从而能够标准化比较不同的MAS方法。第二篇论文,“协作鸿沟”,提出了一个说明性的迷宫解决基准,用于在没有固定通信协议的情况下评估代理协作,揭示了与单独性能相比,模型协作时性能显著下降。
-
新框架应对多智能体系统中的隐藏拜占庭攻击
研究人员开发了一个新的理论框架和算法,用于在面临隐藏拜占庭攻击的合作多智能体系统中进行在线安全学习。研究指出,攻击者的信息获取方式,无论是观察计划行动还是盲目行动,都决定了系统的模型复杂度。该研究建立了安全学习的信息论极限,证明了即使在直接回报遗憾为零的情况下,不可避免的遗憾也与累积响应差距相关。提出了一种具有已证明遗憾界的算法,为在这种对抗条件下可靠的多智能体系统奠定了基础。
-
新框架为智能体原生组织区分持久层和动态层
本文介绍了一个用于设计智能体原生组织的框架,该框架将运营层分为持久组件和动态组件。持久层包括一个四存储记录架构和专用智能体,而协调层定义了智能体的权限和特权。运行时层动态地组装任务组,而人类交互层使用翻译智能体进行控制平面调解。该框架旨在创建执行上流畅但结构上刚性的组织,并已在小规模实验中实现并评估了原型。
-
新模型将代理移动性、记忆和网络结构与约定临界点联系起来
一个新的基于代理的模型探讨了移动性、记忆和网络结构如何影响约定临界点。研究人员发现,在许多情况下,少数忠实者不可避免地会推动人口采纳一项新约定。该研究还开发了一个预测模型来估计完成采纳所需的时间,强调移动性是主要的加速器,而记忆和连接性则调节速度。
-
HELENA框架通过新颖的协调增强多智能体系统
研究人员推出HELENA,一个新颖的多智能体系统框架,旨在通过整合不同的推理路径并抑制噪声来增强分析能力。HELENA使用蒙特卡洛树搜索和行列式点过程选择互补拓扑,构建一个复合图。然后,一个分层稀疏协调模块仅激活必要的子图,通过压缩的潜在摘要抑制冗余信息。实验表明,HELENA在八个基准测试中取得了最先进的成果,包括在MMLU-Pro上显著的平均提升。
-
研究人员将多智能体攻击/防御方法应用于大型语言模型推荐系统
研究人员已将通用多智能体系统(MAS)的攻击和防御方法改编应用于由自主语言智能体驱动的协作过滤(CF)系统。该研究在AgentCF框架内,在不同连通性水平下评估了这些改编方法,并考察了候选数量和目录集中度如何影响攻击和防御结果。研究结果表明,MAS攻击策略具有部分可转移性,用户和项目智能体之间存在角色不对称,并且攻击效果呈现非单调的时间动态。
-
新研究探索使用符号选项和合作进化策略训练的 LLM Agent
研究人员正在探索训练大型语言模型 (LLM) 作为复杂环境中 Agent 的新方法。一种方法,在一篇新的 arXiv 论文中详细介绍,使用“前沿编码模型”为 Agent 生成符号选项,然后使用多 Agent GRPO (PA-MAGRPO) 的变体和 LoRA 适配器进行训练。该方法旨在通过关注行为评估来提高 Agent 的性能,超越简单的奖励最大化,因为单独的奖励可能是真正合作的不可靠指标。另一篇论文介绍了一种用于资源受限的 LLM…
-
在LLM多智能体系统中发现新的后门漏洞
研究人员在基于LLM的多智能体系统中发现了一种新的漏洞,其中协作会无意中触发后门行为。这种情况发生在多个智能体的集体证据达到隐藏阈值时,而不是依赖于单个消息。为了解决这个问题,已经开发了一种名为边界条件后门注入(BCBI)的新范式,用于构建分离良性和对抗性目标的特定边界对。此外,还提出了一种名为潜在转换测试时评估(LATTE)的防御机制,用于学习正常的通信动态并隔离异常的智能体更新。
-
新框架增强数字孪生中人工智能代理的可验证性
研究人员引入了一个新颖的神经符号去中心化治理框架,旨在增强数字孪生生态系统中人工智能代理的可验证性。该框架集成了概率神经推理和确定性制度治理,利用多层语义配置文件和形式化领域本体来确保代理遵守策略并维持值得信赖的人机协作。通过基于区块链的智能合约验证组织机构颁发的凭证,从而实现可审计的参与,而不会泄露敏感数据。一个原型演示了该系统在防止未经授权的交互和跨诊所、数字孪生和可穿戴设备提供商代理执行策略方面的有效性。
-
Intellibooks 提供数据驱动型企业 AI 战略框架
Intellibooks 推出了一个实用框架,旨在帮助企业构建数据驱动型战略,即使在实施生成式 AI 或 RAG 等高级 AI 技术时也是如此。该框架在其《数据战略单页概览》中进行了详细介绍,引导组织完成七个步骤,强调以业务为先的方法,即目标决定数据计划,而不是反之。关键步骤包括梳理当前数据现状、通过明确的所有权和治理建立坚实的数据基础,以及通过集中的试点项目将原始数据转化为可行的见解和业务成果。
-
新的MARS框架实现了多智能体系统的自主修复
研究人员开发了MARS,一个用于自主修复多智能体系统(MAS)的新型基于搜索的框架。MARS将修复过程构建为蒙特卡洛树搜索(MCTS)问题,通过诊断引导的扩展和分类增强的评估来导航潜在解决方案。该方法在新提出的StateMAS基准测试中表现显著优于现有方法,该基准测试包含1,310个多智能体故障轨迹。MARS在有效管理令牌消耗的同时,显著提高了修复准确性。
-
新研究论文为多智能体赌博机系统引入程序化公平
一篇新论文将程序化公平的概念引入多智能体多臂赌博机系统,超越了基于结果的公平性指标。该研究提出将程序化公平形式化为决策策略中的平等发言权和代表性。实证结果表明,优先考虑程序化公平对基于结果的目标造成的牺牲最小,而以结果为中心的方法可能会损害平等代表性。
-
对抗性评论绕过LLM代码漏洞检测器
研究人员开发了ALIBI,一个新颖的攻击框架,通过在源代码中插入对抗性自然语言注释来绕过基于LLM的漏洞检测器。该技术通过引导其推理或模仿工具输出来成功操纵了90%以上的受测检测器,包括先进的多代理系统。该攻击利用了LLM对注释作为上下文的信任,这是一种类似于聊天界面中提示注入的漏洞,并突显了当前静态分析工具的不足。
-
人工智能可视化口述历史面临叙事保存挑战
一篇新的研究论文探讨了使用生成式人工智能可视化口述历史访谈的挑战,特别是针对侨民社区。该研究提出了一个包含15个指标的框架来评估人工智能生成的可视化效果,并确定了三种主要的失败模式。研究人员发现,原始证词的叙事结构对人工智能可视化的成功率有显著影响,常常在场景规划和叙事保存之间产生冲突。
-
SafeFlow 框架增强多智能体系统安全性,阻止恶意传播
研究人员推出 SafeFlow,一个旨在增强多智能体系统安全性的新框架。该系统解决了恶意意图分散在专业智能体中可能导致数据泄露或不安全操作等意外后果的挑战。SafeFlow 将此问题形式化为语义信息流问题,将结构化“污点”附加到请求上,并在采取不可逆操作之前对其进行验证。评估表明,SafeFlow 在降低各种基准测试中的攻击成功率方面是有效的,包括提示注入和风险代码执行,同时保持了高比例的良性任务完成率。