PulseAugur
实时 08:36:32
实体 Nash equilibrium

Nash equilibrium

PulseAugur coverage of Nash equilibrium — every cluster mentioning Nash equilibrium across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 18
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_198118 ·

    新AI框架学习交叉口类人驾驶行为

    研究人员开发了一个名为深度虚构博弈潜在微分博弈(DFP-PDG)的新框架,用于模拟和学习无信号交叉口处的类人驾驶行为。该方法将车辆交互重新构建为潜在微分博弈,并从自然驾驶数据中学习成本函数权重以捕捉不同的驾驶风格。该框架理论上保证收敛到纳什均衡,并已使用INTERACTION数据集进行了验证,证明了其在学习真实驾驶策略方面的有效性。

  2. TOOL · CL_199776 ·

    LLM 在双人游戏中展现出惊人的协调能力,但在团队中表现不佳

    一项新的研究论文探讨了大型语言模型(LLM)在没有直接通信的多智能体游戏中的协调能力。研究发现,在双人游戏中,两个前沿托管的 LLM 能够持续超越纳什均衡基线,这表明它们能够推断对手的行为。然而,在更大的团队中,性能显著下降,这表明其自玩协调能力在扩展方面存在局限性。

  3. TOOL · CL_183093 ·

    New game theory model predicts cooperation in foundation model agents

    研究人员开发了一个新的博弈论框架“嵌入式均衡”,以更好地模拟基于基础模型的 AI 代理的行为。与假设解耦的代理的经典博弈论不同,这个新模型将代理视为嵌入其环境之中,并将其自身的决策过程视为系统的一部分。这种方法可以预测合作,这与通常在社会困境中预测背叛的传统模型形成对比。“嵌入式贝叶斯代理”通过允许代理推断他人的行为相似性,并利用自身的规划审议作为潜在合作的证据来形式化这一点。

  4. TOOL · CL_173872 ·

    新的CS-RNR方法允许AI智能体在游戏中自我认证其漏洞

    研究人员开发了一种名为置信度调度受限响应(CS-RNR)的新方法,用于在不完美信息游戏中进行博弈的智能体。该技术允许智能体自我认证其漏洞,确保任何偏离纳什均衡策略的行为都经过安全审计。CS-RNR使用置信度序列来确定何时可以利用对手的行为,然后生成候选的应对策略。在Leduc扑克上的测试中,CS-RNR在保持安全保证的同时,取得了比以前的方法显著更高的收益。

  5. RESEARCH · CL_173876 ·

    新的嵌入预测LLM在博弈中的策略迁移

    研究人员开发了一种新的正则博弈行为嵌入方法,以更好地理解微调如何影响大型语言模型(LLM)的策略推理能力。这种嵌入方法使用两个特征——纳什均衡熵和最优响应敏感度——能够可靠地预测在新的博弈中的性能变化,而现有的结构嵌入则不能。研究结果表明,LLM的策略迁移是由博弈所需的决策行为驱动的,而不是其收益结构。

  6. TOOL · CL_166990 ·

    新算法解决了并发停止博弈中的均衡问题

    研究人员开发了新的算法来分析并发停止博弈中的均衡,这是一种用于多智能体系统的模型。即使在更简单的轮流博弈场景下,这些博弈中纳什均衡的约束存在性问题也是不可判定的。该研究通过考虑ε-纳什均衡提出了一个近似解,虽然计算量大,但在ε的比特大小上是多项式的。此外,研究还探讨了极端风险敏感均衡(XRSE),在这种均衡中,玩家会考虑最坏情况下的收益,并发现并发博弈中XRSE的约束存在性问题是NP完全的。

  7. TOOL · CL_163897 ·

    共享发现悖论:汇集信息可能损害搜索结果

    一个新的基准,“共享发现悖论”,分析了如何将分散的信息汇集到单一推荐中会悖论式地导致更差的搜索结果。虽然整合信息可以提高最佳单一推荐的准确性,但当代理人反复基于这个单一的汇集视图进行操作时,它会显著降低整体的群体发现能力。研究提出,这是一个协议失败,而不是信息失败,并建议“一个答案规则”将一系列行动压缩为单一的、重复的选择。该研究还探讨了自私的搜索者场景,并引入了“唯一救援奖励”来激励更好的结果。

  8. RESEARCH · CL_153892 ·

    共享发现悖论:研究发现汇集信息可能损害搜索

    一篇题为《共享发现悖论》的新论文探讨了信息汇集如何会适得其反地导致更差的搜索结果。该研究引入了一个包含多个代理和噪声线索的基准,证明了虽然信息汇集可以改善个人推荐,但“一个答案规则”会极大地减少集体发现。论文认为这是一个协议失败,而不是信息失败,并提出了涉及协调行动或修改奖励结构以提高集体搜索效率的解决方案。

  9. TOOL · CL_152452 ·

    新的MESHA算法利用严厉触发条件解决战略线性老虎机问题

    研究人员开发了MESHA,这是一种用于战略线性老虎机中最佳臂识别(BAI)的新算法。该场景涉及可能故意错误报告其特征以显得最佳的臂。MESHA采用统一采样规则和分时期严厉触发条件来减轻这些战略行为的影响,并识别与事实显著偏离的臂。该算法在战略环境中表现优于依赖最优设计采样规则的现有方法,后者可能适得其反。

  10. TOOL · CL_139339 ·

    新的PGTS框架增强了多智能体博弈策略的计算

    研究人员开发了一个名为Primitive-Guided Tree Search (PGTS) 的新框架,以解决多智能体追逐-逃跑博弈中计算纳什均衡策略的复杂性。这种混合方法将离线计算小型子博弈的精确纳什均衡与部署期间的在线树搜索相结合。PGTS利用这些预先计算的最优子博弈策略和价值函数来指导其搜索并估计叶节点值,在各种图拓扑上的实验中表现优于现有的学习和启发式方法。

  11. TOOL · CL_117139 ·

    新的FALCON算法解决了航空航天领域的非凸微分博弈问题

    研究人员开发了FALCON,这是一种旨在解决复杂多智能体最优控制问题的新型算法,特别适用于航空航天领域的追逐-规避和太空对抗等应用。该算法通过放宽智能体间的控制耦合并采用序贯凸规划,将非凸微分博弈问题转化为可处理的凸子博弈来解决。FALCON为这些非凸博弈提供了全局收敛到开环纳什均衡的保证,证明了其在合作和竞争场景中的有效性。

  12. RESEARCH · CL_115592 ·

    AI算法在游戏中系统性地选择不同的纳什均衡

    一篇新的研究论文探讨了不同的算法如何在零和游戏中选择纳什均衡,发现这种选择是依赖于算法的,而不是随机的。像R-NaD和磁镜下降这样的正则化方法倾向于选择最大熵均衡,而像CFR和CFR+这样的后悔平均方法则收敛于一个较低熵的均衡。这种选择对游戏结果有下游影响,尤其是在具有顺序或隐藏信息的游戏中。

  13. RESEARCH · CL_116098 ·

    新算法解决复杂多人博弈中的纳什均衡问题 · 跟踪3 个来源

    研究人员开发了一种名为“投影可利用性下降”(Projected Exploitability Descent, PED)的新算法,用于近似计算具有不完美信息的复杂多人博弈中的纳什均衡。该算法最小化了可利用性函数的一个代理目标,这是一个非凸且不光滑的目标。虽然 PED 在长时间运行中表现出持续的改进,但最初的性能不如已有的方法,如虚构博弈(Fictitious Play, FP)和反事实遗憾最小化(Counterfactual Regr…

  14. TOOL · CL_79954 ·

    LLM通过形式化证明框架发现新的纳什均衡算法

    研究人员开发了一个名为LegoNE的框架,该框架将大型语言模型与形式化证明策略相结合,以发现近似纳什均衡的算法。该系统可以自动验证候选算法的最坏情况保证,这是一项以前自动化系统无法完成的任务。利用这种方法,他们重新发现了双人博弈的最先进算法,并发现了一种新的三人博弈算法,该算法改进了现有的保证。

  15. TOOL · CL_49321 ·

    AI模型将创伤复苏视为纳什均衡博弈

    研究人员开发了一种新的方案,通过将创伤复苏过程建模为广义纳什均衡寻求博弈来优化该过程。该方法融入了临床经验,以更好地理解医护人员的行为和资源分配。目标是通过在工作量、日程安排和有限资源的约束下优化决策来改善患者的治疗效果。

  16. TOOL · CL_36958 ·

    算法定价模型可能导致超竞争性价格

    研究人员开发了一个理论框架,以理解简单的算法定价系统如何在多公司市场中导致超竞争性价格。他们的模型使用具有错误设定的需求估计的探索-利用管道,表明当公司探索相似的价格范围时,价格可能超过纳什均衡水平。研究表明,在对称探索下,价格甚至可能达到垄断水平,并且在真实租赁市场上的模拟表明这些结果是稳健的。

  17. MEME · CL_14513 ·

    Enshittification 和 AI:探讨平台衰败和社会联系

    该集群讨论了“enshittification”的概念,该术语描述了在线平台的衰败,以及它与人工智能的潜在关系。其中一篇文章推测了晚期资本主义、AI 以及各种文化和科学主题之间的广泛联系,另一篇文章则链接到一个探讨 AI 在平台衰败中作用的视频。

  18. RESEARCH · CL_14461 ·

    研究发现,基于奖励模型的LLM对齐面临统计上的不可能性

    一篇新论文探讨了大语言模型(LLM)与多样化人类偏好对齐所面临的统计挑战。研究人员证明,由于人类偏好中普遍存在孔多塞循环,现有的基于奖励的对齐方法(如人类反馈强化学习)在统计上是不可能的。然而,该研究也表明,非基于奖励的方法(如纳什学习)可以通过使LLM使用混合策略,在统计上保留少数派偏好。

  19. RESEARCH · CL_11730 ·

    大型语言模型计算纳什均衡,但通过末层覆盖来抑制它

    研究人员调查了大型语言模型(LLMs)在战略互动中为何偏离纳什均衡博弈。通过检查 Llama-3 和 Qwen2.5 等开源模型,他们发现虽然对手历史得到了很好的编码,但纳什行动本身的表征却很弱。模型末层的亲社会覆盖似乎抑制了纳什行动,导致了合作行为。有趣的是,思维链推理可以提高大于 70B 参数的大型模型的纳什博弈能力,但会降低小型模型的纳什博弈能力。

  20. RESEARCH · CL_11472 ·

    新的均衡概念最小化联盟偏离激励

    研究人员开发了一种新的博弈论解概念,解决了传统均衡模型的局限性。该概念侧重于最小化联盟偏离的激励,而不是要求完全不存在,从而确保其存在。该论文介绍了基于平均和最大联盟收益计算均衡的算法,并为这些目标设定了复杂性界限。