研究人员推出了 Social Gym,这是一个包含 21 种多智能体社交游戏的新环境,旨在客观地对 LLM 的社交推理进行基准测试和改进。该系统使用 Elo 锦标赛对模型进行排名,结果显示 GPT-5 mini 领先,但在所有游戏和角色中表现不均衡。为了解决这些局限性,开发了 SPaRTan(Self-Play and Reflect-Transfer)方法,这是一种无需训练的循环,模型在该循环中生成并应用剧本以提高其性能,特别是使 GPT-5 mini 在较弱的角色上受益。 AI
影响 这项研究为评估和改进 LLM 的社交推理提供了一个更客观的框架,有望在复杂的多智能体环境中产生更强大的智能体。
排序理由 该集群包含一篇学术论文,详细介绍了用于评估 LLM 能力的新基准和方法论。
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →