mud
PulseAugur coverage of mud — every cluster mentioning mud across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
BlowTorch 2 MUD客户端在F-Droid上发布
BlowTorch 2,一款MUD客户端应用程序,已在F-Droid上发布,F-Droid是免费和开源的Android应用程序的存储库。该客户端提供触发器、别名、计时器和Lua插件等功能,增强了用户对MUD(多人地牢)游戏的体验。
-
研究人员探究 MUD 基准测试中的 AI 评估缺陷
研究人员正在调查 MUD,一个基准环境,作为评估 AI 系统的一种方法。他们的研究表明,大型语言模型(LLM)裁判可能表现出传统聚合指标(如 kappa)无法检测到的偏见。这凸显了当前 AI 评估技术中的重大挑战,尤其是在使用语言模型进行复杂评估任务时。
-
AI代理在复古文本冒险游戏中进行测试
CrucibleBench 引入了一种新颖的AI代理评估方法,利用多人在线地牢(MUD)作为测试环境。该方法摒弃了复杂的模拟器,提供了一个持久且受限的环境来衡量AI在交互、信息检索和目标达成方面的表现。研究通过在这些模拟世界中观察到的行为,揭示了当前依赖LLM裁判的AI评估方法存在的显著偏见,以及诸如对话循环和探索瘫痪等常见的AI故障模式。
-
在文本MUD中评估LLM以测试行为适应性
研究人员开发了CrucibleBench,一种通过将大型语言模型(LLM)置于文本多人地下城(MUD)环境中来评估LLM的新颖方法。该方法利用了MUD固有的限制,例如有限的动作、非玩家角色(NPC)的明确社交反馈以及持久的世界状态,以衡量LLM在需要信任、信息收集和适应性的场景中的行为。研究发现,使用LLM作为评判者进行评估会显著改变模型的排名,这凸显了此类方法的不稳定性,并表明在报告评判者剔除下的协议和稳定性方面需要更大的透明度。
-
新播客和游戏反思出现
此集群汇总了关于近期播客的新闻,包括与Dave Airlie在SE Radio上的讨论,以及BSD Now播客和This Week in Linux的新节目。它还包括对在Gothic Remake游戏中玩五小时“Mud”的个人反思。