实体
CrucibleBench
CrucibleBench
PulseAugur coverage of CrucibleBench — every cluster mentioning CrucibleBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
AI代理在复古文本冒险游戏中进行测试
CrucibleBench 引入了一种新颖的AI代理评估方法,利用多人在线地牢(MUD)作为测试环境。该方法摒弃了复杂的模拟器,提供了一个持久且受限的环境来衡量AI在交互、信息检索和目标达成方面的表现。研究通过在这些模拟世界中观察到的行为,揭示了当前依赖LLM裁判的AI评估方法存在的显著偏见,以及诸如对话循环和探索瘫痪等常见的AI故障模式。
-
在文本MUD中评估LLM以测试行为适应性
研究人员开发了CrucibleBench,一种通过将大型语言模型(LLM)置于文本多人地下城(MUD)环境中来评估LLM的新颖方法。该方法利用了MUD固有的限制,例如有限的动作、非玩家角色(NPC)的明确社交反馈以及持久的世界状态,以衡量LLM在需要信任、信息收集和适应性的场景中的行为。研究发现,使用LLM作为评判者进行评估会显著改变模型的排名,这凸显了此类方法的不稳定性,并表明在报告评判者剔除下的协议和稳定性方面需要更大的透明度。