研究人员开发了 MineCEraft,这是一个新的基准测试,旨在评估大型语言模型 (LLM) 在 Minecraft 游戏中执行建造工程任务的能力。这个开源基准测试包含 723 条手工制作的指令,涵盖 17 个任务类别,并提供程序可验证的评估来衡量 LLM 的可靠性。使用 MineCEraft 进行的初步评估揭示了将 LLM 应用于此类建造工程任务时存在的显著故障模式和实际挑战。 AI
影响 该基准测试可以帮助研究人员识别和解决 LLM 在复杂、结构化任务执行方面的局限性。
排序理由 该集群描述了一篇介绍 LLM 评估基准测试的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →