GameCraft-Bench
PulseAugur coverage of GameCraft-Bench — every cluster mentioning GameCraft-Bench across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI研究探索具身智能体和游戏开发的自我对弈 · 追踪6个来源
两篇新研究论文探讨了用于AI开发的先进自我对弈技术。一篇论文介绍了用于具身智能体的游戏引导技能发现(GGSD),通过竞争性游戏实现人类可玩的操作技能。另一篇提出了RSIGame,一个用于自主智能体游戏开发的框架,该框架使用递归自我改进来提高游戏质量和效率,在某些基准测试中显著优于GPT-5.5。
-
新框架赋能 LLM 代理自主开发和改进软件
研究人员推出 Harness-of-Harness (HoH) 框架,旨在通过使基于 LLM 的编码代理能够持续改进软件来增强自主软件开发能力。HoH 将开发过程结构化为迭代的规划-编码-测试循环,平衡修复与能力增长,并将任务分解为小型、可验证的增量。在 GameCraft-Bench、FrontierSWE 和 ProgramBench 等基准测试中,HoH 表现出显著的性能提升,平均比独立 harness 提高了 52.25%。在…
-
AI通过执行门控自蒸馏学习游戏生成
研究人员开发了一种新颖的自蒸馏技术,用于训练AI模型根据自然语言描述生成功能性的游戏项目。这种被称为“执行门控自蒸馏”的方法使用严格的启动检查作为过滤器,确保生成的项目能够无错误地运行。当在GameCraft-Bench数据集上使用Qwen3-14B模型应用此方法时,它显著提高了跨未见过游戏家族生成完整Godot项目的能力,每个候选项目的成功率从8.8%提高到42.2%。
-
AI 游戏生成基准揭示顶级模型在创建可玩游戏方面仍遇挑战
来自香港中文大学(深圳)、深圳技术大学和腾讯的研究人员推出了 GameCraft-Bench,这是一个旨在评估 AI 生成完整可玩游戏能力的新基准。与以往侧重于静态代码或简单网页游戏的基准不同,GameCraft-Bench 利用 Godot 4 引擎来评估端到端的游戏开发,包括脚本编写、场景配置和资源集成。该基准包含一个多模态模型来评估生成游戏的动态交互和视觉反馈,结果显示即使是顶级 AI 模型在生成复杂交互系统方面也面临困难,平均…