MineBench
PulseAugur coverage of MineBench — every cluster mentioning MineBench across labs, papers, and developer communities, ranked by signal.
- 2026-08-29 product_launch MineBench released version 4.0, introducing a community gallery, iOS app availability, and private model checkpoint testing. 来源
-
GPT-6 Astra Pro 在 MineBench 上构建复杂迷宫
AI 模型 GPT-6 Astra Pro 通过在 MineBench 平台上构建迷宫,展示了其能力。该迷宫包含一个有效的解决方案,模型的输出被描述为精良。通过视频和 GIF 展示了这一创作,突显了 AI 生成复杂结构的能力。
-
GPT-6 Astra 在 MineBench 上展示了生成质量的巨大飞跃
根据 X 上的分析,一款新的人工智能模型 GPT-6 Astra 在生成质量方面取得了显著飞跃,尤其是在对比例、均衡和品味的理解方面。其在 MineBench 基准测试中的表现突显了这一进步,并与 GPT-5.6 Sol Pro、Claude Fable 5.1、Claude Opus 5 和 GPT-5.5 Pro 等领先模型进行了比较。开发者认为,该模型代表了对现有 AI 能力的重大改进。
-
MineBench 上 Fable 5.1 的成本显著高于 Fable 5
对 MineBench 基准测试中 Fable 5.1 和 Fable 5 的比较显示,Fable 5.1 的成本几乎是 Fable 5 的三倍,运行时间是其两倍,这主要是由于推理时间增加所致。尽管 API 定价相同,但 Fable 5.1 的成本更高,不过它仍然比 GPT 5.6 Sol Pro 便宜得多。该基准测试还突出了 Fable 5.1 生成可识别室内场景能力的提高,而这是以前所缺乏的功能。
-
MineBench 4.0 发布,新增社区画廊、iOS 应用和私有模型测试功能
MineBench 是一个用于评估 AI 模型生成 3D 结构能力的基准测试工具,现已发布 4.0 版本。此次更新包括一个社区画廊,供用户展示和点赞自定义提示,并引入了私有模型检查点的 A/B 测试。此外,MineBench 现已在 iOS App Store 上架。在有限的时间内,登录用户可以与 Google Deepmind 合作的 Gemini 3.7 Flash 无限次生成。
-
GPT-5.6 Sol 在 MineBench 上表现出色但成本高昂
最近在 MineBench 上进行的基准测试比较显示,GPT-5.6 Sol 能够生成高度详细且富有创意的构建,其质量和规模常常超越 GPT-5.5 Pro 等先前模型。然而,这种增强的输出付出了显著更高的成本,GPT-5.6 Sol 的成本是 GPT-5.5 Pro 的三倍多,但生成的构建数量相同。尽管该模型生成的细节令人印象深刻,但高昂的成本可能使其在许多用例中不切实际。
-
GPT 4.5 在 MineBench 中意外输出“HELP”而非请求的内容
一位 Reddit 用户报告称,在 MineBench 框架内,当被提示生成“摩天大楼”时,GPT 4.5 输出了“HELP”一词。在尝试了大约 30 次后,模型一致生成了摩天大楼,这种异常输出仅在该特定实例中发生。用户发现这种行为很有趣,并指出模型精确地遵循了 MineBench 规则和工具模式,但用“HELP”替换了请求的输出。