PulseAugur
中
实时 10:37:33
实体 MineBench

MineBench

PulseAugur coverage of MineBench — every cluster mentioning MineBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
  1. 2026-08-29 product_launch MineBench released version 4.0, introducing a community gallery, iOS app availability, and private model checkpoint testing. 来源
最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_240499 ·

    GPT-6 Astra Pro 在 MineBench 上构建复杂迷宫

    AI 模型 GPT-6 Astra Pro 通过在 MineBench 平台上构建迷宫,展示了其能力。该迷宫包含一个有效的解决方案,模型的输出被描述为精良。通过视频和 GIF 展示了这一创作,突显了 AI 生成复杂结构的能力。

  2. SIGNIFICANT · CL_236800 ·

    GPT-6 Astra 在 MineBench 上展示了生成质量的巨大飞跃

    根据 X 上的分析,一款新的人工智能模型 GPT-6 Astra 在生成质量方面取得了显著飞跃,尤其是在对比例、均衡和品味的理解方面。其在 MineBench 基准测试中的表现突显了这一进步,并与 GPT-5.6 Sol Pro、Claude Fable 5.1、Claude Opus 5 和 GPT-5.5 Pro 等领先模型进行了比较。开发者认为,该模型代表了对现有 AI 能力的重大改进。

  3. RESEARCH · CL_232635 ·

    MineBench 上 Fable 5.1 的成本显著高于 Fable 5

    对 MineBench 基准测试中 Fable 5.1 和 Fable 5 的比较显示,Fable 5.1 的成本几乎是 Fable 5 的三倍,运行时间是其两倍,这主要是由于推理时间增加所致。尽管 API 定价相同,但 Fable 5.1 的成本更高,不过它仍然比 GPT 5.6 Sol Pro 便宜得多。该基准测试还突出了 Fable 5.1 生成可识别室内场景能力的提高,而这是以前所缺乏的功能。

  4. TOOL · CL_224623 ·

    MineBench 4.0 发布,新增社区画廊、iOS 应用和私有模型测试功能

    MineBench 是一个用于评估 AI 模型生成 3D 结构能力的基准测试工具,现已发布 4.0 版本。此次更新包括一个社区画廊,供用户展示和点赞自定义提示,并引入了私有模型检查点的 A/B 测试。此外,MineBench 现已在 iOS App Store 上架。在有限的时间内,登录用户可以与 Google Deepmind 合作的 Gemini 3.7 Flash 无限次生成。

  5. RESEARCH · CL_142148 ·

    GPT-5.6 Sol 在 MineBench 上表现出色但成本高昂

    最近在 MineBench 上进行的基准测试比较显示,GPT-5.6 Sol 能够生成高度详细且富有创意的构建,其质量和规模常常超越 GPT-5.5 Pro 等先前模型。然而,这种增强的输出付出了显著更高的成本,GPT-5.6 Sol 的成本是 GPT-5.5 Pro 的三倍多,但生成的构建数量相同。尽管该模型生成的细节令人印象深刻,但高昂的成本可能使其在许多用例中不切实际。

  6. COMMENTARY · CL_101425 ·

    GPT 4.5 在 MineBench 中意外输出“HELP”而非请求的内容

    一位 Reddit 用户报告称,在 MineBench 框架内,当被提示生成“摩天大楼”时,GPT 4.5 输出了“HELP”一词。在尝试了大约 30 次后,模型一致生成了摩天大楼,这种异常输出仅在该特定实例中发生。用户发现这种行为很有趣,并指出模型精确地遵循了 MineBench 规则和工具模式,但用“HELP”替换了请求的输出。