PulseAugur
中
实时 08:53:00
实体 WorldBench

WorldBench

PulseAugur coverage of WorldBench — every cluster mentioning WorldBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_289311 ·

    新的 WorldBench 基准测试评估 LLM 在 3D 世界生成方面的能力

    研究人员推出 WorldBench,一个旨在评估大型语言模型使用 Three.js 生成交互式 3D 世界能力的新基准测试。目前依赖视觉快照或源代码分析的评估方法被发现不可靠,并且经常在生成内容上产生分歧。WorldBench 采用了一个更强大的评估器,它结合了对运行中世界的视觉探索和源代码分析,并交叉引用发现以确保准确性。这个新基准测试被用来评估五个前沿模型,包括 Claude Fable 5.1、GPT-6 Astra、Kimi …

  2. RESEARCH · CL_221112 ·

    新的基准测试揭示了大型语言模型智能体在多语言任务和协作中的局限性

    新研究探讨了大型语言模型(LLM)智能体在复杂、多语言和协作环境中的能力。WorldBench 是一个新基准,在七种语言和八种文化中测试了 LLM 智能体执行的 1,600 项任务,揭示了其在状态保持和环境正确性方面存在显著局限性,前沿模型仅达到 49.2% 的约束任务成功率。另一项研究引入了 LLAMIA-Bench,用于评估 LLM 与非语言智能体的协作,证明通过学习的状态标记(潜在状态内化)直接整合连续表示优于传统的言语化方法,…

  3. TOOL · CL_208692 ·

    新的WorldBench基准测试将物理概念隔离,用于AI世界模型评估

    研究人员推出了WorldBench,这是一个旨在评估AI所用世界模型物理理解能力的新基准测试。与先前同时测试多个物理概念的基准测试不同,WorldBench隔离了单个概念,以更精确地评估模型的性能。该基准测试包括对直观物理理解(如物体恒存性)和低级物理常数(如摩擦力)的评估。初步测试显示,当前最先进的世界模型在特定物理概念方面存在困难,并且缺乏可靠的现实世界交互所需的稳定性。