PulseAugur
实时 11:47:39
实体 SafeBuild-Bench

SafeBuild-Bench

PulseAugur coverage of SafeBuild-Bench — every cluster mentioning SafeBuild-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_180891 ·

    新基准评估AI在建筑安全任务上的表现

    研究人员开发了SafeBuild-Bench,一个旨在评估多模态大语言模型(MLLMs)在建筑安全任务上的新基准。该基准源自超过10万条工业图像-文本记录,包含3,314个经专家验证的实例,涵盖了多项选择题式危害识别和自由形式危害描述。为了高效创建用于训练和评估的子集,他们还引入了GEMS,一个图增强的多模态选择管道。目前,MLLMs在该基准上的表现低于可靠的建筑安全理解水平,最高得分约为60%。