PulseAugur
实时 08:43:52
English(EN) SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

新的基准数据集揭示AI在工程问题上面临挑战

研究人员推出SoM-1K,一个旨在评估基础模型在材料力学复杂工程问题上能力的多模态基准数据集。该数据集包含1065个问题,每个问题都有文本描述和示意图。采用了一种新颖的提示策略——图像描述(DoI),该策略使用专家生成的图表文本描述,来测试八个领先的大型语言和视觉语言模型。结果表明,当前模型在这些任务上表现出显著的困难,最佳模型的准确率仅为56.6%,凸显了AI在科学和工程应用中对改进多模态推理的需求。 AI

影响 强调了在科学和工程领域为基础模型开发更强大的多模态推理能力的关键需求。

排序理由 该集群描述了一篇介绍基准数据集和现有模型评估的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准数据集揭示AI在工程问题上面临挑战

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng ·

    SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

    arXiv:2509.21079v2 Announce Type: replace Abstract: Foundation models have shown remarkable capabilities in various domains, but their performance on complex, multimodal engineering problems remains largely unexplored. We introduce SoM-1K, the first large-scale multimodal benchma…