研究人员开发了VEHBench,一个旨在评估大型语言模型(LLM)在设计振动能量收集器(VEH)过程中表现的新诊断基准。该基准通过关注LLM在设计过程不同阶段的表现,而非仅仅最终产物,来解决现有工程基准的局限性。VEHBench包含763项基于文献的任务,并由物理预言机进行评分,评估LLM在规格分类和损坏状态恢复等角色中的能力。初步实验表明,LLM的能力高度依赖于具体的设计阶段,没有单一模型能在所有任务中都表现出色。 AI
影响 为在工程设计工作流中评估和改进LLM提供了面向阶段的评估基础。
排序理由 该条目描述了一个用于评估LLM在特定工程领域表现的新研究基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →