PulseAugur
实时 11:06:40
English(EN) StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw 工作台和基准提高了结构工程领域大语言模型代理的评估效果

研究人员推出了 StructureClaw,这是一个专为结构工程工作流中的大语言模型代理设计的新型工作台。该系统强调以产出为中心的评估,确保从解释的需求到最终报告的所有工程请求的相互依赖的组件都得到验证。与工作台一起,还开发了一个名为 StructureClaw-Bench 的基准,其中包含 150 个受控场景,用于测试标准工作流执行、交互鲁棒性和多模态重建。初步评估显示,与通用基线相比,使用 StructureClaw 时的成功率有了显著提高,这凸显了其在专业领域进行更严格代理评估的潜力。 AI

影响 增强了在专业工程工作流中对大语言模型代理的严格评估,有可能提高可靠性和安全性。

排序理由 该集群描述了一篇介绍用于特定领域大语言模型代理的新型工作台和基准的研究论文。

在 arXiv cs.MA (Multiagent) 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

StructureClaw 工作台和基准提高了结构工程领域大语言模型代理的评估效果

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu ·

    StructureClaw:可追溯的大语言模型Agent及结构工程工作流的可执行基准

    arXiv:2607.14896v1 Announce Type: cross Abstract: Addressing a structural-engineering request requires more than a single answer; it requires a chain of interdependent artifacts: interpreted requirements, a computable model, validation records, solver outputs, code-check records,…

  2. arXiv cs.MA (Multiagent) TIER_1 English(EN) · Xinzheng Lu ·

    StructureClaw:可追溯的大语言模型Agent及结构工程工作流的可执行基准

    Addressing a structural-engineering request requires more than a single answer; it requires a chain of interdependent artifacts: interpreted requirements, a computable model, validation records, solver outputs, code-check records, and a final report. Evaluations centered on quest…