研究人员推出了AeroCopilotBench,这是一个新颖的两级基准测试,旨在评估航空场景中的大型语言模型(LLM)智能体。该基准测试包括一个名为AeroCopilot Operational Environment(ACOE)的虚拟驾驶舱环境,以及一套1200道选择题用于知识评估。第二级侧重于程序执行和安全合规性,包含73项源自飞行员操作手册的紧急和异常任务。对12个模型的初步测试显示,虽然知识可以评估,但程序执行仍然是一个重大挑战,最高成功率仅为72.6%。对失败的分析突显了程序完整性、状态反馈利用和长期执行管理方面的问题。 AI
影响 该基准测试可以加速LLM智能体在航空和其他复杂领域关键操作角色中的开发和安全验证。
排序理由 该项目描述了一个特定领域(航空)中LLM智能体的新学术基准测试和评估环境。[lever_c_demoted from research: ic=1 ai=1.0]
- AeroCopilotBench
- AeroCopilot Operational Environment
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Model agents
- Pilot's Operating Handbooks
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →