研究人员推出了GeoOutageBench,一个旨在评估大型语言模型(LLMs)在执行地理时空知识图谱问答(KGQA)以分析停电和基础设施韧性方面的能力的新基准。该基准独特地整合了来自各种来源的视觉、文本和结构化数据,包括停电记录、卫星图像和天气数据,以及领域本体。GeoOutageBench提供了一个具有不同难度级别的查询分类,以评估LLM对模糊时空问题的理解能力、本体的使用情况以及在多模态KGQA检索中的准确性,为评估LLM-KG系统在现实世界基础设施分析中的应用奠定了基础。 AI
影响 该基准有望推动更强大的LLM系统在关键基础设施分析和灾害响应方面的应用。
排序理由 该条目描述了一个用于评估LLM在特定研究领域(地理时空KGQA)的新基准,该基准发表在arXiv论文中。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →