研究人员开发了一个新的基准和流程,用于评估开放权重大型语言模型(LLM)在提供地理上下文时进行推理的能力,而不是依赖其内部知识。该系统使用来自OpenStreetMap的街道网络数据和来自GHS-POP的人口数据,为LLM创建“空间简报”。然后,该简报用于测试模型对所提供信息的忠实度,即使引入了错误的假设。对Qwen、Gemma和Llama系列中的十六种不同的开放权重模型配置进行了不同大小和模式的测试,结果表明模型家族和代数显著影响了它们抵抗错误假设和阅读所提供上下文的能力,而与模型规模无关。 AI
影响 这项研究可能有助于开发更可靠的LLM,以应用于需要准确地理推理和上下文遵循的任务。
排序理由 该集群包含一篇研究论文,详细介绍了评估LLM的新基准和方法论。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →