研究人员推出了MultiGlobeQA,这是一个旨在评估大型语言模型在不同语言和地区地理空间推理能力的新基准测试。该基准测试包含超过46,000个英文及其他16种语言的问答对,覆盖201个国家和地区以及各种空间功能。初步评估显示,大型语言模型在几何和拓扑计算方面存在困难,尤其是在低收入地区,并且尽管检索和工具使用可以提高性能,但计算限制仍然是一个重大瓶颈。 AI
影响 强调了大型语言模型在复杂推理任务中的计算局限性,指出了未来模型开发和评估的领域。
排序理由 该集群描述了一个用于评估大型语言模型能力的新学术基准测试。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- English
- Gotit.pub
- Hugging Face
- large language models
- MultiGlobeQA
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →