研究人员开发了一个名为 URBANCONTRASTIVEQA 的新基准,用于评估工具增强型大语言模型理解相对城市活动的能力。该基准展示了来自纽约市、芝加哥和西雅图公共出行数据中的城市情景对,要求模型判断哪个情景相对于其本地历史基线更不寻常,而不仅仅是选择较大的原始计数。结果表明,当仅提供原始计数时,模型通常难以完成这项比较任务,但当提供基线分数和序数标签时,准确性会提高,尽管增益因模型而异。 AI
影响 该基准有望促使大语言模型在分析现实世界数据方面具备更细致的能力,从而改进决策支持工具。
排序理由 该集群包含一篇详细介绍大语言模型新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →