研究人员推出了UTP-Bench,这是一个旨在评估大型语言模型在不确定条件下生成旅行行程的鲁棒性的新基准。与假设确定性环境的先前基准不同,UTP-Bench整合了来自印度504个城市的真实世界数据,包括经验性延迟分布和人群模式。它提出了三个新指标——缓冲充分性得分、人群感知计时得分和交通延迟吸收得分——来量化生成的计划在处理交通延迟和人群可变性方面的表现。使用GPT-5、Qwen3、Mistral和Phi-4等模型进行的实验显示,与人类制定的计划相比,在时间缓冲和延迟感知调度方面存在显著的性能差距。 AI
影响 该基准可以推动LLM在需要不确定性下鲁棒规划的现实世界应用中的能力改进。
排序理由 该集群描述了一篇介绍用于评估LLM的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Buffer Adequacy Score
- Crowd-Aware Timing Score
- GPT-5
- India
- large-language models
- Mistral AI
- Phi-4
- Qwen3
- Transport Delay Absorption Score
- TravelPlanner
- TRIPCRAFT
- UTP-Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →