研究人员推出UrbanAgent,一个新颖的框架,旨在通过将大型语言模型与一套用于代码执行和API调用的工具集成起来,来处理复杂的城市任务。该系统旨在弥合碎片化的数字城市服务与居民需求之间的差距,从而实现更无缝的跨系统工作流程。在实验中,UrbanAgent展示了71%的任务成功率,在包括GPT-5 mini、Gemini 2.5-Flash、DeepSeek-V4 Flash和Qwen3-235B-A22B在内的各种领先LLM上,比现有基线高出10个百分点。为了便于评估,还开发了一个名为Urban-Eval的新基准,该基准评估任务结果和执行质量,包括工具覆盖率和证据可追溯性。 AI
影响 该框架可以改善城市数字服务的集成和可用性,可能带来更高效的城市运营和更好的居民体验。
排序理由 该集群包含一篇详细介绍城市任务新Agent框架和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- DeepSeek-V4 Flash
- Gemini 2.5-Flash
- GPT-5 mini
- Model Context Protocol
- Qwen3-235B-A22B
- UrbanAgent
- Urban-Eval
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →