一篇新的研究论文评估了视觉语言模型(VLM)从谷歌街景图像预测建筑类型的能力。该研究将GPT-4o、Claude 3.5 Sonnet和Gemini 2.0 Flash等模型与人类专家的表现进行比较,发现VLM的准确率约为70%。虽然VLM侧重于视觉线索,但人类专家会纳入更广泛的背景知识,这表明VLM可以作为城市分析的可扩展工具。 AI
影响 VLM可以在城市分析任务中近似专家能力,为模式识别和对象识别提供可扩展的自动化。
排序理由 该集群包含一篇详细介绍人工智能模型能力研究结果的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →