研究人员开发了一种新的细粒度食物图像理解方法,以应对网络收集数据的异构性挑战。他们的方法包括目标感知数据选择,以识别视觉上相关的子集,以及视觉语言模型(VLM)驱动的字幕细化,以创建更准确、视觉上更具依据的描述。然后,使用精心策划的数据来训练检索专家,并采用分层融合策略,仅在必要时有效利用VLM。实验表明,与朴素的网络监督相比,检索性能有了显著提高,仅字幕细化就使性能提高了约19%。 AI
影响 提高了特定领域(如食物识别)的视觉语义理解的准确性和效率。
排序理由 详细介绍计算机视觉新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →