研究人员开发了一种新颖的方法,以提高多模态大语言模型(MLLMs)在基于图像的膳食评估中的份量估计准确性。所提出的技术包括向冻结的DINOv2骨干网络添加一个增强几何的小型网络,该网络处理MLLM的食物名称、边界框和密度范围输出。与单独使用MLLM相比,该方法将每种食物的份量误差显著降低了33-41%,在无需MLLM微调的情况下,在此任务上优于Gemini、GPT和Claude等当前旗舰模型。 AI
影响 增强了MLLM在特定领域的性能,可能提高AI辅助膳食跟踪和分析的准确性。
排序理由 该集群包含一篇详细介绍改进AI模型能力新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Claude
- DINOv2
- Gemini
- generative pre-trained transformer
- Hugging Face
- structured softmax-ownership volume
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →