PulseAugur
实时 09:44:15
English(EN) OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

OliveGemma模型在识别地中海饮食方面表现出色

研究人员开发了OliveGemma,一个新推出的、拥有30亿参数的视觉语言模型,专门用于识别地中海和欧洲美食。OliveGemma基于PaliGemma-2-3B架构构建,并使用LoRA在超过17,000张图片的的数据集上进行了微调,在菜肴识别方面达到了92.96%的top-1准确率。在这一专业任务上,其表现优于DenseNet-121等已有的CNN基线模型,并且显著优于Gemini Flash 3、Gemini 3.5、GPT 5.4 Mini和Claude Haiku 4.6等更大、更通用的模型。 AI

影响 展示了针对专业任务微调小型VLM的有效性,有望提高小众AI应用的效率和准确性。

排序理由 该条目描述了一篇介绍专业视觉语言模型的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

OliveGemma模型在识别地中海饮食方面表现出色

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis ·

    OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

    arXiv:2608.03428v1 Announce Type: cross Abstract: Image based dietary assessment offers a scalable alternative to self reported food diaries, yet fine-grained food recognition remains challenging due to high intra-class variability and visually similar dishes. This study presents…