研究人员开发了PetQA,这是一个旨在评估大型语言模型(LLMs)和大型视觉语言模型(LVLMs)的兽医知识和临床推理能力的新基准。该基准包含超过10,000个问答对,这些问答对源自关于狗和猫的真实查询,并由兽医专家提供答案。使用ROUGE和BERTScore等指标对十八个模型进行的初步评估显示,当前AI系统在兽医护理方面存在局限性,突显了改进适应方法的必要性。 AI
影响 该基准可以推动开发更可靠的AI系统,用于兽医诊断和护理。
排序理由 该集群描述了一篇介绍用于评估AI模型基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- BERTScore
- Cats
- dog
- LLMs
- LVLMs
- PetQA
- PetQA-Bench
- retrieval-augmented generation
- ROUGE
- supervised fine-tuning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →