一项名为BioEVAL的新基准测试已被开发出来,用于评估大型语言和多模态模型在生物工程领域的实验推理能力。该项目涉及22个研究小组,创建了一个博士级别的基准测试,包含608个条目,涵盖11个子领域,包括选择题、文献综合任务和多模态问题。ChatGPT、Gemini和Grok等云规模模型在选择题上的准确率高达90%,但在不同生物工程领域的表现差异很大。 AI
影响 该基准测试可以指导未来LLM在专业科学应用中的开发,并揭示复杂推理任务中的性能差距。
排序理由 该集群描述了一个用于评估特定科学领域LLM和多模态模型的新学术基准测试。
- arXiv
- bioengineering
- ChatGPT
- Gemini
- Grok
- Hugging Face
- large language models
- multimodal models
- Vinny Chandran Suja
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →