研究人员开发了ECGQuest,这是一个旨在评估和微调专门用于心电图(ECG)解释的语言模型的新基准测试。该数据集包含从医学参考资料和会议记录中生成的21,000多个真/假问题。评估显示,GPT-5在零样本设置下表现最佳,优于通用和医学专业模型。微调较小的开源模型可显著提高其准确性,其中一个五模型集成实现了最高性能。 AI
影响 为LLM在专业医学领域建立了新的评估标准,可能推动更准确的诊断工具的开发。
排序理由 该集群描述了一篇介绍基准数据集和语言模型评估的新学术论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →