研究人员开发了一个新的框架,用于评估医疗健康领域的大语言模型(LLMs),重点关注它们在干预和因果关系方面的推理能力,而不仅仅是单答案准确性。该框架利用领域因果知识图谱来为LLM的响应提供基础,并在心血管疾病试点研究中测试了四种受控条件。结果表明,集成基础(C4)显著提高了因果推理能力并减少了未经支持的说法,尽管无基础模型(C1)仍然实现了更高的原始干预准确性。 AI
影响 该框架有可能通过强调因果推理和基础,促使医疗健康领域的大语言模型更加可靠和值得信赖。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一个用于评估特定领域(医疗健康)大语言模型的新框架和指标。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- arXiv
- healthcare
- Hugging Face
- Large Language Models
- adverse-effect F1
- alphaXiv
- arXivLabs
- causal edge F1
- evidence accuracy
- intervention accuracy
- unsupported claim rate
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →