一系列研究论文探讨了大型语言模型(LLM)在心理健康应用中的能力和局限性。一项研究评估了Google Gemini 2.0 Flash和OpenAI ChatGPT-4o在医疗诊断方面的表现,发现其一致性完美,但容易受到无关输入的影响,并且上下文感知能力有所不同。另一篇论文介绍了CARE-MH,这是一个用于标准化和提高心理健康LLM评估可复现性的框架。此外,研究还探讨了用于增强数字心理健康干预中LLM安全性的检索增强生成(RAG),表明RAG以增加误报为代价提高了准确性和一致性。最后,一项研究评估了LLM在为德语心理健康邮件生成主题行方面的表现,强调了专有模型和开源模型之间的性能差异以及德语微调的好处。 AI
影响 这些研究强调,随着LLM越来越多地集成到心理健康等敏感应用中,需要建立健全的评估框架和安全措施。
排序理由 该集群包含多篇讨论LLM在心理健康领域应用和评估的学术论文。
- arXiv
- German
- Hugging Face
- Philipp Steigerwald
- CARE-MH
- Google Gemini 2.0 Flash
- Krishna Subedi
- LLMs
- mental health LLMs
- OpenAI ChatGPT-4o
- Retrieval Augmented Generation
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →