研究人员开发了一个包含33次临床认知评估对话的新语料库,共计8,250个话语,并标注了说话者角色和56种对话行为。该数据集旨在对大型语言模型(LLMs)在临床背景下的细粒度对话行为分类和下一患者话语生成进行基准测试。使用LLaMA-3.1-8B模型的实验表明,指令调优提高了性能,其中面向推理的微调产生了最佳的分类结果,尽管模型在区分密切相关的对话行为方面仍存在困难。 AI
影响 这项研究为开发能够理解和生成细微临床对话的更复杂的人工智能代理提供了框架。
排序理由 该集群包含一篇学术论文,详细介绍了用于LLM评估的新数据集和基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →