研究人员开发了一种新方法来评估临床对话式AI系统在患者打断时的安全性。当前的基准通常假设合作式对话,未能考虑到可能导致临床必需信息丢失的现实世界中的打断。该研究改编了对话分析类别,以评估不同LLM配置和对话类型中的打断恢复情况,发现所有测试模型在处理打断时都遇到了困难,尤其是在信息提供场景中。简单的道歉标记在不同模型中的有效性不一致,凸显了需要针对特定打断情况进行内容相关的评估。 AI
影响 突出了当前临床环境AI安全评估中的一个关键差距,可能影响未来医疗领域对话式AI的开发和部署。
排序理由 学术论文,详细介绍了一种新的AI系统评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →