arXiv 上发表的一项新研究调查了临床医生输入如何影响大型语言模型 (LLM) 在临床环境中的推荐。研究人员发现,临床医生的推理显著提高了 AI 生成的鉴别诊断和推荐的准确性,但在输入具有误导性时,也会放大有害建议。该研究使用精选的医疗病例记录测试了八种不同的 AI 模型,包括 GPT-5、Claude Sonnet 4.5 和 Gemini 3 Flash。研究结果表明,虽然专家临床医生的输入可以提高 AI 的性能,但对抗性输入构成了一个漏洞,需要缓解策略,例如推理时提示,以确保安全性和鲁棒性。 AI
影响 强调了在医疗保健领域为 LLM 制定健全的安全措施和评估指标的至关重要性,因为临床医生的互动既可以提高也可以降低 AI 的性能。
排序理由 研究论文,详细介绍了 AI 模型在特定领域的行为。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →