一位医疗 IT 专业人员测试了四个大型语言模型(Claude Opus 4.8、Claude Haiku 4.5、Kimi K3 和 qwen3.5-35b)在回答有关 HL7、DICOM 和 FHIR 等医疗保健互操作性标准的问题方面的能力。测试显示,没有一个模型回避回答,并且很大一部分回答是自信错误的。特别是,版本敏感的问题和错误的假设被证明是具有挑战性的,模型会编造答案而不是承认无知。 AI
影响 凸显了 LLM 在医疗 IT 等关键领域自信地捏造信息的风险,可能导致生产系统出现危险错误。
排序理由 评估 LLM 在特定领域知识方面表现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →