实体
HuatuoGPT-o1
HuatuoGPT-o1
PulseAugur coverage of HuatuoGPT-o1 — every cluster mentioning HuatuoGPT-o1 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架揭示大语言模型临床推理缺陷,尽管诊断准确性尚可
两篇新研究论文介绍了评估大语言模型(LLMs)临床推理能力的框架。第一篇,CLExEval,采用一种人工干预的循环方法,通过渐进式信息屏蔽来揭示诸如冗余偏见和推理到输出不匹配等失败模式,涉及GPT-4o-mini等模型。第二篇,临床推理图谱(Clinical Reasoning Graphs),采用结构化图表示来分析大语言模型的诊断轨迹,揭示模型虽然表现出诊断能力,但在相似病例中缺乏一致的推理。两项研究都强调,除了简单的准确性指标外,…
-
新的基准揭示了 LLM 在动态临床决策中的局限性
研究人员开发了新的基准来评估大型语言模型 (LLM) 在动态临床决策场景中的能力。MedSP1000 源自标准化患者案例,评估 LLM 随时间管理患者护理的能力,显示即使是 GPT-5.5 等顶级模型也只能满足专家标准的约 60%。同样,多模态 LLM BreastGPT 在 BreastStage-Bench 上针对乳腺癌护理进行了评估,显示出潜力但突出了对与工作流程一致的数据的需求。ClinicalMC 为多疗程临床决策提供了另一…