研究人员开发了一个新的基准来衡量大型语言模型在推理临床时间数据时的事后诸葛亮偏见。该基准包含来自PubMed Central的171份病例报告,评估了模型在暴露于未来结果与在不确定性下推理时判断受到的影响。初步测试表明,像GPT 5.6 Sol和Gemma 4这样的模型在给出完整时间线时表现出事后诸葛亮偏见,但时间掩码在不牺牲准确性的情况下减少了这种偏见。 AI
影响 这项研究突显了LLM在临床应用评估中的一个关键缺陷,可能影响可靠的AI诊断工具的开发。
排序理由 该集群包含一篇学术论文,提出了一个新的LLM基准和评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Gemma 4
- GLM-5.2
- GLP-1
- GPT 5.6 "Sol"
- Hindsight Bias in Clinical Temporal Reasoning: How Future Data Exposure Affects Large Language Model Judgment
- Hugging Face
- PubMed Central Open Access Subset
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →