MedHallu
PulseAugur coverage of MedHallu — every cluster mentioning MedHallu across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的ALTAS方法提高了LLM在临床问答中的可靠性
研究人员开发了ALTAS,一种用于提高大型语言模型(LLM)在临床问答中可靠性的新方法。ALTAS利用一个轨迹门控路由器,通过分析单次前向传播的终端熵和晚期线性度来决定是否对模型的输出进行校正。该方法在真实性基准测试上显著提高了准确性,将各种模型尺寸的TruthfulQA提高了10个百分点以上,同时在临床选择题数据集上的表现误差范围很小。
-
新的 MedSNIP 基准通过片段级分析改进医学事实核查
研究人员开发了 MedSNIP,这是一个用于生成医学事实核查片段的新流程,以及 MedSNIP-Bench,一个用于评估此过程的基准数据集。该方法旨在通过在可能被原子级分解破坏的子句组内保留局部临床上下文来提高医学事实核查的准确性。片段级核查方法已被证明可以维持或提高 F1 分数,尤其是在处理较长答案和使用鲁棒核查器时,同时还减少了核查器的调用次数。
-
新研究揭示了光谱诊断在理解LLM幻觉方面的局限性
研究人员开发了一个新的诊断框架,通过分析大型语言模型(LLM)的自注意力机制来理解其产生幻觉的原因。该方法侧重于注意力的“传输”特性,可以区分算子及其转置,这是先前光谱诊断的局限性。这种新方法使用不对称系数来量化方向信息流,并在多达80亿参数的模型中显示出可解释的信号,其预测已在幻觉基准测试中得到验证。
-
CareGuardAI框架提升了患者端医疗保健LLM的安全性和准确性
研究人员开发了CareGuardAI,一个旨在减轻用于患者端医疗保健应用的大型语言模型(LLM)的临床风险和幻觉的新安全框架。该系统借鉴了ISO 14971,纳入了临床安全和事实可靠性的风险评估模块。CareGuardAI采用多阶段管道,包含一个控制器智能体和双重风险评估,以确保响应在发布给患者之前达到安全阈值。