Auroc
PulseAugur coverage of Auroc — every cluster mentioning Auroc across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的CoPoE框架解决了阿尔茨海默病诊断中的缺失数据问题
研究人员开发了CoPoE,一种新颖的多模态阿尔茨海默病诊断框架,可有效处理缺失数据。CoPoE将各种临床证据映射到一个结构化的潜在空间,该空间代表遗传风险、分子病理学、神经退行性和临床分期。通过使用仅包含可用模态的专家乘积架构,CoPoE避免了合成缺失输入,并为任何数据子集保持了稳健的后验。在ADNI数据集上的实验表明,CoPoE在全模态和子集评估中均表现出色,优于现有的融合方法,并改善了概率校准指标。
-
AI模型揭示癫痫患者内部动态的差异,尽管预测准确性相似
研究人员开发了一种分析AI模型学习到的内部动态的方法,即使它们的预测准确性相似。一个在Temple University EEG语料库的EEG数据上训练的CNN-Transformer模型被用来将表示映射到一个共享的潜在状态空间。通过为患有和不患有癫痫的受试者拟合个性化的转移依赖图,研究发现,尽管预测拟合相当,癫痫患者表现出显著更密集的学习依赖结构。这一区别强调了在个性化临床AI模型中,在评估预测性能的同时评估学习结构的重要性。
-
新研究审查LLM升级信号,警惕基准测试陷阱
一篇新论文探讨了确定何时将查询从小型语言模型升级到大型语言模型的方法,重点关注语义熵作为潜在信号。研究发现,虽然语义熵可以有效地区分错误并在GSM8K等基准测试中提高准确性,但简单的难度估计有时也能产生类似的结果,这凸显了仔细评估此类信号的必要性。该论文还详细介绍了基准测试设计和成本分析中可能存在的偏颇结果的陷阱,并提供了一个防止误导性结论的清单。
-
审计质疑AI分类中运动特定关节选择的益处
一项对骨骼关键点分类中运动特定关节选择的新审计显示,虽然它可以提高准确性,但收益通常很小,并且在很大程度上取决于评估方法。该研究分析了来自十名受试者的1057次重复动作,发现手动子集k近邻(kNN)的益处因性能聚合和控制方式的不同而存在显著差异。研究强调了在声称关节选择益处时,需要明确的估计量和适当的控制,并警告称此次审计并未确立新的算法或临床优势。
-
AI模型从流式细胞术数据预测AML突变
研究人员开发了一种可解释的多实例学习模型,可以从急性髓系白血病(AML)的常规流式细胞术数据中预测关键的分子改变。这种方法将患者样本建模为单个细胞的集合,在预测NPM1和FLT3-ITD突变方面取得了高精度。该模型的预测在一个独立的队列中得到了验证,并证明了其识别既定免疫表型特征的能力,为传统的分子检测提供了一种更快、更具成本效益的替代方案。
-
Qwen2.5 和 Llama 3.2 等小型语言模型表现出对用户反驳的显著屈服
一篇新的研究论文调查了小型语言模型(特别是 Qwen2.5-1.5B 和 Llama-3.2-1B)在受到用户挑战时放弃正确答案的倾向。研究发现,这些模型经常切换到不正确的响应,不同反驳风格的有效性在两个模型家族之间存在显著差异。此外,研究表明,尝试线性解码或引导这些模型...
-
新研究质疑VLM置信度校准,提出新的评估指标
一篇新发表在arXiv上的研究论文《校准置信度的幻象》(The Mirage of Calibrated Confidence)揭示,视觉语言模型(VLM)通常会报告其答案的高置信度,而这与其遵循的推理过程无关。研究发现,口头置信度在很大程度上独立于模型的内部轨迹,这意味着它不能准确反映其步骤的正确性。为解决此问题,研究人员提出了一种名为轨迹基础评分(Trajectory-Grounding Score, TGS)的新评估指标,以及一…
-
知识增强型电子健康记录特征提供高效的医院再入院预测
研究人员开发了一种新方法,利用结构化电子健康记录(EHR)数据并结合医学知识源来预测30天内的医院再入院。该方法避免了对临床记录的需求,因为临床记录计算成本高且可解释性差。通过整合疾病本体论、手术分类、药物成分和实验室数据,该系统创建了稀疏且易于理解的患者表示。在MIMIC-IV数据集上评估,最佳配置达到了0.743的AUROC,与使用临床记录的方法相当,但计算成本显著降低。
-
新的XConf方法利用过往经验估计LLM的信心
研究人员推出了一种名为XConf的新方法,通过整合模型过往的经验来估计语言模型输出的信心。与仅考虑当前推理过程的现有方法不同,XConf利用过往任务、反思、声明的信心和结果的记录来指导其估计。这种方法在各种基准测试中表现出色,在辨别能力上优于十样本自洽性,显著降低了校准误差,同时成本效益更高。
-
新的OAS-MIL框架通过MRI扫描预测癌症风险 · 已追踪2个来源
研究人员开发了一个名为Order-Aware Slab Multiple Instance Learning (OAS-MIL) 的弱监督框架,用于使用术前MRI预测肝内胆管癌 (ICC) 的神经侵袭 (PNI) 风险。该方法将MRI数据表示为2.5D切片的有序序列,无需切片或体素级注释即可进行患者级别的PNI预测。在五折交叉验证中,OAS-MIL达到了0.770的平均AUROC,优于现有的体积和MIL基线,表明轴向顺序对于此类预测是…
-
新的VFR-Audit框架增强了AI公平性审计的可靠性
研究人员推出了一种名为VFR-Audit的新框架,旨在评估临床AI应用中公平性审计的可靠性,特别是在预测医院停留时间方面。该框架侧重于判决翻转率(VFR),它量化了在重采样下公平性判决改变的概率。VFR-Audit还报告了队列重采样稳定性、审计规模敏感性和跨医院判决一致性(使用Fleiss' kappa),弥补了现有方法仅考虑指标级不确定性的不足。
-
床垫下传感器预测失智症患者激越风险
研究人员开发了一种使用床垫下传感器来预测失智症患者次日激越风险的方法。研究发现,与传统的夜间汇总数据相比,对夜间生理信号(如活动、心率和呼吸频率)进行分钟级时序建模可以提高风险预测能力。尽管该系统显示出适度的预测能力,但在临床护理中使用之前,还需要进一步的校准和外部验证。
-
新的分割模型有望用于追踪眼部疾病病灶
研究人员开发并评估了四个病灶分割流程,包括AMD和DME的2D和3D变体,在同域验证集上实现了0.76至0.82的Dice分数。这些流程显示出强大的体积和表面校准能力,相关性达到0.97或更高。该研究还引入了一个全体积、校准感知的采用标准,以识别切片级别评估所遗漏的机制,发现集成组合持续提高了性能。在外部临床队列(OLIVES)上使用生物标志物AUROC和纵向一致性等代理指标进行测试时,模型在追踪训练分布之外的临床生物标志物方面显示出…
-
新研究利用因果模型和改进的评估方法解决视频异常检测问题
研究人员正在探索视频异常检测的新方法,重点是提高效率和准确性。一篇论文介绍了一种严格因果流异常检测器,该检测器使用类似Mamba的状态空间模型,每帧更新时间恒定,在边缘硬件上实现了高吞吐量,但准确性低于非因果基线。另一项研究批判性地审查了弱监督视频异常检测的评估指标,发现常用的帧级指标通常反映视频级排名,而不是精确的时间定位。第三篇论文研究了视觉语言模型(VLM)在无训练异常检测中的应用,并强调了如何将VLM输出转换为异常分数会显著影…
-
LeakGauge 检测器以 0.996 AUROC 标记 AI 上下文泄露攻击
一篇新的 arXiv 预印本介绍了一种名为 LeakGauge 的新检测器,旨在识别大型语言模型泄露机密上下文的实例。该工具已显示出高效性,在涉及十一种不同模型的测试中取得了 0.996 的 AUROC 分数。
-
FedCoRe框架解决了医疗联邦学习中缺失数据的问题
研究人员开发了FedCoRe,一个用于医疗联邦学习的新框架,解决了缺失数据模态的挑战。FedCoRe通过比较使用可用数据和不使用可用数据所做的预测来学习纠正缺失信息,例如心电图或胸部X光片。该方法旨在恢复因模态缺失而损失的性能,在模拟医疗场景中显示出显著的准确性恢复。
-
视觉Transformer高精度地从心电图中检测心脏病
研究人员开发了一种视觉Transformer模型,能够从标准心电图(ECG)中检测左心室射血分数(LVEF)降低。该模型在多个临床中心的10,000多名患者身上进行了训练,在外部验证队列中达到了0.88的AUROC。该模型的注意力图突出了对QRS波群的关注,提供了可解释性,并表明常规心电图可以作为识别需要进一步超声心动图检查的患者的可扩展筛查工具。
-
AI系统增强乳腺MRI数据集的质量保证
研究人员开发了一个无监督异常检测系统,以确保用于医疗AI的多中心乳腺MRI数据集的质量。该系统解决了高风险医疗AI应用中对鲁棒数据集质量保证的关键需求。所提出的方法在17种异常类型的基准上进行了评估,在检测不同类型的数据损坏和分布外样本方面表现出不同程度的成功。
-
新的EGRL框架改进了RNA-蛋白质相互作用预测
研究人员开发了一个名为EGRL的新框架,用于预测RNA-蛋白质相互作用(RPI),这对细胞功能至关重要。这种深度学习方法利用图神经网络比以往的方法更有效地模拟RPI网络。EGRL通过结合隐式元路径学习、多关系感知注意力机制和一个预测未知分子潜在边的图生成器,解决了数据稀疏性和冷启动场景。在基准数据集上的评估表明,EGRL在冷启动设置中实现了具有竞争力的性能并显著提高了泛化能力,在AUROC和AUPR方面优于先前最先进的方法。
-
新框架SymboUQ提升LLM空间推理的可靠性
研究人员推出SymboUQ,一个旨在提高大型语言模型(LLM)空间推理可靠性的新框架。该系统通过评估声明是否可以被符号化和确定性地解决来量化不确定性,而不是仅仅依赖于token级别的置信度。SymboUQ集成了布局审计器(Layout Auditor)、确定性剖析器(Determinacy Profile)和可靠性组合器(Reliability Composer),在五个空间推理基准测试中,AUROC相对提高了约8%,Brier损失降低了7%。