ROC-AUC
PulseAugur coverage of ROC-AUC — every cluster mentioning ROC-AUC across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
混合 Gossip-FedAvg 在去中心化组织病理学图像分类中显示出潜力
研究人员比较了三种用于组织病理学图像分类的分布式学习方法:基于服务器的联邦平均法 (FedAvg)、去中心化 Gossip 学习以及结合两者的混合方法。研究使用了超过 277,000 个浸润性导管癌分类图像斑块的数据集,发现混合 Gossip-FedAvg 取得了具有竞争力的 ROC-AUC 0.8811,紧随其后的是 FedAvg。在多次患者级别重复实验中,FedAvg 和混合 Gossip-FedAvg 在平均 ROC-AUC 方…
-
AI框架和基准推动纳米医学发现
研究人员推出了NSA-Bench,这是首个旨在标准化纳米医学发现中纳米自组装预测评估的公开基准。他们还开发了NSA-Net,这是一个多模态框架,集成了图拓扑、序列语义和理化描述符来预测分子对自组装。实验表明,NSA-Net的ROC-AUC约为0.947,优于现有的机器学习和基于图的基线。该框架的预测也有助于优化制剂开发的实验条件。
-
新研究模拟多方对话中的轮次转换动态
两篇新研究论文探讨了多方对话的动态,重点关注如何模拟和预测轮次转换和对话线索。第一篇论文介绍了一种多任务学习方法,该方法使用“轮次转换熵”通过分析说话者转换来改进意图识别。第二篇论文研究了注视和语音动态以及人际亲近度如何发出对话主导权变化的信号,通过结合注视和响度特征实现了 0.76 的 ROC AUC。
-
新型DTD-VAE模型通过解耦时序数据增强信用风险预测能力
研究人员开发了一种名为DTD-VAE的新型变分自编码器模型,旨在通过解耦客户数据中的时序依赖性来改进信用风险预测。该模型区分了与信用风险相关的模式和反映一般客户行为的模式。在六个真实世界数据集上的实验表明,DTD-VAE的性能优于现有方法,准确率提高了9.71%。
-
研究发现机器学习咳嗽模型无法泛化用于结核病筛查
一项对使用咳嗽声学进行结核病筛查的机器学习模型进行的评估新研究发现,尽管在数据集内部表现良好,但这些模型无法泛化到新的数据集。研究表明,音频表示是根据录音设备和数据集组织的,而不是根据疾病状态,并且设备特定的变异性是泛化能力差的一个重要因素。一个临床变量基线模型显示出更一致的泛化能力,这凸显了在基于咳嗽的结核病模型被认为临床可用之前,进行外部验证的至关重要性。
-
新系统利用红外热点预测锂离子电池热失控
研究人员开发了一种新颖的两阶段早期预警系统,用于检测锂离子电池的热失控,尤其是在机械应力下。该系统利用红外热点动力学来估计局部热不稳定性,然后将其与其他传感器数据结合,提供长达20帧的预警范围。该方法展示了0.908的高ROC-AUC,优于直接多模态融合,并提供了14.8帧的平均提前量,从而允许电池管理系统更早地进行干预。
-
新方法纠正客户流失预测中的季节性误报
一篇新发表在arXiv上的研究论文解决了一个客户流失预测系统中的关键问题,即季节性波动可能导致误报。该研究提出了一种逐年校正方法,以区分真实的衰退和季节性模式。这种方法显著提高了预警系统的准确性,减少了误报,并优化了干预能力。
-
新的诊断工具评估大型语言模型评判器的有效性,无需外部验证
研究人员开发了一种新方法来评估在技能优化任务中使用的“大型语言模型”(LLM)评判器的有效性。该诊断方法被称为“无参考评判器”,它评估 LLM 的评分是否能在不依赖外部验证的情况下区分正确和错误的答案。这种方法将评判器形式化为一个潜在的求解器,通过其解决问题的能力来限制其评估能力,并提供区分度的必要条件(c > 1/k)。该诊断方法可以预测可能发生的评判错误类型,并为评判器部署前提供一种经济高效的检查。
-
新型AI代理在模拟中展现预测性异态稳态组织
研究人员开发了能够再现和尖峰代理的代理,它们能够在部分可观察性下表现出适应性行为,其灵感来自Barrett和Miller的分类理论。这些代理在能量受限的觅食任务中进行了测试,与基线方法相比,它们的表现有所提高。研究发现,代理的早期内部动态可以预测后来的成功,ROC-AUC最高达到0.802,并且预测信号分布在各种内部变量中。
-
AI模型通过分割预训练减少了脊柱退变分级的标签需求
研究人员开发了一种使用分割预训练对腰椎退变进行分级的新方法,该方法显著减少了专家标注的放射学分级需求。通过预训练3D ResNet编码器来分割椎骨和椎间盘等解剖结构,该系统仅用20%的手动分级标签即可达到接近全监督的性能。该方法在各种病理学中均表现出改进的性能,特别是对于不常见或空间特异性疾病,使用伪标签达到了0.94的Dice分数。
-
联邦生成模型在电子健康记录方面展现出潜力
研究人员开发了用于分词电子健康记录的联邦生成事件模型(GEMs),解决了不同医疗系统之间的数据孤岛和性能下降问题。在对三个独立医疗系统的评估中,这些联邦GEMs在临床预测任务上表现强劲,接近集中训练的有效性。研究发现,联邦学习在技术上是可行的,并且能保留大部分集中训练的性能,尤其是在本地训练数据有限的情况下,能带来显著的好处。
-
Evo 2 DNA 模型高精度识别 AMR 基因
已开发出一种新的轻量级探针 Evo 2,用于直接从原始宏基因组数据中检测抗菌素耐药性 (AMR) 基因。该方法无需昂贵的基因组组装步骤,ROC-AUC 评分为 0.977,准确率很高。Evo 2 DNA 基础模型旨在有效识别这些耐药性标记。
-
新的基准和数据集推动音频、图像和视频的深度伪造检测
研究人员推出了几个新的数据集和基准,旨在改进跨各种媒体的深度伪造检测。Echoes 专注于音乐深度伪造,强调语义对齐和提供商多样性,以创建更强大的检测模型。VendorBench-100 提供了一个统一的框架,用于评估商业 API、视觉语言模型和开源检测器中的深度伪造图像检测,突出了性能差异和指标分歧。HumanForge 采用以人为中心的方法来检测深度伪造视频,使用多代理管道进行注释,并专注于人与物体以及人与人之间的交互。此外,…
-
图神经网络应用于优化和物理学问题 · 跟踪2个来源
研究人员正在探索图神经网络(GNNs)在组合优化和理论物理学等传统角色之外的应用。一项研究表明,GNNs可以作为欧几里得旅行商问题的有效启发式方法,通过一次前向传播学习生成完整的路径,计算成本极低。另一篇论文将GNNs(包括图Transformer)应用于高能物理学中的大规模图分类问题,取得了高精度,并提供了显著的数据压缩以加快计算速度。
-
研究论文确定了脑机接口拼写准确性的关键指标
本研究论文探讨了在事件相关电位(ERP)脑机接口(BCI)中,哪些性能指标最能反映拼写速率的准确性。研究分析了两个数据集(私有的LARESI数据集和公开的OpenBMI数据集)中的13项指标,以确定它们在反映用户拼写性能方面的有效性,尤其是在ERP应用中常见的数据不平衡分布情况下。研究结果表明,Brier分数、Matthews相关系数(MCC)以及考虑类别不平衡的指标,如ROC AUC、PR AUC、AP和pAUC,最能指示拼写性能,…
-
AI模型高精度检测临床试验剂量错误 · 已追踪2个来源
研究人员开发了一种使用领域特定Transformer嵌入和分类模型来检测临床试验中剂量错误的方法。该研究评估了几种语言模型,包括ClinicalBERT、PubMedBERT、BioBERT和MedCPT,用于编码文本试验数据。BioBERT表现出卓越的性能,ROC-AUC达到0.794,比ClinicalBERT提高了3.95%。组合多个嵌入并未增强结果,这表明领域对齐比表示堆叠更关键。预测剂量错误最有效的模型是梯度提升、支持向量分…
-
新的 GMM 池化方法增强了超声图像早产预测能力
研究人员开发了一种新的高斯混合模型 (GMM) 池化方法,用于多示例学习 (MIL),以改进超声图像的早产预测。该方法对每位患者的多个宫颈图像的特征分布进行建模,捕捉患者内部的变异性,这与使用单一图像估计的标准 MIL 聚合器不同。GMM 池化方法在早产预测方面显示出显著的改进,将 PR-AUC 从 0.44 提高到 0.56。它还在淋巴结转移基准测试中取得了最先进的结果,分类的 F1 分数达到 0.91,ROC-AUC 达到 0.89。