lasso
PulseAugur coverage of lasso — every cluster mentioning lasso across labs, papers, and developer communities, ranked by signal.
- instance of mountain ridge 90%
- instance of ScienceCast 90%
- instance of elastic net regularization 70%
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- instance of CatalyzeX 70%
- competes with mountain ridge 60%
- competes with least squares method 60%
- used by least squares method 55%
- other ScienceCast 50%
- competes with elastic net regularization 50%
7 天有情绪数据
-
新的MultiSigBERT模型通过多模态数据增强肿瘤学生存预测
研究人员开发了MultiSigBERT,一个用于肿瘤学多模态序列生存建模的新框架。该方法整合了异构数据源,包括叙述性临床报告和结构化患者数据,以改进生存预测。通过利用路径签名表示和LASSO正则化的Cox模型,MultiSigBERT能够捕捉跨模态的复杂时间交互,在真实肿瘤学队列中达到了0.743的一致性指数。
-
新的SAR去斑方法在基准测试中达到顶级性能
研究人员开发了一种新颖的合成孔径雷达(SAR)去斑方法,该方法可在不遮挡重要散射结构的情况下去除SAR图像中的噪声。新技术重新审视了非局部稀疏估计器,应用了log--Yeo-Johnson变换并将相似的块编码为组。这种方法确定性地固定了可调参数,包括从随机矩阵理论导出的几何校准校正,该校正将多个设置合并为一个解析确定的自由度。由此产生的估计器无需训练,并在合成基准测试中与十二种已发布的方法进行的24次比较中的18次中排名第一,在实际S…
-
新的理论界限改进了复杂分布的Langevin采样
研究人员为Moreau--Yosida未调整Langevin算法(MYULA)开发了新的理论界限,这是一种用于从复杂概率分布采样的算法。该研究侧重于非光滑复合目标,并引入了一个新指标——活动迹(active trace),与以前的方法相比,该指标能更好地控制算法的离散化误差。这一进展可能导致更有效的机器学习采样技术,特别是在涉及强凸和Lipschitz梯度的问��中。
-
新研究探讨高维网络中的变量选择
一篇新的研究论文探讨了在高维网络中选择相关变量的方法,特别是在底层模型可能被误设的情况下。该研究展示了岭参数如何影响均方误差,从而降低测试方差并更全面地识别邻域。它将这些发现与双重下降等机器学习概念联系起来,表明在具有众多参数的模型中,模型空间的体积应被纳入惩罚项中,以实现准确的邻域选择。
-
新Lasso普遍性定理发布,适用于稀疏模型
研究人员发表了一篇论文,详细介绍了Lasso估计方法的Gaussian普遍性定理。该定理适用于稀疏模型中具有线性相关协变量的情况,允许比以往研究更一般的行和列同时依赖结构。研究结果得到了各种稀疏模型下数值例证的支持。
-
可解释的AI模型揭示了游戏中人类的决策模式
研究人员探索了可解释的机器学习模型,以理解游戏中人类的决策,特别是偏离预测的独立同分布(i.i.d.)博弈行为。通过分析来自零和纸牌游戏的84,000多项决策,该研究将LSTMs等黑箱序列模型与透明模型进行了比较。研究结果表明,诸如重复或避免过去行为等可预测的行为,特别是关于玩家自身近期历史的管理,占了大部分具有战略意义的信号,而频率跟踪的预测价值很小。
-
新研究质疑双重机器学习置信区间可靠性
一篇新研究论文探讨了在使用各种机器学习算法进行干扰参数估计时,双重机器学习(DML)中置信区间的可靠性。该研究进行了模拟,比较了LASSO、Random Forest、LightGBM和神经网络等算法的分析置信区间和自举置信区间。结果表明,覆盖性能存在显著差异,具体取决于所选的学习器,覆盖概率有时会随着样本量的增加而降低。该研究还将这些方法应用于检查美国肥胖患病率城乡差异的真实数据集,证实了学习器选择会影响模型性能,并发现了更大的乡村…
-
新框架支持去中心化网络上的隐私保护分布式卷积秩回归
研究人员为去中心化网络上的分布式卷积秩回归(CRR)引入了一个新框架。该方法允许仅使用本地数据和邻居节点之间共享的信息来推导估计量,从而提高隐私性和通信效率。该框架包括异构网络设置下的有限样本误差界限,以及稀疏 CRR LASSO 估计器的支持恢复保证。采用广义共识 ADMM 在网络节点之间进行高效的数值实现,并通过模拟和真实世界实验验证了其性能。
-
经典机器学习模型在表格数据上表现出幂律缩放
一项新近发表在arXiv上的研究对经典机器学习模型在表格数据上的表现进行了基准测试,结果表明幂律能够准确描述各种数据集和模型家族的学习曲线。研究发现,在分类任务中,树集成模型(特别是Boosting和Random Forest)在完整数据上表现最佳。值得注意的是,模型家族内的指数表现出近似的共同特征,这表明在一定程度上存在可预测的压缩性,尽管并非普遍适用。研究还强调,即使在固定的随机状态下,实现结果也存在显著差异,这表明了预处理和缺失…
-
新Python包ROOFS助力临床试验中的生物标志物特征选择
研究人员开发了ROOFS,一个Python包,旨在帮助生物医学研究人员为生物标志物发现和临床预测建模选择合适的特征选择方法。该包在用户数据上对各种方法进行基准测试,提供关于预测性能、稳定性和特征鲁棒性的报告。在利用PIONeeR临床试验数据进行的演示中,ROOFS确定了一种结合t检验和逻辑回归的Benjamini-Hochberg调整后p值的最佳方法,该方法优于LASSO等方法。
-
新的 Cox 模型方法增强了生存分析的变量选择
研究人员开发了一种在生存分析中进行变量选择的新方法,该方法建立在 Cox 比例风险模型的基础上。该方法利用偏似然函数的平方根变换,使得正则化参数的选择独立于未知的基线风险和删失机制。所提出的标准结合了像 BIC 这样的信息标准和像 lasso 这样的惩罚回归方法,旨在提高在模拟数据和真实世界数据上的性能,特别是在支持恢复应用中。
-
新的LASSO估计器解决了高维面板数据回归问题
一篇新论文介绍了一种因子增强的稀疏分组LASSO估计器,用于高维面板数据回归。该方法解决了由共同冲击引起的横截面相关误差的设置。所提出的估计器集成了MIDAS聚合与潜在因子,使其能够利用时间序列数据中的混合频率分组结构。理论分析表明,与标准的LASSO相比,该方法在处理横截面相关性时可以产生更优的预测和估计性能。
-
新框架统一了正态均值问题中的收缩和阈值估计器
研究人员开发了一个用于正态均值估计问题中近似风险最小化的新框架,并引入了一个名为 NOMAD 的估计器。该框架统一了包括 James-Stein 和 lasso 类型估计器在内的各种收缩和阈值规则,并扩展到相关观测和线性回归。NOMAD 估计器旨在最小化从观测数据派生的近似风险标准,为正则化提供了一种数据驱动的方法。
-
新框架利用领域知识增强模型选择
一篇新论文介绍了一个用于模型选择的理论框架,该框架使用交叉验证,特别是在纳入领域知识时。该研究为整个学习流程建立了基于VC维度的偏差界,扩展了无界损失函数的现有结果。它提出了“学习空间”来根据领域知识构建候选模型,并证明了在处理高维线性回归时,适应良好的学习空间可以显著优于OLS、LASSO和岭回归等标准方法。
-
MCP网关涌现,以保障AI代理交互安全
模型上下文协议(MCP)已成为AI代理的关键基础设施,使其能够与数据库和API进行交互。然而,这种扩展增加了攻击面和凭证分散的风险。MCP网关正在涌现,通过集中管理代理工具调用的访问控制、凭证管理和审计来解决这些安全问题。本文回顾了五种不同的MCP网关解决方案,重点介绍了它们在治理和安全方面的独特方法。
-
新的目标化高度自适应套索方法改进了统计估计
研究人员引入了一种名为目标化高度自适应套索(Targeted HAL)的新统计方法,用于估计非路径可微函数参数,例如剂量-反应曲线。该方法利用样条基函数和LASSO步骤来逼近目标函数,旨在提高准确性和数据自适应推断。模拟表明,Targeted HAL在偏差和均方误差方面优于现有的HAL插件估计器,提供了一种灵活的方法,而无需参数假设。
-
新型神经网络架构解释不透明的形式验证证书
研究人员开发了一种新颖的循环一致神经网络架构,旨在为形式验证证书生成自然语言解释,这些证书通常对非专业人士来说是不透明的。该系统使用两个网络:一个将证书翻译成解释,另一个从解释中重建证书,并由符号验证器确保准确性。在金融合规领域 420 个证书上进行评估,该架构实现了 90.0% 的循环验证健全性,显著优于多 LLM 基线,并提供更快、离线和确定性的推理。
-
新方法大幅降低非光滑估计量的降维复杂度
研究人员开发了一种新方法,可以显著加快非光滑统计估计量的降维计算速度。该技术利用块 Schur 补和 Sylvester 行列式恒等式,将计算复杂度从三次降低到更易于管理的几次多项式形式。该方法已成功应用于 Lasso、Sparse Support Vector Machines、Elastic Net 和 Group Lasso 等各种模型,在保持数值精度的同时实现了超过 14,100 倍的速度提升。
-
研究发现 Mamba 预测瓶颈未能发现因果结构
一篇新的研究论文挑战了 Mamba 等模型中的预测瓶颈能够固有地发现因果结构的观点。由 Aman Chadha 进行的一项研究发现,尽管早期实验暗示了这种能力,但更严格的伪造基准测试显示,像线性瓶颈这样的简单方法,甚至 PCMCI 和 Granger 因果关系等经典技术,表现同样好或更好。该论文强调,预测瓶颈在因果发现中的感知优势很大程度上是由于样本量混淆和非标准干预方案,而不是架构的内在属性。
-
新的Lasso估计器提高了变量选择效率
研究人员开发了一种广义去偏Lasso估计器,该估计器使用稳定性原理,允许在设计矩阵受到扰动时进行高效更新。在某些亚高斯设计的条件下,这种近似在渐近上是准确的,并简化了条件随机化检验和局部knockoff滤波器等重采样变量选择方法的计算。该方法依赖于集中和反集中论证来管理误差项和符号变化。