PulseAugur
实时 06:34:53
实体 Gaussian Mixture Models

Gaussian Mixture Models

PulseAugur coverage of Gaussian Mixture Models — every cluster mentioning Gaussian Mixture Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 33
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 32
层级分布 · 90 天
主题
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 33 条
  1. TOOL · CL_216078 ·

    新的摊销框架改进了核密度估计的带宽选择

    研究人员开发了一种新颖的摊销框架,用于学习核密度估计中的带宽选择。该方法在密度估计任务的分布上优化对数得分,即使在异构数据下也能实现稳定的学习。实验表明,与Silverman规则和最小二乘交叉验证等传统方法相比,这种摊销选择器表现显著更优,尤其是在样本量小或多样化的情况下。

  2. TOOL · CL_208307 ·

    梯度EM算法在过参数化高斯混合模型上实现了全局收敛

    研究人员为梯度期望最大化(EM)算法应用于过参数化高斯混合模型(GMMs)时建立了全局收敛保证。这是EM或其梯度变体在超出两分量特定情况之外的首个此类结果。研究表明,在轻微过参数化的情况下,即学习模型使用 $n = \Omega(m\log m)$ 个分量来拟合一个 $m$ 分量真实GMM时,随机初始化的梯度EM可以在多项式时间和样本复杂度内收敛到正确解。该分析引入了用于GMM分析的新颖工具,以表征算法动力学和似然损失景观。

  3. TOOL · CL_198161 ·

    自然语言处理流水线检测厄瓜多尔公共采购中的指责性语言

    研究人员开发了一种新颖的自然语言处理(NLP)流水线,用于检测厄瓜多尔官方公共采购系统中的指责性语言。这种混合方法结合了无监督聚类和监督分类,利用了来自Word2Vec、LLaMA和RoBERTa等模型的语义嵌入。该系统在识别潜在的违规评论方面表现出高精度和高召回率,即使在数据不平衡的情况下也是如此,展示了轻量级、领域适应性强的自然语言处理在提高公共采购透明度方面的有效性。

  4. TOOL · CL_193216 ·

    揭示了用于部分最优传输的新数学距离

    研究人员引入了新的数学工具,即熵部分最优传输和部分混合 Gromov--Wasserstein 距离,旨在比较概率测度和度量测度空间。这些方法通过允许部分匹配来解决现有平衡公式的局限性,这对于包含异常值或不完整信息的数据集很有益。该论文详细介绍了这些新距离的数学特性,包括它们的存在性、唯一性和极限,并通过在合成数据和点云上的数值实验展示了它们的应用。

  5. TOOL · CL_178396 ·

    LLM 和 GMM 增强 NLP 中代表性不足主题的聚类

    研究人员开发了一种新的无监督自然语言处理(NLP)数据增强方法,该方法结合了高斯混合模型(GMM)和大型语言模型(LLM)。这种方法旨在改善文本数据集中代表性不足主题的表示,这是无监督聚类任务中的一个常见挑战。通过使用 GMM 识别少数簇,并使用 LLM 为这些簇生成合成文档,该方法提高了聚类性能和可解释性。

  6. TOOL · CL_171788 ·

    新研究探索使用紧凑支撑径向基函数进行概率密度建模

    研究人员探索了使用紧凑支撑径向基函数(CS-RBF)作为一种新颖的概率密度函数参数族,特别关注Wendland $\mathscr{C}^2$ 核。该研究在单变量和条件设置中提供了矩和累积分布函数等统计属性的解析表达式,并考虑了截断和非截断支撑的场景。还介绍了一种使用CS-RBF混合模型进行密度估计的增量学习算法,该算法在合成和真实世界数据集上展示了与高斯混合模型相比具有竞争力的性能。

  7. TOOL · CL_170107 ·

    Lloyd's K-Means 算法被识别为 Frank-Wolfe 方法的特例

    一篇新论文建立了 Lloyd's K-Means 聚类算法与 Frank-Wolfe (FW) 算法之间的联系,证明 K-Means 是 FW 的一个特定实例。该研究推导了 K-Means 的非渐近收敛率,并提出了一种用于处理空簇的 FW 变体,保持了相同的收敛率。研究结果通过对高斯混合模型和图像分割数据的模拟进行了说明。

  8. TOOL · CL_154501 ·

    新的优化框架使用高斯混合模型处理鲁棒机会约束问题

    研究人员开发了一种用于分布鲁棒线性机会约束问题的新方法,该方法利用高斯混合模型(GMM)来表示不确定性。通过允许最坏情况分布动态确定连续支持内的混合分量数量和位置,以及它们的均值和协方差,该方法改进了有限支撑分布鲁棒(FDR)公式。已创建一种自适应切割面算法来解决这些问题,该算法内生地确定接收质量的混合分量参数。一项关于电动汽车充电站能源分配的案例研究证明了该框架在满足可靠性目标方面的有效性。

  9. RESEARCH · CL_151822 ·

    扩散模型的信息处理和生成能力得到分析 · 追踪到4个来源

    近期研究论文探讨了扩散模型的内部工作机制,重点关注它们在生成过程中如何存储和利用信息。研究表明,这些模型会将大量信息用于重建精细的感知细节,而语义内容则更牢固地与类别标签相关联,并且不太依赖于低级细节。这种理解有助于解释分类器自由引导等技术的有效性,该技术在生成早期增强了语义信息。进一步的研究还调查了离散扩散框架和分数平滑的插值效应,揭示了这些模型如何通过插值训练样本来生成新颖数据。

  10. COMMENTARY · CL_151034 ·

    自组织映射:一种被低估的聚类算法

    本文探讨了聚类算法,重点关注自组织映射(SOMs)及其被低估的潜力。作者主张深入研究SOMs,认为调整它们可以带来显著的好处,这与通常基于调整不当而表现不佳而将其忽略的普遍做法相反。文章将SOMs与其他算法如DBSCAN、k-means和高斯混合模型进行了对比。

  11. RESEARCH · CL_143375 ·

    新的GMM-EVA框架增强了LVLM长视频理解能力

    研究人员推出了一种新颖的GMM-EVA框架,旨在提高大型视觉语言模型(LVLMs)在长视频理解方面的效率和有效性。该方法利用高斯混合模型来识别和分组视频中的事件,从而实现视觉信息的差异化分配。通过为主要细节保留高分辨率关键帧,并为时间上下文使用低分辨率帧,GMM-EVA在保持性能的同时显著降低了所需的token预算。

  12. RESEARCH · CL_133488 ·

    新研究通过球形分解和统计力学探索高斯混合模型

    两篇新研究论文从不同的分析视角探讨了高斯混合模型(GMM)。第一篇论文介绍了一种使用球形径向分解的方法,将GMM概率函数表示为欧几里得球体上的积分,并建立了可微性条件和梯度表示。第二篇论文将统计力学应用于GMM和非参数最大似然估计(NPMLE),提供了改进的稳定性保证,并深入探讨了NPMLE与随机能量景观中的混沌等概念之间的关系。

  13. RESEARCH · CL_111756 ·

    新AI方法解决时间序列预测和模型可解释性问题 · 追踪5个来源

    研究人员推出KARMA,一种通过构建马尔可夫代理模型来捕捉时间依赖性的新方法,用于解释时间序列预测模型。该方法识别预测充分性所需的最小历史长度,并估计一个马尔可夫转移核,提供一个五级全局解释层次结构。另外,一个名为The Simulacrum的框架使用决策理论预训练来开发基于神经网络的时间序列估计器,这些估计器可以近似最优决策规则并在真实基准上实现具有竞争力的预测精度。此外,一项关于时间序列基础模型灾难性遗忘的研究表明,虽然微调提高了…

  14. RESEARCH · CL_109604 ·

    新方法为稀缺医疗AI训练生成患者数据

    研究人员开发了一种新颖的患者增强技术,用于数据稀缺的医学多示例学习(MIL)。该方法通过使用高斯混合模型从池化的实例嵌入中学习疾病特定的“配方”,在嵌入空间中生成逼真的患者数据。然后,根据不确定性量化选择生成的患者,以提高MIL性能,特别是在罕见病或数据有限的情况下。该方法已证明比现有方法具有更高的性能,甚至在缺失类别的情况下也能取得与完整数据集训练相媲美的结果。

  15. TOOL · CL_108118 ·

    用于机器学习中混合模型的新的半定规划方法

    一篇新的研究论文介绍了一种半定规划方法,该方法使用诸如高斯混合模型之类的分布混合物来近似目标测度。该方法在确定混合模型阶数和在高维环境中估计参数方面特别有用。该方法提供了一个松弛层次结构,该结构收敛于最优值,并可应用于聚类问题,可能加速标准算法的收敛。

  16. TOOL · CL_104666 ·

    新框架解决了潜在信号的解卷积和去噪问题

    研究人员开发了一个新的非参数密度解卷积和经验贝叶斯去噪框架,解决了复杂系统中模糊潜在信号的挑战。该方法利用卷积最大均值差异(convMMD)损失,通过将观测数据分布与噪声卷积的模型分布进行匹配来学习潜在生成模型。这种方法与高斯混合模型和归一化流等表达性筛分类兼容,为生成潜在分布模型下的解卷积和去噪提供了实用且理论上可靠的解决方案。

  17. RESEARCH · CL_99702 ·

    新的得分匹配方法有望实现生成模型的全局收敛

    研究人员开发了一种新的生成模型得分匹配方法,该方法利用反向 Fisher 散度而非标准的正向 Fisher 散度。这种替代目标显示出改进的优化特性,特别是对于高斯混合模型。该研究在特定条件下证明了梯度下降的全局收敛性,表明学生分量可以收敛到接近其最近的教师分量,并为全变分距离收敛提供了保证。

  18. TOOL · CL_96229 ·

    新的 PFOM 框架通过算子匹配统一生成模型

    研究人员引入了 Perron--Frobenius 算子匹配 (PFOM),这是一个新颖的生成框架,通过匹配积分 PF 算子的密度演化,统一了流、扩散和跳跃模型。该方法利用 Kullback--Leibler 散度来实现样本条件目标,与现有方法相比,在混合高斯和双月形等基准测试中表现出更快的收敛速度和更高的效率。PFOM 将算子理论识别与当代生成建模相结合,为自适应字典和高维应用铺平了道路。

  19. TOOL · CL_94180 ·

    新的几何框架揭示高斯混合模型收敛性见解

    研究人员开发了一个新的几何框架来分析有限高斯混合模型中参数估计的收敛速率。该框架利用 Hellinger 下界将密度差异与 Wasserstein 距离联系起来,明确考虑了分量分离和最小权重。研究表明,当分量数量已知时,收敛主要由这些分量的空间排列决定。然而,当分量数量未知或被过度指定时,最小混合权重与收敛速率无关,将复杂性转移到二阶 Wasserstein 几何学。

  20. RESEARCH · CL_81952 ·

    Flash-GMM 内核将 GMM 聚类速度提升 20 倍,支持更大规模数据集

    研究人员开发了 Flash-GMM,这是一种专为 GPU 上高斯混合模型 (GMM) 高效计算而设计的新型融合 Triton 内核。该内核通过避免完全物化责任矩阵来显著降低内存需求,从而实现了 20 倍的速度提升,并使得在单个设备上处理比以往大 100 倍的数据集成为可能。Flash-GMM 已集成到近似最近邻搜索中,为 k-means 聚类提供了一种可行的替代方案,并提高了召回率。