latent Dirichlet allocation
PulseAugur coverage of latent Dirichlet allocation — every cluster mentioning latent Dirichlet allocation across labs, papers, and developer communities, ranked by signal.
-
新框架TopiCLEAR增强了短文本的可解释主题发现
研究人员开发了TopiCLEAR,一个通过聚类文档嵌入来发现短文本可解释主题的新框架。该方法整合了自适应降维和迭代聚类,基于“人类可解释的主题对应于嵌入空间的低维结构”的假设。在基准数据集和Twitter数据上的实验表明,TopiCLEAR与人类标注一致,并且比潜在狄利克雷分配(Latent Dirichlet Allocation)产生更具可解释性的主题,尤其是在处理非正式和短文本时。
-
新研究质疑主题模型稳定性作为准确性代理
一篇新发表在arXiv上的论文挑战了普遍的假设,即主题模型在重复运行中的一致性输出表明成功恢复了潜在主题。研究人员证明了可重复性不等于恢复,并引入了一个稳定性框架,该框架根据地面真实情况衡量一致性和准确性。使用由潜在狄利克雷分配(LDA)生成的合成语料库,他们发现LDA能够可靠地识别正确的主题数量并收敛到稳定的解决方案,但这些解决方案往往未能准确表示真实的生成主题。该研究强调,内部稳定性不应被误认为是正确性,尤其是在高风险应用中,应提…
-
AutoML 管道自动化文本数据趋势预测
本文介绍了 AutoCluster、AutoTopicModeling 和 AutoTrendAnalysis,这是一个全面的 AutoML 管道,旨在从具有时间属性的文本数据中预测新兴趋势。该系统自动化了最佳聚类、主题建模(LDA、LSA、BERTopic、NMF)和时间序列预测(Prophet、ARIMA、STL、LSTM)算法的选择。通过根据预测准确性对主题进行分类,该框架识别出强信号、弱信号和噪声,旨在减少手动工作量并提高机器…
-
人工智能分析公众对先进空中交通的情绪
一项发表在arXiv上的新研究通过检查来自Reddit和Quora的超过30万条文本,分析了公众对先进空中交通(AAM)的情绪。研究人员评估了七种人工智能情绪分析方法,发现ModernBERT在对AAM相关讨论进行分类方面最有效。然后,使用潜在狄利克雷分配法识别了20个主题和六个关键情绪集群,包括劳动力发展、监管、技术性能、地缘政治应用、安全风险和噪音问题。这些见解旨在指导政策制定者和行业利益相关者解决公众关切,以负责任地部署AAM。
-
LLM驱动的改写提高了社交媒体主题建模的准确性
研究人员开发了 TM-Rephrase,一个旨在改进 X(前身为 Twitter)等社交媒体平台上短文本主题建模的新框架。这种模型无关的方法利用大型语言模型在应用主题建模之前将非正式推文改写成更标准化的语言。一项使用 COVID-19 相关推文的案例研究表明,TM-Rephrase 提高了主题的一致性、独特性和多样性,其中口语化到正式的改写策略显示出最显著的改进,特别是对于潜在狄利克雷分配算法。
-
新AI框架使用行为模板检测移动异常
研究人员开发了IBAD,一个新颖的框架,通过识别重复的行为模板来检测人类移动数据中的异常。该方法使用潜在狄利克雷分配(LDA)来发现全局行为模式,并使用分层自监督模型来学习个体正常行为。IBAD的有效性已在真实和合成数据集上得到证明,表明学习到的行为原型可以跨越不同的地理和人口统计背景进行迁移。
-
新的 MIRAGE 方法通过元数据和 FAIR 原则增强 MSR 数据集分析
研究人员开发了 MIRAGE,一种通过增强元数据和评估 FAIR 原则来分析软件开发库挖掘 (MSR) 数据集的新方法。该方法使用 Semantic Scholar API 收集 2013 年至 2024 年的数据,并应用潜在狄利克雷分配 (LDA) 主题建模进行分析。研究发现,存储库托管网站和数据格式会影响引用模式和可用性,表明改进的注释可以提高数据集的可发现性和可重用性。
-
论文回顾混合模型以实现准确的风力发电预测
一篇新论文系统地回顾了用于区间风力发电预测的混合方法,结合了深度学习、模态分解和统计方法。研究强调,将变分模态分解(VMD)等技术与LSTM等模型相结合可以提高预测的准确性和可靠性。大多数研究采用双模型策略独立预测下限和上限,并通过平衡覆盖率和宽度来评估区间质量。
-
新基准解耦主题模型中的相似性与相关性
研究人员开发了一种新方法,用于区分主题模型(特别是那些经过大语言模型增强的模型)中的主题相关性和分类相似性。他们创建了一个使用LLM注释的合成基准来训练一个能够测量这两个语义轴的神经评分器。该评分器揭示了不同的主题模型家族在相似性-相关性空间中占据不同的位置,并且优化一个轴可能会损害在需要另一个轴的任务上的性能。