Dirichlet
PulseAugur coverage of Dirichlet — every cluster mentioning Dirichlet across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
Dirichlet-style smoothing's role in in-context learning is being actively investigated
The cluster explicitly states that researchers have identified Dirichlet-style smoothing as a mechanism underlying in-context learning in transformers. This suggests ongoing research and potential for further discoveries regarding its specific impact and applications within transformer architectures.
Dirichlet-style smoothing will be applied to other sequence models beyond transformers
The recent cluster highlights Dirichlet-style smoothing as a key component in transformer in-context learning. Given the success of Mamba models in time-series forecasting (QuantFlow), it's plausible that similar smoothing techniques, including Dirichlet-style, could be adapted to improve their performance on sequence-based tasks.
Dirichlet-style smoothing in transformers to improve in-context learning performance
The recent cluster evidence highlights that transformer models utilize Dirichlet-style smoothing for in-context learning. This suggests that further research into optimizing this smoothing mechanism could lead to significant improvements in the model's ability to learn from context. Future work could focus on tuning the parameters of this smoothing technique or exploring variations to enhance its effectiveness.
Dirichlet-style smoothing identified as a key component in transformer in-context learning
A recent paper indicates that transformers employ Dirichlet-style smoothing, similar to techniques used in other statistical models, as a mechanism for in-context learning. This observation suggests a deeper connection between traditional statistical smoothing methods and the emergent capabilities of large language models.
-
PRiSM 改进了视觉语言模型的少数样本适应能力
研究人员推出了一种新颖的类别原型正则化技术 PRiSM,旨在提高视觉语言模型 (VLM) 少数样本适应方法的性能。这些方法的现有基准测试通常依赖于不切实际的数据平衡假设,当这些假设被违反时,会导致性能显著下降。PRiSM 通过优化一个多项损失来解决这个问题,该损失增强了类间距离并促进了特征对齐,可作为现有基线方法的即插即用模块。该方法采用了一种高效的块状 Majorize-Minimize 优化器,并利用 Gershgorin 圆定理…
-
DP-Splat 为 3D 高斯飞溅提供自适应复杂性控制
研究人员推出 DP-Splat,一种用于控制 3D 高斯飞溅复杂性的新方法。该方法利用狄利克雷过程先验,允许高斯分量数量适应场景复杂性,这与之前使用固定分量数量的方法不同。DP-Splat 提供理论保证和经验改进,表明它可以用比现有方法少得多的分量实现相当或更好的颜色预测精度。
-
新的FedCVESA攻击窃取联邦学习模型中的私有数据
研究人员开发了FedCVESA,一种在联邦学习环境中进行“窃取训练数据”(TATD)攻击的新颖方法。这种白盒攻击针对特定客户端,将私有训练数据编码到模型参数(称为载体参数)中。为了对抗联邦学习中标准服务器聚合过程中发生的覆盖问题,FedCVESA采用了分段聚合,保留了这些关键的载体参数,同时允许其余参数进行正常平均。在MNIST和CIFAR-10等数据集上的实验表明,即使在非独立同分布(non-IID)数据分布下,FedCVESA也能…
-
新求解器加速图 $p$-拉普拉斯半监督学习
研究人员开发了一种新颖的图 $p$-拉普拉斯半监督学习求解器,该求解器实现了近线性时间复杂度。这种新方法解决了现有求解器的局限性,尤其是在 $p$ 值较高时系统可能变得病态的问题。通过在 $p$ 中采用连续性方法和阻尼弦牛顿法,该求解器保持了良态系统,与直接分解方法相比,实现了显著的加速和更低的内存使用。该方法在大规模图族和 MNIST 等基准数据集上表现出改进的性能,优于标准的二次方 ($p=2$) 方法。
-
Transformer模型使用Jelinek-Mercer和Dirichlet风格的平滑技术进行上下文学习
研究人员在Transformer模型中识别出两种互补的平滑机制,据信是上下文学习的基础。第一种机制在有限的注意力权重尺度上观察到,充当软上下文匹配估计器,类似于Jelinek-Mercer平滑那样在上下文阶数之间进行内插。第二种机制涉及一个序列起始标记,引入加性伪计数,类似于Dirichlet风格的平滑。一个特制的Transformer模型展示了这些机制,表明Transformer模型学会了正则化上下文估计,而不仅仅是计数,并且可以匹…
-
QuantFlow:联邦Mamba模型增强时间序列预测
研究人员推出QuantFlow,一个新颖的用于时间序列预测的联邦学习框架。该模型结合了倒序序列嵌入、双向Mamba状态空间解码器和分位数回归,以处理长序列、高维度和隐私敏感数据。QuantFlow在包括加密货币、交通和天气在内的各种数据集上表现出色,同时在去中心化部署中保持准确性,而无需集中化原始数据。该框架在可扩展和注重隐私的时间序列预测方面显示出潜力,尽管它在处理不规则信号和长周期泛化方面存在局限性。
-
新研究探讨大型语言模型在不同语言和任务中的不确定性估计 · 跟踪 4 个来源
研究人员正在探索提高大型语言模型 (LLM) 在各种语言和任务中的不确定性估计的方法。一项研究发现,即使问题是低资源语言,提示 LLM 用英语进行推理也能显著提高不确定性估计性能。另一篇论文提出了一个框架,将 LLM 的不确定性分解为输入歧义、知识差距和解码随机性,从而为审计可靠性提供更细致的理解。此外,一种新方法使用知识蒸馏来创建高效的、单通道的 LLM 进行不确定性估计,其性能与计算密集型方法相当。
-
贝叶斯模型获得混合权重精确后验计算 · arXiv论文
一篇新论文详细介绍了一种在分层贝叶斯模型中计算混合权重后验分布的精确方法。所提出的动态规划方法(带有用于提高效率的FFT变体)无需采样即可提供闭式后验摘要和可信区间。与EM、高斯和拉普拉斯近似等现有技术相比,该方法在小样本模型和特定生物分析中表现出优越的校准性和速度。
-
AI系统ProMUSE通过自适应成像降低阿尔茨海默病诊断成本
研究人员开发了ProMUSE,一个新颖的AI系统,旨在通过自适应地整合多模态数据来改善阿尔茨海默病的早期诊断。该系统最初使用低成本的临床评估并量化诊断不确定性。如果存在高不确定性,ProMUSE会逐步整合更昂贵的数据,如MRI和PET扫描,并利用Dempster-Shafer理论融合信息,减少对昂贵成像的依赖。在基准数据集上的实验表明,ProMUSE可以达到与全模态方法相当的准确性,同时显著减少对MRI/PET扫描的需求,为广泛筛查提…
-
新框架通过流形锚定学习改进医学影像分析
研究人员开发了一种新颖的流形锚定变分框架,旨在改进医学影像队列的无监督表示学习。这种新方法利用了几何感知的期望最大化算法,通过选择具有高扩散中心性的图中心点来确保学习到的原型保持在数据流形上。该框架还包含一个用于潜在空间平滑的狄利克雷能量正则化器,以及一个用于无标签质量评估的每个子种群的不确定性分数。在心脏瘢痕和脑部MRI基准测试中,该方法取得了优于现有模型的准确性,并产生了更清晰的原型,即使在存在大量子种群的情况下也能保持稳定性。