Markov chain
PulseAugur coverage of Markov chain — every cluster mentioning Markov chain across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
arXiv论文分析非线性两时间尺度随机逼近中的平稳偏差
本文深入探讨了非线性两时间尺度随机逼近方法中存在的平稳偏差。研究聚焦于由有限状态马尔可夫链驱动的递归,推导了一个一阶偏差展开,即使当慢步长远小于快步长时,该展开也保持一致性。研究结果表明,偏差缩减策略需要仔细匹配Richardson-Romberg外插权重与特定的步长路径,因为偏差指数可能并非总是整数。研究包含一个可精确求解的非线性马尔可夫示例用于验证,并考察了时序差分学习和有限运行外插。
-
新指标量化历史数据带来的预测增益
研究人员引入了一个名为内存预测过量(MPE)的新指标,用于量化过去信息在多大程度上提高了随机过程的预测准确性。MPE衡量了与仅使用静态边际分布相比,使用整个观测历史所带来的平均预测准确性增益。MPE的归一化版本提供了一个无量纲的预测效率度量,并且该框架被扩展到有限历史MPE(FH-MPE),以确定给定预测性能所需的最小内存长度。
-
新的 GFlowNet 混合框架增强了 AI 科学发现能力
研究人员开发了一个新的 GFlowNets 混合模型理论框架,用于改进 AI 驱动的科学发现中的状态空间探索和收敛性。该框架分为连续索引和离散索引的集合。连续索引方法可以被解释为一种随机特征扩展,增强了采样器的表达能力并降低了学习的不稳定性。离散索引方法为分层条件 (SC) GFlowNets 提供了基础,后者将状态空间分解并允许并行训练,从而在不增加计算成本的情况下加快学习收敛速度并改善模式覆盖。
-
新研究推进薛定谔桥以改进AI传输学习 · 跟踪2个来源
两篇新研究论文介绍了薛定谔桥技术的进展,这是一种用于学习分布之间随机传输的技术。第一篇论文《图上的成本增强薛定谔桥可精确求解》提出了一种通过用Feynman-Kac倾斜取代学习控制来简化过程的方法,能够进行精确计算,并在蛋白质折叠模型中显示出潜力。第二篇论文《分布鲁棒薛定谔桥》介绍了一种通过学习一个考虑不确定性的单一控制器来提高对初始分布变化的鲁棒性的方法,在图像到图像翻译和传输任务中表现优于标准方法。
-
arXiv新论文详述高级SGD优化技术 · 已追踪2个来源
arXiv上发布的两篇新研究论文探讨了随机梯度下降(SGD)的高级优化技术。第一篇论文“常数步长SGD的尖锐平稳高斯近似”(Sharp Stationary Gaussian Approximation for Constant-Stepsize SGD),作者是Junghoon Seo,在特定条件下为用高斯分布近似SGD的不变定律提供了理论框架。第二篇论文“重尾噪声和$(L_0,L_1)$-平滑下裁剪SGD的高概率收敛性”(High…
-
新的统计方法改进了时间相关数据的估计
研究人员开发了一种名为“留窗估计”(leave-a-window-out estimation)的新统计方法,用于分析随机变量序列。该技术旨在改进函数估计,例如新颖的下一个 token 的概率或测试误差,这对于理解时间依赖性至关重要。所提出的方法在模拟中被证明对广泛的平稳过程(包括马尔可夫链和自回归过程)有效,并且优于传统的留一法(leave-one-out)方法。
-
新算法为多智能体协调提供安全保障
研究人员开发了一类新的算法,称为截断噪声最优响应(TNBR)算法,以解决具有次模最大化目标的多个智能体协调问题。这些算法允许智能体异步地、随机地从其最优响应收益的邻域中选择动作。该研究为TNBR算法相关的马尔可夫链提供了界限,确保了高价值的循环状态(性能)和避免任意糟糕的循环状态(安全)。一个值得注意的发现是连接这两种界限的水床效应:较差的安全保证意味着有利的性能保证。
-
新的NS-Flows方法可大幅缩短原子模拟时间
研究人员开发了一种名为NS-Flows的新方法,可显著加快确定原子系统热力学性质的过程。该方法采用了之前用于引力波推断的流基技术,以解决传统嵌套采样算法中的计算瓶颈。通过用条件归一化流替换马尔可夫链更新,NS-Flows可将Lennard-Jones圆盘等系统的能量评估次数减少两个数量级以上,并将实际运行时间减少约三分之一。
-
新的数据驱动模型加速了随机化学反应模拟
研究人员开发了一种新颖的数据驱动方法,以更有效地模拟随机化学反应网络。该方法利用一个机器学习模型(特别是条件归一化流),该模型在模拟数据上进行训练,以近似底层马尔可夫链的转移核。所得的随机传播器允许在更粗的时间步长下生成统计上一致的轨迹,与传统的精确方法相比,大大降低了计算成本。
-
新理论量化扩散模型中的并行采样成本
研究人员开发了一个新的自适应并行离散向量采样理论框架,其动机是掩码扩散模型中的并行解码。核心发现是将库尔巴克-莱布勒散度测量的近似误差与揭示轮次中累积的条件总相关性联系起来的一个精确恒等式。该恒等式将条件总相关性确立为轮内并行性的基本信息成本。该研究为马尔可夫链和伯努利游走等各种结构提供了优化的采样计划,并证明了串行深度和熵之间的分离。使用掩码扩散语言模型的实验表明,该框架可以有效地区分不同的解码规则并预测输出质量。
-
使用 llama.cpp 在消费级 GPU 上优化 LLM 性能
这篇博文详细介绍了在消费级多 GPU 硬件上运行大型语言模型的技木挑战和解决方案。作者侧重于使用 llama.cpp 等现有工具和多 GPU 并行等技术来优化性能,而不是开发新的底层代码。解释深入探讨了底层 Transformer 模型架构、Token 的概念以及注意力机制,并将其与马尔可夫链等更简单的模型进行对比,以突出生成连贯文本所涉及的复杂性。
-
新的谱算法加速马尔可夫链收敛
研究人员开发了用于选择定义有限马尔可夫链平均核的状态空间划分的谱算法。这些算法旨在通过将基线核与吉布斯核组合或混合来加速收敛,吉布斯核在选定的块内重新采样。选择过程涉及使用加权 k-means 对马尔可夫链平方核的底部非恒定特征函数进行四舍五入,或对加性混合物进行代数上最小的特征函数进行四舍五入。该目标被证明等同于最小化初始块标签与一次跃迁后的状态之间的皮尔逊卡方互信息,从而提供了概率解释。在各种模型上的实验表明,每次迭代在收敛和统计…
-
新的巴拿赫空间理论用于AI中的马尔可夫式哈尔彭迭代
研究人员开发了一个新的理论框架,用于逼近非扩张算子的不动点,特别是在数据源自连续马尔可夫轨迹时。他们新颖的方差缩减马尔可夫PAGE-Halpern方法在希尔伯特空间中实现了O(epsilon^-3)的样本复杂度,并将其扩展到一般的有限维巴拿赫空间,同时还建立了高概率保证。
-
新的因果抽象框架增强了人工智能研究中的可迁移性
研究人员开发了一个新的因果推断泛化可迁移性框架,超越了单一查询分析,转向模型层面。该方法以因果抽象理论为基础,描述了单个映射如何在干预行为中对源和目标人群进行对齐,适用于马尔可夫和半马尔可夫设置。该框架还为近似可迁移性提供了认证查询区间,将抽象误差重新定义为定量度量,并推导出不可迁移查询或目标无关设置的界限。
-
分析了用于马尔可夫链的新统计核
研究人员开发了新的理论工具来分析源自平稳马尔可夫链的滑动窗口计数核的统计特性。该研究为这些核建立了谱隙界和Poincaré不等式,证明了谱隙与窗口长度($n$)成反比。这项工作对理解有限窗口计数统计中的方差界和经验平均值的算子范数集中具有启示意义。
-
新研究提供更快的马尔可夫链收敛方法
两篇新研究论文提出了加速马尔可夫链收敛的新方法。第一篇论文引入了一个称为“渐近等价于目标”的标准,提供了一条无需依赖不可约性或非周期性等传统概念即可直接证明收敛的途径。第二篇论文提出了一个称为“延迟接受正则化和退火”(DART)的框架,该框架通过利用目标密度的几何信息而不直接计算梯度来实现马尔可夫链更快的混合时间。
-
高斯扰动可防止循环GNN中的过平滑
研究人员开发了一种使用持久高斯扰动来对抗循环图神经网络(GNN)中过平滑的新颖方法。该技术在每次传播步骤后注入独立的斯诺伊噪声,将GNN转变为随机动力系统。分析表明,该方法保证节点表示不会崩溃到低维子空间,从而防止渐近过平滑并保持表示多样性。
-
两篇arXiv论文详述从单条轨迹学习动力学系统 · 跟踪2个来源
两篇新提交至arXiv的stat.ML板块的研究论文探讨了从单条轨迹学习动力学系统。第一篇论文侧重于切换非线性动力学系统,基于函数类熵为预测风险提供理论保证,并获得明确的收敛速率。第二篇论文处理遍历动力学系统,通过非线性最小二乘法推导出预测函数估计的高概率保证,并将框架扩展到高阶系统和Koopman算子。
-
大语言模型文本处理详解:从词数统计到语言学和符号学 · 追踪8个来源
一系列文章探讨了大语言模型(LLM)如何处理和理解文本的技术基础。作者深入介绍了各种方法,从基本的词数统计和TF-IDF、马尔可夫链等统计技术,到Word2Vec、MLP、RNN和LSTM等更先进的神经网络方法。该系列还触及了理解LLM功能所必需的语言特征和符号学理论,并强调这些模型是复杂的机器,而非有意识的思维体。
-
新框架对模型误设下的 Thompson Sampling 进行分类
本文引入了一个新颖的随机稳定性框架,用于分析在潜在模型可能被误设的动态决策场景中的 Thompson Sampling (TS) 算法。该研究对双臂高斯老虎机中的后验演化进行了详细分类,识别出预测极限信念、行动频率和渐近遗憾的明确状态。然后,该框架被推广到有限模型类别,为模型误设下的 TS 行为提供了定性和几何理解,并为结构化老虎机问题中的鲁棒决策奠定了基础。