Lagrange function
PulseAugur coverage of Lagrange function — every cluster mentioning Lagrange function across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究通过隐藏神经元探索联想记忆的相 · 跟踪到2个来源
研究人员分析了一类称为H类的联想记忆,该类联想记忆利用了具有隐藏神经元的二分结构。这种结构允许在多项式和指数负载机制下研究检索动力学和存储容量。分析揭示了不同的相,包括顺磁相、凝聚相和冻结相,并强调了隐藏神经元如何充当检索的序参量。该研究还区分了多项式负载和指数负载之间的串扰统计数据,表明可见和隐藏拉格朗日量分别在固定稳定性和存储规模方面起着双重作用。
-
新研究为生成模型的流匹配提供了几何和基于残差的视角
两篇新研究论文探讨了生成模型流匹配技术的进展。第一篇论文《从分阶段几何角度看流匹配和无分类器引导的粒子动力学》为连续和离散采样提供了统一的几何理论,详细说明了轨迹如何被吸引以及引导如何重塑数据几何。第二篇论文《概率偏微分方程的残差增强流匹配算子》引入了一个通过关注表征低保真度和高保真度解之间差异的概率残差算子来学习具有潜在不确定性的代理模型的框架。Hugging Face 的相关分析从拉格朗日视角对流匹配进行了分析,从以粒子为中心的观…
-
LaGSplat框架从视频推断受物理约束的模拟
研究人员开发了LaGSplat,一个新颖的框架,可以从单目视频中推断受物理约束的交互式模拟。该系统允许用户对拍摄的物体施加外力,从而能够实时渲染它们在2D或3D中的响应。LaGSplat利用一个潜在状态,该状态既是学习到的耗散拉格朗日的广义坐标,又是高斯泼溅解码器的条件变量,使其能够将图像空间力转换为运动方程的广义力。
-
新研究通过关注每轮违规来针对道德强化学习代理
一篇新研究论文提出,通过关注每轮分布而非平均性能来训练强化学习代理以展现道德行为。该研究在Craftax基准测试中比较了四种训练方法,发现一种在预期标量回报(ESR)标准下优化每轮非补偿效用的方法最有效。与允许违规平均化或在最坏情况下超出预算的其他方法不同,这种ESR方法几乎确保了在每一轮中都满足规定的违规预算。
-
新的RCI框架通过稀疏反馈增强安全离线强化学习
研究人员开发了一个名为基于重分配的成本推断(RCI)的新框架,以改进安全离线强化学习。该方法通过将轨迹级别的停止信号转换为密集的每步成本标注来解决稀疏反馈的挑战。RCI框架在理论上保留了最优策略集,同时在实践中增强了成本Critic的学习。在高速公路驾驶和机器人操作任务上的实验表明,与现有基线相比,RCI显著降低了违规率。
-
新研究探索最大均值差异的 Wasserstein 梯度流
研究人员发表了一篇论文,详细介绍了使用能量核的最大均值差异(MMD)的 Wasserstein 梯度流。该研究解决了将标准梯度流理论应用于非光滑核的挑战,尤其是在更高维度的情况下。论文在特定条件下证明了概率密度的全局适定性,并探讨了相关的 N 粒子系统的行为,包括非碰撞性质和收敛到连续流。
-
新研究探索统一路由以实现自适应 LLM 效率 · 跟踪 2 个来源
两篇新研究论文探讨了通过根据令牌复杂度动态调整计算资源来优化大型语言模型效率的方法。第一篇论文《线性注意力架构》比较了各种线性注意力机制,发现 Kimi Delta Attention with Muon 的验证损失最低,而纯 Gated DeltaNet 堆栈的训练吞吐量最高。这项工作还引入了跨层值路由(CLVR)来提高性能。第二篇论文《TriRoute》提出了一个统一的学习路由系统,该系统为每个令牌联合调整注意力分辨率、专家选择和…
-
新的MAMO系统利用多智能体强化学习解决多目标优化问题
研究人员推出了一种新颖的多智能体强化学习系统MAMO,旨在解决多目标约束优化问题。传统方法通常使用手动选择的权重将成本和约束违反情况嵌入到单一标量奖励中,这在动态环境中可能存在问题。MAMO旨在通过将奖励权重选择视为一个学习问题来解耦任务执行和目标设计,为更自主和鲁棒的解决方案铺平道路。
-
环境AI用于物理模拟代码生成
环境AI正被探索用于生成和执行物理模拟代码的潜力。该概念涉及向AI提供模型的拉格朗日量,使其能够生成模拟代码并呈现结果。此应用可以通过自动化复杂的计算任务,极大地帮助物理研究。