Maze-hard
PulseAugur coverage of Maze-hard — every cluster mentioning Maze-hard across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究挑战关于循环模型压缩的假设
研究人员调查了循环模型的压缩,这些模型重复应用相同的权重进行推理。与普遍的看法相反,累积的舍入误差并不是这些模型崩溃的唯一原因。相反,当循环稳定时,舍入误差会改变静止点,只有当这种变化超出容差时才会导致失败。这一见解可以预测模型的失败,并解释为什么有些模型能够恢复,因为具有 8 位权重的最终循环可以恢复答案。
-
新研究探索循环语言模型的效率提升
研究人员正在探索提高循环语言模型效率和性能的新方法。一种方法侧重于在循环状态中实现“不动点”,这可以降低训练和解码成本。这涉及到优化训练先验和输入注入技术,从而得到在保持准确性的同时需要更少内存和计算的模型。另一项研究调查了循环模型的模型压缩,发现舍入误差仅在模型循环不稳定时才会引起严重问题,这为预测和从压缩失败中恢复提供了新方法。
-
Winfree振荡神经网络展示参数效率
研究人员推出了一种新颖的动力学架构——Winfree振荡神经网络(WONN),该架构利用广义Winfree动力学进行计算和表示。这个新模型通过结构化的振荡相互作用在环面上演化表示,将基于相位的归纳偏置与灵活的交互机制相结合。WONN在各种任务上展示了具有竞争力或更优的性能和参数效率,包括CIFAR和ImageNet上的图像识别,以及Maze-hard和Sudoku上的复杂推理。
-
新框架衡量人工智能空间推理中的信息流
研究人员引入了一个名为“交互局部性”的新框架,用于衡量人工智能模型在空间推理任务中信息流动的过程。该框架分析计算是否保持局部化或跨越语义边界,并将其应用于HRM和TRM等分层和递归推理模型。研究发现,这些模型中的高级状态倾向于在局部写入信息,然后通过递归更新累积到更广泛的结构中,这种模式在具身3D模型模块边界处也得到了观察。