Jacobian matrix
PulseAugur coverage of Jacobian matrix — every cluster mentioning Jacobian matrix across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
机器人学研究引入基于结果的表示学习
研究人员开发了一种在机器人学中学习操纵充分表示的新方法,该方法侧重于动作结果而非密集几何状态。该方法利用了带有KL正则化项的动作条件结果瓶颈,旨在保留可接受动作的结果分布。该系统在抓取选择和主动视点选择等各种任务中都显示出有效性,与重建几何方法相比,抓取成功率的AUC显著提高。
-
新的 Jacobian Lens 工具测试 AI 模型是否使用内部信号
研究人员开发了一种新的可解释性工具,称为 Jacobian lens,旨在确定模型内部信号是否在其决策过程中被积极使用。与主要识别相关性的 logit lens 或 tuned lens 等先前方法不同,Jacobian lens 通过分析模型的平均 Jacobian 矩阵来实现可测试的干预。这使得研究人员能够选择性地编辑内部状态并观察预测的行为变化,为信号的功能作用提供了更强的证据。
-
新框架增强了不确定性下的电网稳定性
研究人员开发了一个新的框架,用于在不确定性下确保交流最优潮流系统的稳定性。该方法利用了一种新颖的几何方法,将稳定性要求转化为“提升”变量空间中的凸约束。通过优化样本安全半径,该框架证明了不确定性球体保持在稳定区域内,提供了到故障的距离的认证下界。数值研究证实了该方法在增强系统鲁棒性方面的有效性。
-
新的SC-NOs提高了神经网络在复杂PDE建模中的准确性
研究人员开发了敏感性约束神经算子(SC-NOs),以提高用于建模偏微分方程(PDE)的神经网络的可靠性和数据效率。通过引入雅可比监督,SC-NOs提高了正向预测和反向建模的能力,尤其是在高维输入方面。该方法在平流-扩散和RANS-Spalart-Allmaras等基准测试中表现出更高的准确性和成本效益,并有望用于海啸源反演等实时应用。
-
新理论解释用于语言模型解释的雅可比矩阵透镜
研究人员开发了一个数学框架,以更好地理解雅可比矩阵透镜(J-lens),这是一种用于解释语言模型内部表征的方法。该研究为J-lens提供了理论基础,将其视为一个近似未来读出的因果传递算子。分析表明,雅可比矩阵的能量分布是稀疏且集中的,导致了短视界和稀疏概念的预测。这一理论洞见促使了对J-lens的改进建议,增强了其在模型推理过程中可视化概念的能力。
-
新方法增强了本地差分隐私下的数据效用
研究人员开发了一种新颖的方法来提高在本地差分隐私(LDP)下收集的数据的效用。该方法选择性地减少数据中最与特定任务相关的子空间中的噪声,而不是在所有维度上应用均匀噪声。通过使用公共模型的雅可比矩阵识别这些关键子空间,该方法将噪声分布从各向同性重塑为各向异性,从而在保持隐私保证的同时提高了数据效用。实验表明,在图像分类任务上准确性得到了显著提高。
-
新研究表明归一化层可为序列标注器提供全局上下文
一篇新研究论文挑战了对卷积序列标注器中上下文的传统理解。该研究表明,序列池化归一化层可以提供全局上下文,绕过了模型感受野的限制。这种源自层雅可比矩阵的归一化机制显著提高了序列标注任务的性能,尤其是在标签运行时间长的情况下,如在合成数据和1000 Genomes Project的实验所示。
-
神经算子无法可靠地为PDE的牛顿求解器进行热启动
研究人员发现,在使用神经算子为非线性偏微分方程(PDE)的牛顿求解器进行热启动时存在一个关键缺陷。虽然神经算子可以降低测试误差,但它们仍可能产生离散雅可比矩阵不定的初始状态,导致求解器失败。这个问题之所以出现,是因为算子可能会将物理属性(例如超弹性问题中的体积变化)分散到远离其正确值的位置。为了纠正这种谱问题,研究人员提出了一种新颖的微调阶段,该阶段通过对算子施加离散能量惩罚,而无需额外的求解数据,从而在先前方法失败的加载范围内实现了…
-
FishBack 方法使用非欧几里得几何改进 Transformer 激活定向
研究人员开发了一种名为 FishBack 的新方法,以改进 Transformer 中的激活定向,这是一种无需更新参数即可修改语言模型行为的技术。现有方法由于激活空间是欧几里得空间的错误假设,通常不稳定,并且会干扰不相关的行为。FishBack 通过使用 softmax 层的 Fisher 信息度量,通过雅可比矩阵拉回,推导出最佳定向,从而纠正了这一点。该方法通过减少目标外失真,尤其是在几何校正影响最大的早期和中间层,在 GPT-2 …
-
新研究为神经网络训练提供理论收敛保证
两篇新研究论文探讨了神经网络训练的理论基础。第一篇论文通过引入广义 Lipschitz 光滑性条件,为通用前馈神经网络中的梯度下降建立了收敛保证。第二篇论文提出了一种深度神经网络训练的统一优化框架,通过 Legendre 函数和共轭变换推广了凸性和光滑性,并引入了具有理论收敛率的广义梯度下降和 SGD。
-
新研究提出通过函数正交性实现无监督解耦
一篇新的研究论文提出了一种新颖的无监督解耦表示学习方法,将潜在概念构建为通过局部正交方向影响观测值的因素。该方法通过对生成映射的雅可比矩阵施加正交性约束来形式化,旨在在不依赖统计独立性或因果假设的情况下,在非线性生成模型中实现可辨识性。使用正交性正则化归一化流的实验已在经验上验证了该理论,展示了对真实因素的可靠恢复,并为变分自编码器(VAE)的有效性提供了见解。这些发现挑战了先前关于无监督解耦不可能性的说法,并提出了一种有原则的替代方案。
-
Gemma 2-2B研究发现主动特征平面具有更少全纯性
一篇新发表在arXiv上的研究论文调查了Gemma 2-2B模型特定特征平面的全纯性集中情况。该研究在检查数据之前预先注册了其方法论和分析规则。与主动特征平面会表现出更多全纯性的预测相反,结果显示情况恰恰相反,主动平面携带的全纯性少于对照组。该论文总结认为,这是一个可审计的操作性反转,而非确定的因果声明,其根本原因仍有待进一步研究。
-
Google 的 Gemma-4-E4B-it 模型内部科学表征可读且可控
研究人员开发了读取和控制开源语言模型 google/gemma-4-E4B-it 中材料科学机制内部表征的方法。该研究表明,概念在单个隐藏状态中是可辨识的,构成方向通过状态转换传达,并且特定的内部表征可以对工程答案产生因果影响。通过使用雅可比读出和因果干预,该团队能够识别机制家族,甚至操纵模型的输出来符合物理定律。
-
新研究强调多模态对比学习中的几何保持
研究人员发现,编码器雅可比矩阵的条件化对于有效的三模态对比学习至关重要,该方法超越了简单的图像-文本对,可对三种或更多模态进行对齐。条件化不良的编码器可能因雅可比矩阵条件数爆炸而导致对齐效果下降。该研究引入了几何保持编码器(GPEs),通过正则化直接对雅可比矩阵进行条件化,并利用LeakyReLU激活和残差路径等修改来改善几何特性。这些改进提高了在各种数据集上的检索和线性探测性能,表明多模态对比学习依赖于客观表达能力和编码器的几何特性。
-
研究人员探索“J空间”作为语言模型的潜意识
研究人员探索了语言模型中的“J空间”概念,他们将其比作这些AI系统的潜意识。这种使用“雅可比透镜”的方法,可以更深入地了解模型的内部过程,揭示其最终输出或思维链推理中未明确表达的想法。该方法旨在揭示模型中隐藏的认知状态。
-
新的双曲神经网络闭合改进了辐射传输模拟
研究人员开发了一种新颖的双曲神经网络闭合模型,旨在提高辐射传输模拟的准确性和稳定性。该新模型解决了M1方法中的一个关键问题,即不受约束的机器学习闭合可能由于非实特征速度导致数值求解器崩溃。通过神经网络参数化雅可比矩阵,确保特征值是实数,闭合模型保证了稳定性。实验表明,这种方法不仅提高了比经典方法更优的闭合精度,而且在间断伽辽金模拟中也提高了整体解的精度和稳定性。
-
Anthropic 发布 J-Lens 以可视化 LLM 的内部思考过程
Anthropic 推出了一种名为 Jacobian Lens (J-Lens) 的新可解释性技术,用于可视化其大型语言模型(特别是 Claude)的内部思考过程。J-Lens 揭示了模型中一个隐藏的“J-Space”,概念和词语在此被激活,然后才被明确生成,从而提供了对其链式思考之外的推理过程的洞察。这一进展对于开发人员调试模型行为、理解失败模式以及确保模型遵循预期的推理路径特别有用,Anthropic 与 Neuronpedia …
-
Anthropic 为 Claude AI 的内部推理揭晓“J-space”
Anthropic 为其 Claude 模型推出了一种新的内部机制,称为“J-space”,它允许 AI 在不产生外部输出来处理和存储信息。这种 J-space 被描述为一个工作空间,Claude 可以在其中执行推理步骤、发现错误并识别概念,这与人类认知和有意识的访问有相似之处。虽然 J-space 并不能表明主观体验,但对于多步推理等某些复杂任务至关重要,并且可以揭示模型中隐藏的目标或对分阶段场景的意识。
-
新方法使用盒子分解计算连续积分R2指标
研究人员开发了一种计算连续积分R2指标的新方法,这是用于多目标优化和数据库天际线选择的经典R2指标的改进。该方法通过透视映射将计算转化为在锚定轴对齐盒子并集上的积分。这使得现有的超体积算法能够适应积分R2计算,提供与输出相关的计算复杂度。
-
新的双边缘图增强了可解释的糖尿病视网膜病变分级
研究人员开发了一种新颖的双边缘空间-雅可比图像图,以提高从眼底图像进行糖尿病视网膜病变(DR)分级的可解释性。该方法将每个眼底照片表示为一个图节点,整合了四个不同的数据流:血管信息、病变证据图、对比图像嵌入和形态学生物标志物。该图包含空间边缘以编码血管-病变几何形状,以及雅可比边缘以模拟嵌入-生物标志物敏感性,从而能够超越简单的分类,更细致地理解疾病表现。