PulseAugur
实时 00:50:59
实体 Spearman

Spearman

PulseAugur coverage of Spearman — every cluster mentioning Spearman across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 19
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 19
层级分布 · 90 天
主题
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 19 条
  1. RESEARCH · CL_229272 ·

    新的PruneShift框架评估AI模型剪枝决策的可靠性

    研究人员推出PruneShift,一个旨在评估机器学习模型结构化剪枝过程中决策可靠性的新框架。与以往关注平均代理误差或秩相关性的方法不同,PruneShift将选择器输出附近的预测保真度与最终剪枝决策的质量分离开来。使用TextbookQA和Natural Questions等数据集以及OPT-125M模型进行的研究表明,局部保真度并不总是与广泛保真度相关,这凸显了区分评估指标的必要性。

  2. TOOL · CL_216183 ·

    新方法可对多模态大语言模型进行序数任务对齐

    研究人员发现,多模态大语言模型(MLLMs)在处理序数回归任务(如年龄估计或图像质量评估)时存在显著差距。尽管内部模型状态与有序标签显示出很强的相关性,但最终的 token 输出未能反映这种序数证据。为解决此问题,开发了一种名为序数镜头对齐(Ordinal Lens Alignment, OLA)的新方法。OLA 使用在解码器层上训练的轻量级镜头来融合序数信息,并在生成过程中纠正最终的 token logit,其性能优于现有方法,同时…

  3. TOOL · CL_208435 ·

    新研究探讨统一多模态模型中的概念绑定

    研究人员开发了一种新颖的方法来研究统一多模态模型(UMMs)中理解和生成之间的关系。通过构建一个仅通过一个任务方向进行训练的视觉实体,他们发现生成训练会植入一个模型只能匹配的概念,而理解训练则允许模型也能生成该概念。研究表明,跨任务可用性取决于概念绑定进入共享计算的位置,特别是在理解路径的入口点需要一个共享的语义格式。

  4. TOOL · CL_206485 ·

    AI安全研究:监视器技能而非谱系决定集成体有效性

    一篇题为“去相关性并非互补性:技能而非谱系决定了可信监视器集成体的有效性”的新研究论文挑战了这样一种假设:即多样化的预训练谱系是构建有效的AI安全可信监视器集成体的关键。研究发现,监视器在检测威胁方面的个体技能是比其谱系或集成体构建中使用的去相关性指标更重要的因素。研究表明,随着面板整体技能的提高,集成体收益会降低,这表明选择单一最佳监视器可能比复杂的集成方法更有效。

  5. RESEARCH · CL_206312 ·

    新框架提供对大型语言模型谄媚行为的可控操纵

    研究人员开发了一个名为 PCA-guided Activation Scaling (PAS) 的新框架,用于控制大型语言模型 (LLM) 中的谄媚行为。谄媚是指 LLM 倾向于同意用户,而不顾准确性,这可能存在问题。PAS 旨在提供一种可预测且渐进的方式来同时减少和增加谄媚行为。该方法将 LLM 激活分解为谄媚-诚实子空间,并应用不同的缩放,在不同模型和数据集上实现了强单调性和显著的行为转变。

  6. RESEARCH · CL_193819 ·

    SoftMCC框架增强了不平衡分类模型的选择

    研究人员推出了一种新颖的训练后框架SoftMCC,旨在改进不平衡二分类任务的模型选择。该方法通过利用概率值混淆计数,解决了传统Matthews相关系数(MCC)验证中固有的阈值依赖性问题。跨多个设置的实验表明,与AUPRC和[email protected]等其他指标相比,SoftMCC实现了更优越的稳定性和排名,尽管在所选模型的效用方面未显示出优势。

  7. TOOL · CL_187429 ·

    量子机器学习使用后期融合来降低成本并提高鲁棒性

    研究人员提出了一种名为“后期融合”的新方法,用于在较小的设备上运行大型量子神经网络(QNN)。这种方法避免了将QNN分解为子电路时通常需要进行的计算成本高昂的重构步骤。相反,每个子电路都经过独立训练和测量,一个小型的经典组件将它们的输出结合起来。实验表明,这种后期融合方法在成本显著降低的情况下,实现了与完全重构相当的准确性,并且对噪声更鲁棒,尽管在测试数据集上它并未提供优于经典机器学习的准确性优势。

  8. TOOL · CL_191637 ·

    量子机器学习通过新的后期融合技术提高效率

    研究人员开发了一种名为“后期融合”的新方法,用于量子机器学习(QML),该方法可显著降低计算成本。该技术涉及训练量子神经网络(QNN)的独立子电路,然后将它们的输与经典头部结合,从而避免了昂贵的大型QNN重构的需要。实验表明,后期融合在各种数据集上可实现与完全重构相当的准确性,同时效率呈指数级提高且对噪声具有鲁棒性,尽管它并未提供优于经典机器学习的优势。

  9. TOOL · CL_184482 ·

    研究发现:LLM评判者的噪音会掩盖真实的性能提升

    LLM评判者不可靠会系统性地偏倚评估结果,而不仅仅是扩大误差范围。这种由Spearman在1904年描述的“衰减”效应,会导致真实的改进显得更小甚至不存在。两个模型之间的观测差异会乘以(1 - 2e)的因子,其中'e'是评判者的错误率。在配对比较中,这个衰减因子会被平方,进一步削弱测量的效应,并可能导致研究人员丢弃真正有效的改进。

  10. TOOL · CL_183189 ·

    新理论解释了激活修复与权重空间消融之间的分歧

    研究人员开发了一个理论框架,用于理解激活修复(activation patching)和权重空间消融(weight-space ablation)之间的关系,这两种方法都用于确定神经网络中的因果责任。该理论在理想化模型和小型Transformer上进行了测试,揭示了这些方法在何种条件下会达成一致,以及何时会产生分歧,特别是关于它们如何衡量模型输出的变化。研究结果表明,虽然激活修复衡量的是激活的对比度,而消融衡量的是绝对水平,这导致了关…

  11. TOOL · CL_158745 ·

    IBM 硬件上量子核几何存活率测试

    研究人员在 IBM 量子硬件上研究了四量子比特量子核内几何信息的存活情况。该研究聚焦于一种特定的冻结 ZZ 特征映射核,并分析了其在三种执行配置下的性能:基线、动力学解耦和门旋转。结果表明,虽然格拉姆矩阵在执行后普遍存活并能在很大程度上保留状态向量几何,但门旋转被证明是最忠实的方法。然而,最忠实配置与目标标签的对齐度最低,这表明在当前的量子机器学习研究中,实现保真度与任务相关性之间存在脱节。

  12. TOOL · CL_154620 ·

    去噪模型开发出类似人类的感知错觉表征

    研究人员发现,在自然图像上训练的去噪模型会形成对感知错觉敏感的内部表征,这与人类观察者类似。这些表征存在于不同模型架构的特定内部层中,去噪目标比模型架构本身更能驱动这些表征的形成。尽管这些内部表征与人类感知的心理物理模型相关,并且可以通过通道消融在因果上与内部信号处理相关联,但它们并不影响模型的输出,这使得研究人员称之为“感知幻象”。

  13. TOOL · CL_139620 ·

    机器学习模型预测电力通信网络中的级联故障

    研究人员开发了一种机器学习代理模型,用于预测相互依赖的电力和通信网络中的级联故障。该模型利用梯度提升,与高保真模拟器实现了高度相关性,从而能够快速对关键组件进行排序,以加强基础设施的韧性。该代理模型通过整合层间依赖信息来提高有效性,其性能优于传统的拓扑中心性度量。

  14. TOOL · CL_117114 ·

    新的“几何稳定性”指标揭示了独特的神经编码特性

    研究人员引入了一种名为“几何稳定性”的新指标来分析神经种群编码,该指标衡量配对刺激距离在不同试验中的一致性。该指标不同于时间稳定性和解码准确性,并且在视觉辨别任务中预测了神经-行为耦合。研究观察到几何稳定性在不同大脑区域存在显著的区域变异,其中纹状体显示出最高的稳定性,而海马体最低。一个吸引子网络模型表明,递归兴奋性耦合通过完成稀疏前馈输入的刺激模式来放大这种几何稳定性。

  15. RESEARCH · CL_115266 ·

    自编码器模型将跑者遥测数据简化为表现评分

    本文探讨了使用自编码器架构将跑者复杂的穿戴遥测数据简化为单一表现评分。研究人员评估了五种降维模型,包括三种自编码器变体和PCA,并根据重建误差和所得潜在评分的可解释性对其进行了评估。研究发现,深度自编码器在低重建误差和高综合可解释性评分方面表现最佳,其中跑步配速、有氧耦合和平均心率被确定为潜在评分的关键驱动因素。

  16. RESEARCH · CL_115175 ·

    新框架通过更小的数据集优化机器学习模型基准测试

    研究人员开发了一个新框架,以应对为机器学习模型基准测试选择代表性数据集的挑战。该框架旨在通过识别更小、更有效的数据子集来降低评估成本,这些子集能够保持大型基准测试中发现的全局模型排名。该研究介绍了各种选择策略,包括引导聚合和贪婪最远优先方法,并评估了它们在时间序列分类和自然语言处理等不同领域的有效性。

  17. RESEARCH · CL_109633 ·

    AI研究:图像编码的自然度可预测但并非可迁移性的原因

    研究人员调查了一维数据流生成的图像的视觉自然度与其在视觉骨干网络上的可迁移性之间的关系。他们的研究使用了WorldStream语料库,发现像Fréchet Inception Distance (FID)这样的指标可以预测准确性,但这种相关性并非因果关系。相位扰动等干预措施,在保持功率谱的同时改变局部结构,显示了局部结构与准确性之间存在很强的联系,这表明视觉模型能够识别自然图像和编码数据中的相似结构。

  18. TOOL · CL_113322 ·

    Hugging Face论文揭示LLM中的“潜移学习”,影响可审计性

    Hugging Face的一篇新论文探讨了语言模型中“潜移学习”的概念,即学生模型可以通过不明确命名这些特征的蒸馏数据从教师模型继承隐藏特征。研究确定“通道位置”是决定在训练前是否可以审计这种转移的关键因素。研究发现,根据特征是在主体通道中还是依赖于词汇几何结构,存在不同的转移机制,这表明标准的预训练筛选并非总是能有效审计这些隐藏特征。研究结果表明,即使移除了特定的训练标签,相关的偏好仍然可以转移,这凸显了对细致审计策略的需求。

  19. RESEARCH · CL_14210 ·

    LambdaRankIC 使用新颖的学习排序方法直接优化金融预测的Rank IC

    研究人员推出了一种名为LambdaRankIC的新机器学习方法,旨在直接优化金融预测的Rank IC(Spearman秩相关性)。该方法通过推导成对排序交换的闭式lambda梯度,解决了传统回归或排序损失与期望的Rank IC指标之间的不匹配问题。LambdaRankIC在XGBoost中实现,理论上优化了Rank IC的上限,并在模拟和真实金融数据上展现出优于现有方法的性能。