Spearman's rank correlation coefficient
PulseAugur coverage of Spearman's rank correlation coefficient — every cluster mentioning Spearman's rank correlation coefficient across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
更丰富的视频表征不一定能更好地实现人类对城市互动的认知对齐
一篇题为“Sidewalk Moments”的新研究论文探讨了更详细的视觉表征是否能更好地与人类对城市互动活动的感知对齐。研究人员利用城市步行视频发现,虽然更丰富的视频特征显示出更强的连续对齐性,但在高互动与低互动瞬间的二元分类任务中,更简单的时序平均图像(TAIs)表现相当或更好。亚马逊Mechanical Turk上的人类研究证实了这种相当性,表明感知基础的时序压缩可以作为训练感知评分模型的全视频编码的可行替代方案。
-
新框架Code-MUE衡量代码大语言模型的(不)确定性
研究人员开发了Code-MUE,一个旨在衡量代码大语言模型(LLMs)不确定性的新框架。这个纯粹的黑盒系统利用基于执行的语义交互图,通过分析运行时行为和计算解空间的冯·诺依曼熵来评估不确定性。涉及八个最先进大语言模型的实证研究表明,Code-MUE能有效关联功能正确性,在软件工程工作流的风险检测方面优于传统的词汇和基于嵌入的方法。
-
Rank-Then-Act框架在没有环境奖励的情况下学习控制策略
研究人员开发了一个名为Rank-Then-Act (RTA) 的新颖框架,使强化学习代理能够在没有显式环境奖励的情况下从视频演示中学习控制策略。RTA利用视觉语言模型作为序数评分器,预测视频序列中的进展。然后,该评分器用于生成基于相关性的强化学习奖励信号,该信号在各种任务和环境中表现出稳定的性能,包括离散控制基准和连续控制任务。
-
LLM搜索评估通过历史用户数据得到改进 · arXiv
研究人员开发了一种使用大型语言模型(LLM)评估搜索引擎结果的新方法,该方法整合了历史用户交互数据。这种“基于行为”的方法使用查询相关性印象(QRI)卡来为LLM提供经验证据,从而提高它们将相关性判断与实际用户偏好保持一致的能力,尤其是在处理模糊或长尾查询时。在Spotify进行的评估中,该方法将与用户偏好的匹配度提高了约5%,并在解决分歧案例方面显示出91%的相对改进。该方法在多语言数据集上与人类判断的相关性更强,并且与实际A/B测…
-
新流程增强ASR鲁棒性,词错误率降低55%
研究人员开发了一种新颖的双门诊断流程,以增强自动语音识别(ASR)系统在对抗性和良性扰动下的鲁棒性。该流程包含一个双面原子审计和一个基于排名的竞赛,旨在认证令牌存在和对抗性排除,从而提高声学安全性。在四种架构上的评估显示,词错误率(WER)相对降低高达55%,并且置信度得分与WER之间的相关性降低。
-
研究论文强调了射线追踪在城市射频模拟中的局限性
一篇新的研究论文探讨了在城市环境中,基于学习的射频(RF)任务的射线追踪模拟的局限性。在罗马进行的研究发现,虽然精确的几何形状和天线模型对模拟保真度至关重要,但准确捕捉城市残余噪声仍然是可迁移射频模拟的一个重大挑战。研究强调,天线的位置和方向对模拟精度有决定性影响,简单的优化可将相关性提高高达130%,并将定位误差降低三分之一。
-
大型语言模型在评估中难以衡量学生熟练程度的差异
一项发表在arXiv上的新研究调查了大型语言模型(LLMs)在教育评估中衡量项目区分度的能力。研究人员使用两种方法评估了42个LLMs:直接预测区分度值,以及使用LLM答案作为合成学生反应的基于反应的校准。研究结果表明,虽然LLMs显示出与项目区分度相关的某些非随机信号,但它们尚未能可靠地捕捉评估项目如何区分不同熟练程度的学生,表现最好的模型仅达到0.241的Spearman相关系数。
-
新数据集XPASS-Vis支持跨领域个性化图像美学评估
研究人员推出了XPASS-Vis,一个旨在探索跨不同视觉领域的个性化图像美学评估的新型数据集。该数据集包含来自艺术、时尚和风景类别的 6,500 多张图像,由 129 名标注者进行评分。使用无监督域自适应进行的初步实验表明,个性化美学偏好可以以中等程度的成功跨领域转移,尽管在 PIAA 特定自适应策略方面仍存在显著差距。
-
MTCurv 深度学习方法测绘嘈杂显微镜图像中的微管曲率
研究人员开发了 MTCurv,一个新颖的深度学习框架,旨在直接从嘈杂的荧光显微镜图像中测绘微管曲率。该方法通过将问题重新表述为回归任务,绕过了容易出错的传统分割步骤。该框架利用了基于注意力的残差 U-Net 和梯度感知损失函数,即使在具有挑战性的成像条件下也能准确预测曲率,为细胞力学研究提供了实用的工具。