openness
PulseAugur coverage of openness — every cluster mentioning openness across labs, papers, and developer communities, ranked by signal.
-
新的CANDOR度量揭示了冻结AI编码器的弱点
研究人员开发了CANDOR,这是一种新的不一致性度量,旨在更准确地评估冻结基础编码器的能力。与以前的方法不同,CANDOR使用对称、等大的银行将机会水平固定在精确的50%,纠正了由发现的不平等流行度引入的偏差。通过在22个编码器和来自不同领域的605,443张图像上进行广泛测试,CANDOR显示,虽然没有编码器是完全盲目的,但所有编码器在辨别特定发现方面都表现出弱点,其性能通常低于预期。
-
新的CANDOR指标揭示了冻结AI编码器的弱点
一种名为CANDOR的新指标已被开发出来,用于评估机器学习中的冻结基础编码器,解决了先前受数据普遍性影响的方法的局限性。CANDOR使用等大银行来确保一半的固定机会水平,从而更准确地评估编码器辨别特征的能力。跨大量数据集和编码器的实验显示,虽然没有编码器是完全盲目的,但许多编码器的表现都很弱,有些甚至在识别鸟类物种或青光眼等特定任务上的表现比随机权重还要差。
-
新方法使用OCEAN框架映射和控制LLM个性特征
研究人员开发了一种名为“Persona Cartography”的方法来衡量和控制大型语言模型(LLM)的个性特征。通过改编OCEAN框架(开放性、尽责性、外向性、宜人性、神经质),他们可以训练低秩适配器来放大或抑制40亿到320亿参数模型中的特定特征。这些适配器在模型规模扩展时对特征表现出很大程度上单调的影响,并且可以累加组合,影响诸如沮丧和谄媚等与安全相关的行为。该方法还包括一个无监督流程,用于发现人类心理测量学未预定义的、可解释的行为因素。
-
Databricks 概述评估企业分析平台的标准
Databricks 发布了一份评估企业分析平台的指南,强调了简单 BI 工具和综合平台之间的区别。该公司认为,真正的企业平台在一个单一基础上统一数据、分析、AI 和治理,这对于长期的数据战略至关重要。Databricks 建议进行严格的评估过程,包括使用实际数据进行测试,对三年内的总体拥有成本进行建模,并使用供应商问题库来确保平台满足超越基本功能的需求。
-
新研究推进机器学习的策略外评估技术
两篇新研究论文探讨了机器学习中策略外评估(OPE)的高级技术,这是一个使用现有数据评估新策略性能的关键过程。第一篇论文引入了“Quotient DAGs”,用于处理奖励仅取决于无序项目集但生成过程是有序的情况,从而减少了干扰方差。第二篇论文“CANDOR”提出了一种双重稳健的OPE估计器,通过将注释纳入奖励模型组件,有效地利用了不完美的专家标注反事实样本,尤其适用于医疗保健应用。