A/B testing
PulseAugur coverage of A/B testing — every cluster mentioning A/B testing across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的 A/B 测试方法通过策略重叠降低方差 · 跟踪 2 个来源
研究人员开发了一种新颖的实验协议,通过策略重叠降低方差来加速 A/B 测试。该方法利用 $\Delta$-Off-Policy Estimation 来获得平均处理效应的无偏估计,在策略具有共同支持时优于标准的均值差估计量。该方法有望对推荐系统、信息检索管道和大型语言模型界面的评估产生重大影响。
-
新的指南警告称 A/B 测试可能误导特征影响
最近一篇文章强调,A/B 测试(通常被认为是特征发布中因果推断的黄金标准)可能会产生误导,如果其基本假设没有得到仔细审查的话。该文以一个虚构的食谱应用 ForkCast 及其 AI Meal Planner 功能为例,说明了选择加入的功能如何可能扭曲结果。那些主动选择使用新功能的用户可能已经对产品的领域更加投入,从而导致参与度指标虚高,而这并不一定能反映该功能对更广泛用户群体的真实因果影响。
-
新的A/B测试方法提高了算法比较的准确性
一篇新的研究论文提出了一种改进的算法比较方法,特别是在在线服务的A/B测试背景下。研究表明,传统的A/B测试有时可能不如离线评估准确,因为其样本均值估计量缺乏正相关性。研究人员引入了一种新颖的估计量,通过使用一个假设的中间算法来故意诱导这种正相关性,从而减少关键的选择错误。实验表明,这种新方法可以用一半的A/B测试数据达到与现有方法相同的准确性。
-
LLM搜索评估通过历史用户数据得到改进 · arXiv
研究人员开发了一种使用大型语言模型(LLM)评估搜索引擎结果的新方法,该方法整合了历史用户交互数据。这种“基于行为”的方法使用查询相关性印象(QRI)卡来为LLM提供经验证据,从而提高它们将相关性判断与实际用户偏好保持一致的能力,尤其是在处理模糊或长尾查询时。在Spotify进行的评估中,该方法将与用户偏好的匹配度提高了约5%,并在解决分歧案例方面显示出91%的相对改进。该方法在多语言数据集上与人类判断的相关性更强,并且与实际A/B测…
-
新框架验证大语言模型可作为A/B测试的代理
已开发出一个新的统计框架,用于解决使用大语言模型(LLM)替代人类参与者进行A/B测试的问题。该框架借鉴了代理终点理论,以评估LLM结果何时能准确恢复在人类群体中测量的处理效应。它引入了识别平均处理效应的条件,并提供了用于证伪过往实验代理性的诊断方法,同时强调人类实验对于新干预措施仍然至关重要。
-
因果机器学习为 B2B 收入优化提供解决方案
传统的 A/B 测试由于样本量小和销售周期长,在 B2B 收入优化方面通常效果不佳。本文提出使用因果机器学习,特别是倾向得分匹配,来分析历史 CRM 数据。该方法可以克服“防御性折扣”引入的偏差,即为了留住客户而非随机地给予折扣,从而更准确地评估销售策略的有效性。
-
Vercel Edge Config 为 Shopify A/B 测试提供支持,点击率提升 18%
一位开发者分享了使用 Vercel Edge Config 为 Shopify 店铺进行的五种 A/B 测试策略。这些测试通过最小的代码更改实现,重点关注英雄区文案、地理位置定向的免费送货、固定的号召性用语按钮、价格显示格式以及禁用不稳定的组件等元素。作者报告称,点击率、购买意向和加入购物车操作均有显著提升,并强调了 Edge Config 在无需进行完整网站重建的情况下进行实时调整的速度和效率。
-
新框架增强了模型误设下的 A/B 测试鲁棒性
研究人员开发了一种用于 A/B 测试的鲁棒序贯实验设计新框架,专门解决模型误设带来的挑战。该方法旨在通过限制估计处理效应的均方误差最坏情况来提高样本效率。该框架的有效性已通过合成数据和一家主要科技公司的真实数据集得到证明。
-
游戏新闻报道ARC Raiders任务和詹姆斯·邦德演员选角
本文讨论了A/B测试中常见的错误以及领先公司如何确保生产中的成功实验。它强调了理解看似成功的测试在广泛部署时为何可能失败的重要性。