PulseAugur
实时 21:37:38
实体 A/B testing

A/B testing

PulseAugur coverage of A/B testing — every cluster mentioning A/B testing across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 17
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 10
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. RESEARCH · CL_222846 ·

    GNNs通过多哈希嵌入和时序采样扩展至好友推荐

    研究人员开发了一个可扩展的图神经网络(GNN)系统,用于在大型社交图上进行好友推荐,解决了生产环境中的挑战。该系统利用多哈希ID嵌入,将嵌入表大小显著减小了98%以上,同时保持了排名质量。此外,它通过时间戳排序的CSR存储和二分查找实现了时序邻居采样,大幅降低了采样成本。在线A/B测试表明,与现有系统相比,推荐的好友添加量增加了16%,唯一的好友添加者增加了11.5%。

  2. TOOL · CL_205616 ·

    新的离线评估任务预测排名系统展示份额变化

    研究人员引入了“展示份额预测”作为排名系统的一项新颖的离线评估任务,旨在预测新模型在在线 A/B 测试之前会如何将展示份额分配给不同的优化目标。该方法解决了标准离线指标可能无法捕捉到可能降低下游效用的展示份额分配变化的问题。所提出的框架利用了结构因果模型和统计学习方法,实验表明,对于已知模型,随机森林模型在历史数据上将 L1 误差降低了 49%,但对于未见过模型的性能有所不同。

  3. TOOL · CL_206747 ·

    Together AI 支持在生产环境中对 LLM 端点进行 A/B 测试

    Together AI 推出了一项新功能,允许用户直接在 LLM 的端点上进行 A/B 测试。此功能使开发人员能够将实时流量分配给一个对照模型和最多 20 个变体,并根据用户互动而非基准来衡量实际性能。该平台在端点级别管理流量路由和用户群划分,简化了流程,并防止实验逻辑与应用程序代码纠缠在一起。

  4. TOOL · CL_203512 ·

    开发者使用 A/B 测试优化 LLM 生成的 YouTube 标题

    一位开发者详细介绍了他们使用大型语言模型 (LLM) 自动生成 YouTube 视频标题和描述的经验,在客观评估 AI 生成内容质量方面面临挑战。为解决此问题,他们实施了一个 A/B 测试框架来量化评估 LLM 输出,设计实验将不同的标题展示给用户并跟踪点击率等参与度指标。这种数据驱动的方法能够迭代优化 LLM 提示和模型,从而根据真实用户反馈形成一个闭环,持续提高内容质量。

  5. COMMENTARY · CL_199210 ·

    Spotify探索LLM在A/B测试自动化中的应用

    Spotify的工程博客探讨了大型语言模型(LLMs)在自动化和增强A/B测试过程中的潜力。文章讨论了LLMs如何分析用户行为、预测结果,甚至生成测试变体,从而可能带来更高效、更有洞察力的实验。

  6. TOOL · CL_193738 ·

    研究发现LLM A/B测试预测可靠性面临挑战

    一篇新的研究论文探讨了大型语言模型在预测网页设计A/B测试结果方面的有效性。研究发现,虽然Gemini 3 Flash模型可以与测试结果达成中等程度的一致,但其预测往往基于非显著性测试。即使只关注统计学上的显著结果,该模型的表现也尚无定论。研究还指出,转化率优化(CRO)领域的人类专家也表现出类似的局限性,他们之间的共识度高于与实际测试结果的一致度,这表明共识本身并不等同于预测准确性。

  7. TOOL · CL_167935 ·

    新引擎为确保准确的因果推断而拒绝回答

    为了解决在商业分析中确定真正因果关系所面临的挑战,尤其是在无法进行 A/B 测试的情况下,开发了一个新的因果推断引擎。该引擎构建因果图,将变量分类为混淆变量、中介变量或对撞变量,指导在分析中是否需要调整它们。一个突出的关键特性是该引擎能够识别何时无法提供可靠的估计,并拒绝回答以防止得出误导性结论。使用已知真实因果效应的合成数据来评估该引擎的性能。

  8. TOOL · CL_167247 ·

    生成模型与自适应测试提升广告创意表现

    研究人员开发了一种将生成模型与自适应测试相结合的广告创意优化新工作流程。该方法在离线阶段使用基于历史A/B测试训练的预测模型来优化和排序生成模型产生的变体。然后,在在线自适应实验中评估最佳候选创意,现场实验表明,与人工创作的创意相比,该方法可显著提高参与率。

  9. RESEARCH · CL_147466 ·

    新的 A/B 测试方法通过策略重叠降低方差 · 跟踪 2 个来源

    研究人员开发了一种新颖的实验协议,通过策略重叠降低方差来加速 A/B 测试。该方法利用 $\Delta$-Off-Policy Estimation 来获得平均处理效应的无偏估计,在策略具有共同支持时优于标准的均值差估计量。该方法有望对推荐系统、信息检索管道和大型语言模型界面的评估产生重大影响。

  10. COMMENTARY · CL_122072 ·

    新的指南警告称 A/B 测试可能误导特征影响

    最近一篇文章强调,A/B 测试(通常被认为是特征发布中因果推断的黄金标准)可能会产生误导,如果其基本假设没有得到仔细审查的话。该文以一个虚构的食谱应用 ForkCast 及其 AI Meal Planner 功能为例,说明了选择加入的功能如何可能扭曲结果。那些主动选择使用新功能的用户可能已经对产品的领域更加投入,从而导致参与度指标虚高,而这并不一定能反映该功能对更广泛用户群体的真实因果影响。

  11. TOOL · CL_123199 ·

    新的A/B测试方法提高了算法比较的准确性

    一篇新的研究论文提出了一种改进的算法比较方法,特别是在在线服务的A/B测试背景下。研究表明,传统的A/B测试有时可能不如离线评估准确,因为其样本均值估计量缺乏正相关性。研究人员引入了一种新颖的估计量,通过使用一个假设的中间算法来故意诱导这种正相关性,从而减少关键的选择错误。实验表明,这种新方法可以用一半的A/B测试数据达到与现有方法相同的准确性。

  12. TOOL · CL_121229 ·

    LLM搜索评估通过历史用户数据得到改进 · arXiv

    研究人员开发了一种使用大型语言模型(LLM)评估搜索引擎结果的新方法,该方法整合了历史用户交互数据。这种“基于行为”的方法使用查询相关性印象(QRI)卡来为LLM提供经验证据,从而提高它们将相关性判断与实际用户偏好保持一致的能力,尤其是在处理模糊或长尾查询时。在Spotify进行的评估中,该方法将与用户偏好的匹配度提高了约5%,并在解决分歧案例方面显示出91%的相对改进。该方法在多语言数据集上与人类判断的相关性更强,并且与实际A/B测…

  13. TOOL · CL_96126 ·

    新框架验证大语言模型可作为A/B测试的代理

    已开发出一个新的统计框架,用于解决使用大语言模型(LLM)替代人类参与者进行A/B测试的问题。该框架借鉴了代理终点理论,以评估LLM结果何时能准确恢复在人类群体中测量的处理效应。它引入了识别平均处理效应的条件,并提供了用于证伪过往实验代理性的诊断方法,同时强调人类实验对于新干预措施仍然至关重要。

  14. TOOL · CL_62086 ·

    因果机器学习为 B2B 收入优化提供解决方案

    传统的 A/B 测试由于样本量小和销售周期长,在 B2B 收入优化方面通常效果不佳。本文提出使用因果机器学习,特别是倾向得分匹配,来分析历史 CRM 数据。该方法可以克服“防御性折扣”引入的偏差,即为了留住客户而非随机地给予折扣,从而更准确地评估销售策略的有效性。

  15. TOOL · CL_43799 ·

    Vercel Edge Config 为 Shopify A/B 测试提供支持,点击率提升 18%

    一位开发者分享了使用 Vercel Edge Config 为 Shopify 店铺进行的五种 A/B 测试策略。这些测试通过最小的代码更改实现,重点关注英雄区文案、地理位置定向的免费送货、固定的号召性用语按钮、价格显示格式以及禁用不稳定的组件等元素。作者报告称,点击率、购买意向和加入购物车操作均有显著提升,并强调了 Edge Config 在无需进行完整网站重建的情况下进行实时调整的速度和效率。

  16. RESEARCH · CL_30618 ·

    新框架增强了模型误设下的 A/B 测试鲁棒性

    研究人员开发了一种用于 A/B 测试的鲁棒序贯实验设计新框架,专门解决模型误设带来的挑战。该方法旨在通过限制估计处理效应的均方误差最坏情况来提高样本效率。该框架的有效性已通过合成数据和一家主要科技公司的真实数据集得到证明。

  17. COMMENTARY · CL_07459 ·

    游戏新闻报道ARC Raiders任务和詹姆斯·邦德演员选角

    本文讨论了A/B测试中常见的错误以及领先公司如何确保生产中的成功实验。它强调了理解看似成功的测试在广泛部署时为何可能失败的重要性。