研究人员开发了GALA,一种用于推荐系统中自适应多模态表示的新型三阶段流水线,已在淘宝拍买部署。该系统通过引入中间的“生成式强化学习对齐”阶段,解决了图像、文本和用户交互等异构数据融合的挑战。该阶段使用奖励驱动优化(GRPO)来改进多模态嵌入,使其更好地与用户行为对齐,弥合了预训练和微调之间的差距。GALA已在生产环境中实施,服务于超过2亿日活跃用户,并在离线指标和可衡量的订单量增长方面取得了显著改进。 AI
影响 该系统的部署及其在增加订单量方面取得的成功,为改进大规模推荐系统中的多模态表示指明了方向。
排序理由 该集群描述了一篇研究论文,详细介绍了新系统(GALA)及其在实际应用中的部署。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →