feature engineering
PulseAugur coverage of feature engineering — every cluster mentioning feature engineering across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
特征工程:提升机器学习模型性能的关键
机器学习中的特征工程旨在通过从现有数据创建新特征来提高模型性能。此过程对于提高机器学习模型的准确性和效率至关重要。有效的特征工程可以带来更好的洞察力和更稳健的预测。
-
LLM驱动的代理系统增强CTV内容发现
本文介绍了一个用于智能电视内容发现的LLM驱动的代理推荐系统。该系统解决了整合各种上下文信号(如热门话题和用户活动)的挑战,而传统的多阶段推荐系统难以处理这些信号。通过利用大型语言模型的推理能力,该系统可以自然地综合来自各种来源和结构的信息,从而减少了对广泛特征工程的需求。所提出的代理架构结合了LLM的灵活性和传统机器学习模型的性能,以克服推理延迟等实际限制并改进推荐任务。
-
作者认为,尽管有大型语言模型,特征工程仍然至关重要
即使大型语言模型(LLMs)兴起,特征工程对于机器学习模型仍然至关重要。作者认为,输入模型的特征质量对准确性的影响远大于算法本身的选择。虽然大型语言模型可以自动化部分特征提取,特别是从非结构化文本中提取,但它们并不能取代深思熟虑的特征工程的必要性,尤其是在处理结构化业务数据时。
-
Azure、AWS、GCP 上的 MLOps CI/CD 和特征工程 · 跟踪 2 个来源
该集群探讨了在 Azure、AWS 和 GCP 等主要云平台上实现 MLOps 中的 CI/CD 管道。它强调了 MLOps 与传统 DevOps 的区别,强调了特征工程和可扩展数据处理的重要性。Azure Databricks 结合 Apache Spark 和 Delta Lake 等技术,被认为是管理大规模特征工程和 MLOps 工作流的关键工具。
-
批处理层对实时欺诈检测的完整性至关重要
本文讨论了批处理层在维护实时欺诈检测系统完整性方面的重要作用。文章强调,虽然实时评分很重要,但强大的批处理流程对于重新审计和重新训练机器学习模型至关重要。这种方法有助于解决概念漂移等问题,并确保数据质量,最终实现更准确可靠的欺诈预防。
-
新的LLM编排多智能体框架增强BDaaS生命周期自动化
研究人员开发了一个新的大数据即服务(BDaaS)框架,该框架利用由中央LLM编排的多智能体系统。该系统旨在自动化和提高从摄取到部署后监控和漂移检测的整个数据工程和MLOps生命周期的可靠性。与现有的单智能体或仅AutoML方法相比,所提出的架构将任务分解为专门的智能体,增强了生命周期级别的编排、工件治理和人工监督。
-
新研究将神经网络 OOD 泛化与特征工程联系起来
研究人员发现,深度神经网络之所以常常无法学习到能够泛化到分布外 (OOD) 数据的表示,是因为它们无法将特征学习与数据生成过程的可识别性分离开来。研究表明,特征图、标签图和模型类的选择决定了假设的数据生成过程,并控制着 OOD 泛化,仅表示形式的改变就会导致 OOD 任务的性能差异巨大。该论文提出,成功的 OOD 推断不仅需要正确的特征,还需要能够表达目标和训练数据的模型类,并且这些数据能够覆盖相关的表示空间。