PulseAugur
中
实时 10:39:18
实体 MinHash LSH

MinHash LSH

PulseAugur coverage of MinHash LSH — every cluster mentioning MinHash LSH across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_228765 ·

    新的PUFFER管道加速了海量LLM训练数据的去重

    研究人员开发了PUFFER,一种用于大规模、持续演进的语言模型训练语料库的增量模糊去重新管道。PUFFER利用不可变的、带数据集标签的内存映射段进行高效的历史成员资格检查,并采用分层压缩策略来管理筛选扇出。与传统方法相比,这种方法显著降低了维护成本和内存需求,能够更快地摄取数据并实现数据集范围的数据撤回。

  2. RESEARCH · CL_229169 ·

    百万用户画像新语料库助力生成式AI优化

    研究人员开发了PersonaGen-1M,一个包含超过一百万个合成买家用户画像的语料库,旨在帮助优化ChatGPT、Gemini和Perplexity等生成式AI引擎。该语料库包含详细的行为属性、搜索查询,以及重要的是,每个用户画像的主要意图标签和偏好来源字段。这些数据是使用GPU加速的MinHash LSH和语义去重技术,从数百万原始用户画像描述中构建的,旨在提供需求侧的见解,以了解品牌在这些AI系统中是如何被推荐的。

  3. TOOL · CL_91516 ·

    ML数据污染使Qwen3-8B模型性能虚增9个点

    Nexus Labs的一个机器学习团队发现,他们微调的Qwen3-8B模型性能显著提升是由于数据污染造成的。该模型在票务路由任务上达到了80.4%的准确率,远高于基础模型的71.2%,但这种提升是虚假的。在使用MinHash LSH检测训练集和评估集之间的近乎重复条目后,他们发现大约6%的评估数据无意中被包含在了训练集中。在移除这些受污染的样本后,模型的真实准确率接近72%,表明微调过程的实际改进微乎其微。