MinHash
PulseAugur coverage of MinHash — every cluster mentioning MinHash across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新指标CCdim显示精确Jaccard校准的指数维度
研究人员引入了指数凸校准维度(CCdim)来分析多标签分类和二元分割任务的复杂性。该新指标应用于Jaccard分数,揭示了实现精确校准需要指数数量的预测坐标。该研究还提供了多项式维度的近似保证以及一种从F-1代理到Jaccard代理的新颖迁移方法,为管理遗憾提供了实用的替代方案。
-
从生产日志构建 LLM 微调数据集
本文讨论了为大型语言模型从生产日志构建有效微调数据集的关键过程。文章强调原始日志并非数据集,并着重指出了选择高信号示例的重要性,例如用户编辑、验证器失败或路由到更昂贵模型的请求。作者还提供了数据清理技术的建议,推荐使用代理进行 redaction、使用 MinHash 进行去重、限制每个来源的贡献,以及过滤截断的输出。最后,文章警告了训练集和测试集之间的时间和近乎重复的泄露问题,建议在拆分前进行去重,并使用基于时间的拆分来确保准确评估。
-
新的SubQuad管道改进了自适应免疫组库分析
研究人员开发了SubQuad,这是一个旨在克服自适应免疫组库分析中局限性的新管道。该系统解决了成对亲和力评估的计算成本以及可能掩盖稀有但重要的细胞群的数据集不平衡问题。SubQuad结合了近亚二次方检索方法、GPU加速亲和力核、学习到的多模态融合和公平性约束聚类,以提高吞吐量和内存使用率,同时保持或提高召回率和聚类纯度。
-
LLMs通过MinHash课程微调用于神经架构合成
研究人员开发了一个新颖的神经架构搜索(NAS)框架,该框架利用基于MinHash的相似性调度方法为大型语言模型(LLM)的微调创建渐进式课程。该方法将神经架构代码划分为相似性带,并以递增的异质性呈现它们来指导LLM。在LEMUR基准的CIFAR-10图像分类任务中,使用OlympicCoder-7B模型进行评估时,该课程在高度相似性水平下达到了60%的峰值成功率,且无需后处理修复。消融研究表明,尽管在某些多样化场景下,未经修复的基础模…
-
H3D基准测试评估用于文档去重的无监督文本哈希
一项名为H3D的新基准测试已被开发出来,用于评估细粒度文档去重的无监督文本哈希方法,特别是针对科学文档。该基准测试将MinHash和SimHash等传统的非学习方法与利用BGE嵌入的语义敏感方法进行了比较。H3D根据排名质量、效率和鲁棒性评估各种方法,揭示了用于近重复文档的词汇/结构指纹与用于内容重写的语义表示之间的权衡,而后者会产生更高的计算成本。
-
新框架SemHash-LLM通过集成LLM增强文档去重能力
研究人员开发了SemHash-LLM,一个专为大规模文档集合进行高效准确去重的新型框架。该系统集成了多种技术,包括语义投影哈希、注意力加权MinHash和对比边界学习,以捕捉不同粒度的语义等价性。通过结合字符、词元和文档级别的信号,SemHash-LLM显著降低了重复检测的神经验证成本,以不到百分之一的验证成本实现了高质量的去重。