PulseAugur
中
实时 15:57:37
实体 NDCG@10

NDCG@10

PulseAugur coverage of NDCG@10 — every cluster mentioning NDCG@10 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
22
90 天内 22
发布 · 30天
0
90 天内 0
论文 · 30天
20
90 天内 20
层级分布 · 90 天
主题
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/2 页 · 共 22 条
  1. RESEARCH · CL_273136 ·

    组件感知反馈提升LLM程序进化效率

    研究人员开发了一种名为组件感知反馈的新方法,以提高LLM指导的进化搜索在程序开发中的效率。该技术记录了对程序组件所做的更改及其对适应度指标的影响,为未来的变异提供了更清晰的历史记录。该方法在十二个Bright数据集的LLM重排任务上进行了测试,显著缩短了搜索时间,提高了准确性,同时降低了每次查询的token使用量。

  2. RESEARCH · CL_269376 ·

    新方法提高了视觉文档重排的效率和准确性

    研究人员开发了两种新颖的高效视觉文档重排方法:RenderRank 和 RidgeRank。RenderRank 利用从文档图像中提取的压缩视觉标记来学习查询相关的评分,显著减少了输入标记数量,并在多个数据集上优于基于文本的重排器。RidgeRank 通过融合检索器分数和重排器分数并采用浅层线性读出,提高了效率,以一小部分计算成本实现了接近交叉编码器的准确性。这两种方法都旨在提高多模态语言模型在文档检索任务中重排的速度和准确性。

  3. TOOL · CL_281353 ·

    新的LLM评分方法减少了决策中的顺序依赖性

    一篇新的研究论文介绍了一种名为“顺序一致监督微调”(Order-Consistency Supervised Fine-Tuning, OC-SFT)的方法,旨在减少大型语言模型(LLM)评分器中的顺序依赖性。这些评分器用于候选文档重排和多文档问答等任务,即使在展示出相等的排名质量时,也可能因为提示中候选项目的顺序而产生不同的决策。OC-SFT通过惩罚不同排序下的分数不一致来解决这个问题,从而在保持排名质量的同时提高决策的稳定性。该论…

  4. TOOL · CL_259128 ·

    新基准改进了从临床文本中推荐SNOMED CT概念

    研究人员开发了一个新的基准,用于从掩码临床上下文中推荐SNOMED CT概念,旨在提高临床语言的标准化和互操作性。该研究使用了源自MIMIC-IV-Note的SNOMED CT实体链接挑战v1.2.1数据集,并测试了各种推荐方法。稀疏TF-IDF被证明是最有效的方法,实现了14.81%的Recall@1和33.43%的Recall@10。研究结果强调,概念频率和局部词汇上下文的覆盖范围对推荐质量有显著影响,尤其是在低资源场景下。

  5. TOOL · CL_258910 ·

    新的单Token评分方法改进了LLM候选人排名

    研究人员开发了一种名为单Token期望值评分的新方法,用于对求职者进行排名,尤其适用于交互数据有限的平台。该技术将候选人-职位相关性视为一个序数分类问题,使用经过微调的小型语言模型(SLM)和混合损失函数。该方法在低延迟下提供确定性分数,并在离线模拟和在线实时实验中显示出显著的改进,降低了低相关性率并提高了雇主保留率。

  6. RESEARCH · CL_257048 ·

    研究论文质疑后训练量化对文本嵌入器的有效性

    一篇新发表在arXiv上的研究论文,探讨了后训练量化(PTQ)技术在文本嵌入器上的有效性。研究发现,PTQ的常用启发式方法,例如保护嵌入表和根据模块敏感度分配比特,并不能可靠地迁移到检索嵌入器上。该研究在各种比特宽度和组大小下对模型进行量化,揭示了在较低比特宽度下,模块敏感度变得依赖于嵌入器家族,并且一个简单的重建代理在选择需要保护的张量方面不太可靠。

  7. RESEARCH · CL_252189 ·

    MoE模型获得更智能的剪枝、检索和推理效率

    研究人员正在探索用于混合专家(MoE)语言模型的先进技术,以提高其效率和性能。一篇论文介绍了HOPE(Higher-Order Pruning of Experts),一种考虑专家协同交互的新型剪枝目标,在稀疏率较高和复杂代理任务上表现优于现有方法。另一项研究表明,MoE模型可以作为强大且高效的信息检索系统,在激活参数较少和编码时间较短的情况下优于密集模型。此外,一个名为DynaExq的系统在推理过程中动态量化专家,以管理单GPU上的…

  8. TOOL · CL_244564 ·

    研究发现,礼貌的提示会改变大型语言模型的相关性判断

    一篇新发表在arXiv上的研究调查了提示中的礼貌用语对用作相关性判断器的大型语言模型的影响。研究人员发现,语气显著影响模型的判断,并且影响因模型而异。当语气影响一致性时,它似乎会转移模型整体评分的宽松度,而不是提高判断的准确性。研究表明,当精确的相关性标签至关重要时,提示语气可能构成有效性威胁。

  9. TOOL · CL_237611 ·

    Tendero eCommerce 推出 .NET 11 和 AI 层

    Tendero eCommerce,前身为 CocktailDev,已作为一个真实的在线商店推出,使用 .NET 11 和 Angular 22 构建。该平台集成了 AI 层,旨在提升用户体验。主要功能包括完整的购物车到结账流程和退货管理,并将 NDCG@10 作为持续集成门禁。

  10. TOOL · CL_231352 ·

    LLM 组件对对话推荐性能产生关键影响

    一篇新的研究论文探讨了大型语言模型 (LLM) 的不同组件在用于对话推荐系统时如何影响其性能和稳定性。研究发现,在 ReDial 基准测试中,专有 LLM 的表现明显优于非 LLM 基线,取得了更高的 NDCG@10 分数。然而,性能提升高度依赖于候选生成方法,当与 LLM 重排序器配对时,语义候选可将性能提升 50% 以上。研究还强调,对于表现最佳的专有 LLM 而言,解码温度对 NDCG@10 的影响微乎其微,但可能会削弱较弱模型的性能。

  11. TOOL · CL_231293 ·

    新方法为低资源语言构建树状知识图谱

    研究人员开发了一个端到端的树状知识图谱构建和检索策略评估流程,专门解决了越南语等低资源语言的挑战。该系统采用混合关系提取流程,包括去重和基于 LLM 的提取以及验证器,来构建知识图谱。对越南语历史教科书上的图遍历策略的评估表明,在 NDCG@10 中,自顶向下方法优于向量基线,表明结构信息在检索中的价值。

  12. RESEARCH · CL_222853 ·

    新的OC-SFT方法提高了LLM评分器的稳定性,减少了顺序依赖性

    研究人员开发了一种名为顺序一致评分(OC-SFT)的新训练方法,以解决大型语言模型(LLM)评分器中的顺序依赖性问题。虽然现有的评分器在排名质量上进行评估,但它们的决策可能因输入文档或响应的顺序而有很大差异。OC-SFT旨在通过训练模型,使其候选者的分数不受其在序列中位置的影响,从而使这些分数更加稳定。这种新方法在保持排名质量的同时,提高了各种任务的决策稳定性,其表现优于其他针对顺序的目标以及平均现成的排列。

  13. TOOL · CL_205986 ·

    新方法使用代理搜索轨迹调整密集检索模型

    研究人员开发了导航感知嵌入(NIE),一种利用代理搜索工作流中的轨迹来调整密集检索模型的新方法。该方法利用查询、检索和停止轨迹来微调已部署的模型,而无需新的相关性标签、合成查询或 LLM 判断。通过将停止文档视为正面示例并纳入先前的路径文档,NIE 显著提高了检索性能,在 BEIR HotpotQA 等基准测试中,Recall@20 提高了高达 5.8 个点,nDCG@10 提高了 1.9 个点。

  14. RESEARCH · CL_205645 ·

    ConceptFormer框架利用潜在概念改进视觉文档检索

    研究人员推出ConceptFormer,一个旨在增强视觉文档检索的新型框架。该方法学习自适应的潜在概念,以更好地将查询与相关文档对齐,即使证据分散在文本、布局和视觉结构中。与依赖文本描述或原始视觉注释的先前方法不同,ConceptFormer使用查询条件潜在概念作为中间表示。实验表明,ConceptFormer显著提高了检索准确性,在NDCG@10方面比现有的基于视觉和OCR的基线取得了实质性进展。

  15. TOOL · CL_193004 ·

    新方法利用难度门控推理提高时序检索准确性

    研究人员开发了一种改进信息检索系统中时序检索的新方法。该技术称为难度门控推理视图融合,解决了查询与文档匹配的挑战,其中相关性取决于时序推理而非简单的关键词重叠。通过将查询扩展为多个重述,并根据查询难度动态加权其重要性,该系统在无需相关性标签或推理时重新排序的情况下提高了检索准确性。该方法在包括BERT和基于解码器的模型在内的各种检索器上,在Tempo基准测试中显示出显著的改进,最强的模型实现了0.303的nDCG@10得分。

  16. RESEARCH · CL_193344 ·

    UniMoMo框架压缩MoE推荐模型以加速推理

    研究人员开发了UniMoMo,一个训练后压缩框架,旨在加速使用混合专家(MoE)层的推荐模型。该方法根据专家的功能相似性而非参数距离对专家进行分组,并使用无标签的校准数据来评估专家对推荐状态的响应相似度。UniMoMo还引入了一个层自适应保护机制,通过限制高流量专家的合并来防止性能下降。在Amazon Beauty、KuaiRec和TenRec等数据集上的实验表明,将MoE模型压缩到更少的专家数量可以显著提高推理速度,同时保持高质量的推荐效果。

  17. RESEARCH · CL_156459 ·

    PLAID-PRF 使用质心感知伪相关反馈增强密集检索

    研究人员推出了一种用于增强 ColBERT 等多向量密集检索模型的新方法 PLAID-PRF。该技术利用 PLAID 框架内的质心类令牌来执行伪相关反馈 (PRF),根据检索到的顶部结果有效地重构查询向量。PLAID-PRF 利用内部 PLAID 质心向量,保持了较低的计算成本,在 MS MARCO 和 BEIR 等各种基准测试中显示出检索效率的显著提高。

  18. RESEARCH · CL_145910 ·

    Apple TV搜索系统使用混合嵌入来增强个性化

    Apple的机器学习研究团队为Apple TV搜索开发了一个个性化系统,该系统可以增强增量搜索结果。该系统结合了基于文本和基于ID的嵌入,分别使用对比学习和交互数据进行训练。当集成到XGBoost ranker中时,这种混合方法显著提高了NDCG@10和MRR等指标,特别是对于模糊、短前缀查询和具有广泛观看历史记录的用户。在线实验证实了这些改进,提高了点击率和转化率。

  19. TOOL · CL_150695 ·

    新方法提高了SQL模式检索的准确性

    研究人员开发了一种新的SQL模式检索方法,专注于为自然语言查询识别相关的表和列。他们将现有的text-to-SQL数据集改编为检索任务,并发现标准的嵌入器表现不佳。为解决这个问题,他们提出了一种语料库自适应微调技术,该技术可以从目标模式合成查询并挖掘困难的负例。这种方法显著提高了召回率和nDCG分数,将模式链接确立为一个独立的检索任务,并为企业规模的部署提供了实用的解决方案。

  20. RESEARCH · CL_115149 ·

    新的Shard方法增强了密集检索系统的隐私性

    研究人员开发了一种名为Shard的新方法,以增强密集检索系统的隐私性。密集检索系统常用于语义搜索和检索增强生成(RAG)。Shard通过引入一种保留检索的嵌入转换来解决向量存储容易受到揭示底层文本的攻击的漏洞。这种转换将嵌入分割成用于初始检索的公共前缀和在密钥下分片的私有残差,然后使用CKKS进行重新排序以取消密钥并保持精确的内积。该系统旨在防止对齐攻击和去匿名化,提供几何防御而非加密保证。