PulseAugur
实时 14:17:11
实体 Retrieval

Retrieval

PulseAugur coverage of Retrieval — every cluster mentioning Retrieval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_188690 ·

    特征存储解决了机器学习训练-服务漂移和目标泄露问题

    特征存储对于生产环境的机器学习至关重要,它解决了训练和提供服务环境之间特征定义漂移的关键问题。这种漂移会悄无声息地降低模型性能,尤其是在高风险预测场景下,因为模型是在一个数据分布上训练的,却在另一个数据分布上进行评分。为了确保时间点正确性,特征存储提供了历史特征值,从而防止目标泄露并保持模型完整性。

  2. RESEARCH · CL_180685 ·

    DART架构通过融合Transformer和SSM来增强长上下文序列建模

    研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。

  3. TOOL · CL_158836 ·

    科隆信息检索小组展示代理式对话搜索系统

    科隆信息检索小组的研究人员为 iKAT SCAI 2026 共享任务开发了一个代理式对话搜索系统。该系统集成了查询重写、检索、重排序和答案生成工具。他们的工作重点是澄清需求预测和澄清问题的生成,并为此目的在两个不同的神经网络模型上进行了实验。

  4. RESEARCH · CL_143683 ·

    新研究质疑用于时间序列预测的光谱分析

    最近的两篇arXiv论文探讨了在结合外部上下文时,使用光谱分析进行时间序列预测的局限性。第一篇论文介绍了CAF-7M,这是一个旨在通过解决上下文质量差的问题来改进上下文辅助预测的大型数据集,表明数据集质量是关键瓶颈。第二篇论文认为,光谱指数不足以预测来自检索插件或基础模型的上下文的价值,并提出了一个名为“覆盖缺口”的新诊断方法,以更好地评估部署决策。

  5. RESEARCH · CL_128512 ·

    新的基准测试评估葡萄牙语文本嵌入模型,揭示性能差距

    发布了两个新的基准测试 MTEB-PT 和 MTEB-PT(巴西葡萄牙语),专门用于评估葡萄牙语的文本嵌入模型。这些基准测试解决了现有评估中葡萄牙语代表性不足的问题,而现有评估通常依赖于翻译的数据集或多语言平均值。新的基准测试包含大量葡萄牙语原生任务,涵盖语义文本相似性、分类、检索和重新排序等多个类别。初步评估表明,模型性能高度依赖于任务,并且在多语言基准测试上的排名并不能可靠地预测葡萄牙语特定性能,这凸显了进行原生语言评估的必要性。

  6. COMMENTARY · CL_113952 ·

    LLM上下文窗口不是知识库;策略性选择是关键

    文章认为,仅仅增加LLM的上下文窗口大小并不等同于有效的上下文工程。相反,它强调了在正确的时间策略性地选择和呈现最相关信息给模型的重要性。作者提出了一个有用的上下文的七层模型,包括系统指令、任务契约、示例、检索、工作记忆、工具描述和近期历史,以确保高信号信息优先于不相关或冗余数据。