PulseAugur
中
实时 07:14:27
实体 cosine similarity

cosine similarity

PulseAugur coverage of cosine similarity — every cluster mentioning cosine similarity across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
26
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
18
90 天内 18
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 27 条
  1. TOOL · CL_284250 ·

    新方法为AI表征定义了特定于上下文的语义几何

    研究人员引入了“Anchor Divergences”,一种定义学习向量表征的特定于上下文的语义几何的新方法。该方法利用对比学习、指数族和信息几何,在锚点上的概率分布与Bregman几何之间建立对应关系。通过对锚点分布进行建模,几何本身也得到建模,从而能够进行超越标准余弦相似度的更细致的相似性度量。实验表明,Anchor Divergences 有效且高效地指定了用于检索任务的依赖于上下文的语义相似性。

  2. COMMENTARY · CL_276224 ·

    数据科学相似性指标解析:从Netflix到欺诈检测

    本文探讨了数据科学应用中至关重要的各种相似性度量和指标。文章解释了为何需要这些指标,并提供了示例,如Netflix的推荐、Goldman Sachs等金融机构的欺诈检测以及零售企业的客户细分。该帖子还触及了搜索引擎如何使用这些指标对相关文档进行排名,并讨论了欧几里得距离、曼哈顿距离和余弦相似度等不同距离指标的可用性。

  3. TOOL · CL_268871 ·

    新研究质疑量化下 AI 可解释性迁移指标

    arXiv 上的一篇新论文质疑了使用余弦相似度来衡量量化下可解释性伪影迁移有效性的有效性。作者认为,报告的统计数据缺乏正确解释所需的噪声基底信息。他们提出了一种测量此噪声基底的方法,并在 Qwen2.5-1.5B-Instruct 上进行了演示,发现在 INT4 量化下,可解释性伪影的方向实际上会旋转,这一发现被标准的报告实践所掩盖。该论文还强调,尺度不变统计量无法区分迁移的决策变量的平移和衰减,并建议了替代的报告建议。

  4. TOOL · CL_247859 ·

    新的基于散度的相似性函数增强了多视图对比学习

    研究人员为多视图对比学习开发了一种新的基于散度的相似性函数(DSF),旨在更好地捕捉多个增强数据视图之间的联合结构。与以往关注成对关系的方法不同,DSF将视图表示为分布,并通过它们的散度来衡量相似性。实验表明,DSF在kNN分类和迁移学习等各种任务中提高了性能,同时效率更高,并且不像余弦相似性那样需要温度超参数。

  5. TOOL · CL_236235 ·

    BERT 嵌入占据狭窄锥体,挑战余弦相似度假设

    最近的一项分析表明,平均池化的 BERT 嵌入在语义无关的配对之间表现出 0.99 的高余弦相似度。这种现象表明嵌入可能占据一个狭窄的锥体,这是标准余弦相似度指标无法解释的一个特征。该论文提出,这并不是检索系统中的错误,而是这些嵌入结构固有的属性。

  6. TOOL · CL_235748 ·

    开发者通过语义缓存和速率限制削减 LLM Token 成本

    开发者正在实施缓存策略,以在免费套餐的大型语言模型 (LLM) 端点上降低成本并提高效率。一种方法是 SimHash,它使用哈希算法来识别语义上相似的提示,即使措辞略有不同也能实现缓存命中。另一种方法涉及令牌桶系统,用于管理请求速率并防止超出 API 限制,从而确保更顺畅的运行并避免错误。第三种策略是语义缓存,它将提示转换为嵌入,并比较它们的距离以找到相似的含义,从而重用已存储的响应并节省昂贵的 LLM 调用。

  7. TOOL · CL_229851 ·

    研究发现AI嵌入会像人脑一样遗忘

    新研究表明,AI记忆系统(特别是使用向量数据库和嵌入的系统)中回忆能力的退化,与人类记忆的遗忘模式相似。研究发现,嵌入的方差会集中在一小部分维度上,无论其标称维度是多少,这会导致记忆之间的竞争加剧。这种竞争,而不是基于时间的衰减,是遗忘的主要驱动因素,甚至可能导致生成与实际检索信息无法区分的错误记忆。

  8. TOOL · CL_229489 ·

    新的SGPDFuse方法通过语义引导增强多模态图像融合

    研究人员开发了SGPDFuse,一种新颖的多模态图像融合技术,它利用基于预训练视觉基础模型的语义-物理参数桥梁。该方法旨在通过应用内在变异原理来解耦内在场景真实性与环境干扰。SGPDFuse采用余弦相似度的语义对齐机制来保留关键目标,并使用Gram矩阵正则化消除伪影,以单一架构在各种融合基准测试中取得了最先进的结果。

  9. TOOL · CL_219495 ·

    开发者的意图检测器在否定词处理上遇到困难,尽管召回率很高

    一位开发者构建了一个使用嵌入式模型进行意图检测的系统,用于识别需要采取行动的用户消息,目标是减少为每条消息调用大型语言模型的成本。该系统将消息与预定义工具的相似度与与中性短语的相似度进行比较,而不是使用固定阈值。虽然该系统实现了 92% 的高召回率,但其误报率高达 24%,尤其是在处理否定词时,具有相反含义的句子被视为高度相似。

  10. TOOL · CL_218945 ·

    大语言模型框架增强大规模评估的相似性分析

    研究人员开发了一个名为AISA的新框架,该框架利用大语言模型(LLMs)来分析大规模评估中的附带内容相似性。这种双维度方法通过结构化分解和语义相关性来实现相似性操作,旨在解决BLEU和余弦相似性等传统指标在捕捉细微冗余方面的局限性。心理测量学验证表明,AISA的大语言模型衍生指标与非构建相关的局部依赖性更吻合,并改善了项目参数分组。该框架在计算机自适应测试(CAT)模拟中的应用表明,与传统方法相比,其估计稳定性得到增强,项目选择偏差减小。

  11. RESEARCH · CL_206410 ·

    新的MRieHy框架提升了脑机接口的准确性

    研究人员开发了一个名为多特征黎曼超图(MRieHy)的新框架,以提高运动想象脑机接口(MI-BCI)的准确性和跨日迁移能力。该方法结合了黎曼几何和超图,以更好地捕捉数据点之间复杂的相互关系,解决了临床应用中在线解码的挑战。实验表明,MRieHy在皮层脑电图(ECoG)和脑电图(EEG)数据集上均优于现有的最先进方法。

  12. COMMENTARY · CL_203783 ·

    嵌入模型漂移悄无声息地降低 RAG 性能

    嵌入模型漂移是生产环境中 RAG 系统中一个微妙但重要的问题,当用于生成向量嵌入的模型与用于查询的模型不同时就会发生。这种不匹配通常由模型更新、弃用或提供商变更引起,会导致检索准确性悄无声息地下降,而不会触发系统警报。检测这种漂移需要采取主动措施,例如维护一个具有已知检索预期的金丝雀语料库,并在部署时比较嵌入,因为向量数据库通常将嵌入视为不透明数据,并且缺乏内置的模型来源检查。

  13. RESEARCH · CL_192701 ·

    RAG 系统通过混合搜索和重排在向量搜索之外得到增强

    本文深入探讨了超越简单向量搜索来增强检索增强生成(RAG)系统。文章解释说,虽然嵌入对于语义相似性至关重要,但它们本身是不够的。文章提倡一种混合方法,将语义搜索与 BM25 等词汇搜索方法相结合,并纳入重排以优化结果。诸如查询优化、元数据过滤和上下文压缩等技术被强调为构建健壮的 RAG 管道的关键,这些管道可以通过提高准确性和效率来可靠地处理实际查询。

  14. RESEARCH · CL_188688 ·

    动态少样本提示可提高 LLM 示例的相关性和效率 · 跟踪 2 个来源

    动态少样本提示通过从更大的池中为每个特定输入检索最相关的示例,而不是为所有查询使用固定的示例集,从而改进了静态少样本提示。此方法使用嵌入空间中的余弦相似度和 k-近邻 (kNN) 等技术,确保提供的示例与当前请求更相关,从而提高质量和令牌效率。少样本提示的成本主要是基于令牌的,每个示例都会增加每次调用的输入成本,尽管提示缓存可以减轻经常性费用。研究表明,虽然示例有助于固定输出形状、标签集和粒度,但只有可混淆案例之间的边界才真正需要正确…

  15. TOOL · CL_174386 ·

    LLM的语义缓存基于含义来降低成本和延迟

    本文介绍了一种用于LLM的语义缓存技术,该技术基于查询的含义而非精确措辞进行键值匹配。通过将查询嵌入到向量中,并使用余弦相似度将其与缓存进行匹配,这种方法可以显著降低重复或释义问题的成本和延迟。作者演示了一个实时缓存,该缓存会在用户输入时对条目进行评分,并强调了调整相似度阈值以平衡缓存命中率和提供错误答案风险的重要性。

  16. TOOL · CL_160926 ·

    arXiv论文质疑余弦相似度在AI表征中的有效性

    一篇题为“角度的语义:余弦相似度何时有效,何时无效”的arXiv新论文批判性地审视了余弦相似度在机器学习表征中的广泛应用。该论文由Kisung You撰写,认为虽然余弦相似度在计算上很方便且对归一化嵌入有效,但其局限性源于无法捕捉径向变化以及可能与下游决策目标不匹配。作者建议审查替代方法,包括几何感知、中心点感知和范数感知方法,并指出余弦相似度的效用取决于特定的表征、处理、评分规则和决策上下文。

  17. TOOL · CL_134502 ·

    新的人脸验证模型IMGNet使用符号模式而非余弦相似度

    一位来自印度尼西亚的独立研究人员开发了IMGNet,这是一种新颖的人脸验证模型,它利用符号模式匹配而非传统的余弦相似度。这种方法侧重于嵌入向量的相对结构,而不是它们的绝对值。该模型在LFW数据集上实现了96.27%的准确率,模型大小相对较小,仅为10.58 MB。当应用于现有的ArcFace嵌入时,它表现出强大的性能,表明符号模式一致性是人脸嵌入的一个基本属性。

  18. COMMENTARY · CL_132912 ·

    Embedding 模型:LLM 上下文和检索的核心

    Embedding 模型是大型语言模型 (LLM) 的基础,尤其是在检索增强生成 (RAG) 中。这些模型将文本等高维数据转换为低维向量空间,从而促进相似性搜索并捕捉语义关系。这个过程对于 LLM 理解上下文和从数据库中检索相关信息至关重要,增强了文本分类、情感分析和问答等任务。

  19. RESEARCH · CL_117712 ·

    新方法以有限数据增强无监督跨模态检索 · 跟踪4个来源

    研究人员正在开发新的无监督跨模态检索方法,旨在提高效率并减少对大型手动标注数据集的依赖。论文提出了属性提示核哈希(APKH)和全局邻域对齐哈希(GNAH)等技术,这些技术利用视觉语言基础模型和有限的配对数据来构建紧凑、对齐的汉明空间。另一种方法UniCA引入了双向交叉注意力和正相似性损失,以实现更鲁棒的多模态检索,并在WebQA+等基准测试中取得了改进。

  20. RESEARCH · CL_117165 ·

    新理论解释嵌入长度如何编码语义特异性

    研究人员开发了一个理论框架,以解释为什么对比嵌入模型中的嵌入长度(通常因余弦相似性而被忽视)会与概念特异性和词元频率等语义属性相关联。该研究推导出一个解析公式,表明嵌入长度是训练过程的副产品,自然地编码了这些信息。这一发现为先前基于启发式观察的现象提供了有根据的解释,并表明这些信号可以作为特定模型和检索任务的免费校准工具。