tf–idf
PulseAugur coverage of tf–idf — every cluster mentioning tf–idf across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
小型语言模型用于边缘数据分类的评估
一篇新的arXiv论文探讨了在边缘计算环境中,使用小型、开源语言模型对智能数据模型(SDMs)进行分类的应用。该研究解决了现有方法资源密集且不适用于边缘设备的局限性。研究人员针对特定领域的数据集,对包括通用模型、推理专用模型和代码专用模型在内的各种语言模型架构进行了基准测试。他们还将这些模型与TF-IDF等更简单的基线模型进行了比较,以评估它们在资源受限平台上的实际价值。
-
研究发现:大型语言模型裁判未能准确衡量工作场所中的人工智能
一个名为 O*NET-BENCH 的新审计套件已被开发出来,用于评估大型语言模型 (LLM) 裁判在评估工作场所需求的人工智能输出方面的有效性。虽然许多大型语言模型配置在响应质量排名方面表现出一致性,但与人类工人数据相比,它们在准确估计接受率或职业汇总数据方面常常失败。这种差异凸显了仅凭排名一致性不足以进行可靠的职业测量,裁判需要针对其旨在估计的实际接受率和汇总数据进行验证。
-
新基准改进了从临床文本中推荐SNOMED CT概念
研究人员开发了一个新的基准,用于从掩码临床上下文中推荐SNOMED CT概念,旨在提高临床语言的标准化和互操作性。该研究使用了源自MIMIC-IV-Note的SNOMED CT实体链接挑战v1.2.1数据集,并测试了各种推荐方法。稀疏TF-IDF被证明是最有效的方法,实现了14.81%的Recall@1和33.43%的Recall@10。研究结果强调,概念频率和局部词汇上下文的覆盖范围对推荐质量有显著影响,尤其是在低资源场景下。
-
新孟加拉语句功能分类语料库已开发
研究人员开发了一个包含 10,000 句孟加拉语的新语料库,这些句子被手动分为陈述句、疑问句、祈使句和感叹句四种功能,以解决孟加拉语句功能分类资源有限的问题。该研究评估了各种特征表示,包括词袋模型 (Bag-of-Words)、TF-IDF 和 Word2Vec,以及经典的机器学习分类器和集成模型。结合 TF-IDF 特征的双层集成模型取得了最高性能,准确率和宏 F1 分数均为 0.95,证明了稀疏词汇表示和集成学习在此自然语言处理任…
-
新框架检测AI原生6G网络中的对抗性意图注入
研究人员开发了一个新框架,用于检测AI原生6G网络中的对抗性意图注入。该方法解决了恶意策略伪装在合法网络配置中的挑战。提出的双路径检测系统利用带有TF-IDF特征的CNN进行监督检测,并利用在良性数据上训练的AutoEncoder进行单类检测,在准确率和F1分数上均优于现有基线。
-
新 arXiv 论文将 TF-IDF 和 BM25 确定为精确的 KL 散度
一篇新发表在 arXiv 上的论文提出,TF-IDF 和 BM25 这两种用于评估查询-文档相关性的基础方法,可以被精确地解释为 Kullback-Leibler 散度。这项研究为这些方法提供了一个统一的概率框架,阐明了它们的理论基础,并能够与其他信息检索技术进行直接比较。该论文特别分析了实践中常用的 BM25 变体,该变体在其 IDF 项中包含加一修正,以及原始的 BM25 公式。
-
新研究评估NLP文本分类器的隐私风险
一项新的arXiv研究评估了训练自然语言处理(NLP)文本分类器相关的隐私风险。研究人员使用TF-IDF + Logistic Regression模型和微调后的DistilBERT分类器,对GLUE SST-2情感数据集进行了成员推断攻击(MIAs)的基准测试。虽然DistilBERT取得了更高的准确率和F1分数,但两种模型都显示出成员信号的泄露。研究还探讨了轻量级缓解技术,发现更强的正则化可以在付出效用代价的情况下减少泄露,而微调…
-
新方法实现计算问题的跨领域解决方案导入
研究人员开发了一种新颖的方法,用于识别和导入不同科学领域的计算解决方案。通过为研究论文创建领域剥离的计算指纹,他们可以有效地匹配那些使用相似底层方法解决但跨学科命名不同的问题。与传统的基于主题或引用的嵌入相比,这种方法显著提高了跨领域检索的准确性,从而能够将专业求解器从一个领域转移到另一个领域。该系统已成功识别出真正的解决方案候选者并促进了实际导入,例如使用开放标准求解器重现临床剂量引擎的输出。
-
新方法学习古典泰米尔语诗文-注释对的表示
研究人员开发了一种新的方法来学习古典泰米尔语诗文-注释对的表示,旨在了解机器学习可以恢复哪些信息。他们训练了各种模型,包括循环和Transformer编码器、Siamese风格网络以及mBART风格和仅解码器语言模型,并将它们的性能与TF-IDF等基线进行比较。虽然一些模型在词序偏好等方面显示出潜力,但没有一个模型能够完全重现保留的注释内容,这表明当前表示学习在该特定语言任务上存在局限性。该团队已发布了他们的提取和评估协议以供进一步研究。
-
研究比较了六种学术导师发现的检索方法
一项新近发表在arXiv上的研究评估了六种不同的信息检索方法,用于发现学术导师。该研究分析了来自美国九所大学的768份教职人员简介,发现重新排序的方法在匹配教职人员与学生研究兴趣方面取得了最佳性能。值得注意的是,研究表明仅使用教职人员的简介比结合简介和研究领域标签能获得更好的结果,而引入arXiv论文摘要实际上降低了性能。
-
新的SHELF基准测试LLM在图书馆书目任务上的表现
一个名为SHELF的新基准测试系统已被开发出来,用于评估语言模型在与图书馆和档案馆相关的书目任务上的表现。该系统基于美国国会图书馆的词汇表生成合成数据,创建分类、聚类和检索任务。初步测试显示不同方法的表现各异,稀疏方法在分类方面仍具竞争力,而TF-IDF在主题时效性方面被证明是高效的。
-
新的SHELF基准测试LLM在图书馆书目任务上的表现 · 跟踪2个来源
研究人员开发了SHELF(Synthetic Harness for Evaluating LLM Fitness),一个用于评估LLM适应性的合成工具包,旨在为图书馆和档案馆进行书目任务的基准测试。该Python系统从标记的分类法和写作规范中生成受控的基准测试数据。首个版本包含基于美国国会图书馆词汇表的超过62,000份模型编写的文档,任务包括分类、聚类和检索。虽然主题分类得分达到0.8887,但体裁形式分类得分显著较低,为0.26…
-
PageIndex 为 dev.to 内容提供无向量 RAG
PageIndex 是一个专为 dev.to 平台设计的新型无向量检索增强生成 (RAG) 解决方案。它通过构建 dev.to 帖子、评论和标签的反向索引,绕过了计算密集型向量嵌入的需要。这种方法可以以更低的开销提供更快、更相关的响应,使其适用于开发者 FAQ 机器人或内容推荐系统等应用。
-
稀疏自编码器显示奖励过滤捕获了解的完整性,而非推理质量
研究人员开发了一种奖励信息稀疏自编码器(RI-SAE)来解释语言模型激活,特别是关注推理能力。虽然 RI-SAE 成功地将 Llama-3.1-8b 中的高奖励和低奖励推理轨迹分开,但进一步的分析表明,这种分离主要是由于解的完整性,而不是真正的推理质量。对照实验表明,即使是简单的 TF-IDF 分类器和诸如答案框之类的结构线索也能达到相似的区分能力,这表明奖励过滤是一种有效的但肤浅的解释方法。
-
AI模型利用文本分析预测研究论文质量
研究人员开发了一种方法,仅使用论文标题和摘要中的文本特征即可将科学论文分为高质量或有缺陷的类别。该研究评估了各种嵌入技术和分类器,发现使用SBERT嵌入的神经网络准确率为87.22%,而FastText-SVM组合的准确率为91.12%。这项工作旨在通过利用文本分析来促进可信的学术研究,为学术诚信工具做出贡献。
-
大型语言模型(LLM)与微调的自然语言理解(NLU):新框架指导意图检测选择
一篇新的研究论文探讨了在对话系统中,大型语言模型(LLM)何时可以作为微调的自然语言理解(NLU)模型的合适替代品。研究发现,虽然在拥有充足标记数据的情况下,像RoBERTa这样的微调模型可以表现得同样好甚至更好,并且效率显著更高,但大型语言模型(LLM)在特定场景下表现出色。这些场景包括检测范围外请求、处理自动语音识别产生的嘈杂输入,以及在无需重新训练的情况下适应动态意图模式。
-
研究发现:LLM代理在社交平台上表现出词汇趋同
一项新研究引入了PV-SST,一个用于评估大型语言模型(LLM)代理的同行投票社交平台测试平台。研究发现,接触按点赞数排序的先前同行帖子的信息流,会导致代理之间的词汇相似性增加。然而,这种信息流诱导的趋同并未可靠地提高意见捕获或协调优势,特别是与单一来源相比,在使用多个分布式来源时。
-
新数据集 Strategic 16K 为文档敏感性基准测试 AI 模型
研究人员开发了 Strategic 16K,这是一个包含 16,000 份来自 WikiLeaks 的外交电报的新数据集,旨在防止文档敏感性分类中的标签泄露。该语料库被用于对经典模型和基于 Transformer 的模型进行基准测试,结果显示 BERT 在清理后的数据上取得了最高的准确率 (89.14%) 和 F1 分数 (89.33%)。虽然像 BERT 和 ELECTRA 这样的 Transformer 模型表现最佳,但 TF-I…
-
金融NLP基准测试存在时间泄露,夸大了性能指标
一项对金融新闻NLP基准测试的新审计显示,存在严重的时间泄露问题,与按时间顺序划分相比,随机的训练-测试集划分将性能指标夸大了高达6.5倍。这种泄露在大模型和更丰富的特征下尤为明显。研究发现,只有并购新闻在接近时间顺序的评估下显示出积极信号,但该信号仅限于特定的语义上下文,并未迁移到更广泛的数据集。研究人员提倡将泄露审计作为金融NLP基准测试的强制性披露内容。
-
AccretionLink系统审计设备上属性推断攻击
研究人员开发了AccretionLink,一个新颖的设备上审计系统,用于检测属性推断攻击。该系统定义了保密性和完整性博弈来模拟攻击,利用了部分识别和依赖感知的时间均匀e过程。在合成和真实数据集上的实验表明,AccretionLink在降低推断可能性和识别潜在的错误反转方面是有效的,其性能在Tensor G5图上得到了验证,并通过P-256检查点进行了认证。