PulseAugur
实时 10:00:59
实体 fastText

fastText

PulseAugur coverage of fastText — every cluster mentioning fastText across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 8
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_245294 ·

    使用 Llama-3.1-8B 分析僧伽罗语语义变化

    研究人员开发了一个计算框架,用于分析僧伽罗语从13世纪到20世纪的历时语义变化。该研究利用了静态嵌入(Word2Vec、FastText)和经过微调的 Llama-3.1-8B 模型的上下文嵌入。研究结果表明,语义漂移并非均匀发生,而是显著受到一小部分高影响上下文实例的影响,而非渐进式、广泛的转变。

  2. TOOL · CL_216034 ·

    AI模型利用文本分析预测研究论文质量

    研究人员开发了一种方法,仅使用论文标题和摘要中的文本特征即可将科学论文分为高质量或有缺陷的类别。该研究评估了各种嵌入技术和分类器,发现使用SBERT嵌入的神经网络准确率为87.22%,而FastText-SVM组合的准确率为91.12%。这项工作旨在通过利用文本分析来促进可信的学术研究,为学术诚信工具做出贡献。

  3. TOOL · CL_193724 ·

    突厥语族脚本统一提升跨语言自然语言处理性能

    一篇新的研究论文探讨了用于改进自然语言处理任务中跨语言迁移的脚本统一策略,特别关注突厥语族。该研究比较了通用罗马化器(uroman)和语族特定方法(通用突厥语脚本 - CTS)。结果表明,这两种方法在命名实体识别和词性标注任务上都显著优于单语模型,CTS和uroman之间没有明显的通用赢家。脚本统一的有效性似乎取决于特定语言、产生的子词重叠以及监督数据的可用性。

  4. TOOL · CL_187268 ·

    机器学习模型检测社交媒体上的用户死亡

    一篇新的论文详细介绍了能够自动检测社交网站上已故用户的机器学习分类器的开发。该研究利用了从Wikidata和X(前身为Twitter)汇编的新数据集,训练了包括SVM和RF等传统算法以及BiLSTM、CNN和BERT等深度学习模型的各种模型。研究发现,BERT取得了最高的性能,优于所有其他模型。对语言特征的分析显示,死后推文表现出更高的负面情绪,并且更频繁地使用与消极、家庭、宗教和死亡相关的词语,而生前推文则表现出更高的中性情绪,并且…

  5. TOOL · CL_180469 ·

    哈萨克语-俄语语码转换识别瓶颈在于注释而非模型

    arXiv上的一篇新论文探讨了哈萨克语和俄语之间的语码转换识别问题,发现注释边界比所使用的模型更为关键。研究人员开发了一个黄金语言识别(LID)数据集,并为整合借词和从句级切换制定了具体指南。在测试中,FastText、Lingua和XLM-RoBERTa等模型表现各异,这表明注释定义而非模型类别本身,是准确识别的主要瓶颈。

  6. TOOL · CL_129108 ·

    新的FastText变体使用高级数据结构大幅减少内存使用

    研究人员开发了一种内存高效的FastText变体,FastText是生成词表示的流行工具。这种新方法用双数组Trie索引取代了传统的哈希桶,并采用标记-压缩内存管理来压缩n-gram矩阵。该方法显著降低了内存使用和模型加载时间,同时保持了下游质量,使其适用于LLM时代检索系统。

  7. TOOL · CL_96164 ·

    新的E2Vec方法使用时间数据分析学生行为

    研究人员开发了E2Vec,一种用于分析数字教科书系统中学生行为的新特征表示方法。该方法利用词嵌入技术,特别是fastText,结合操作日志和时间间隔中的时间信息,创建学生向量。该方法在一个包含305名计算机科学课程学生的 数据集上进行了测试,证明了其在风险检测和泛化方面的潜力。

  8. RESEARCH · CL_20603 ·

    TajikNLP 工具包为塔吉克语提供全面的开源处理

    研究人员开发了 TajikNLP,一个开源的 Python 库,旨在处理塔吉克语。塔吉克语使用西里尔字母书写,并且一直以来在现有的自然语言处理工具中服务不足。该工具包提供了一个全面的处理流程,包括清洗、分词、词法分析和情感分析,并包含一个新颖的词法引擎来处理复杂的屈折变化。该库还附带了四个新发布的语言学数据集,以支持未来的研究和应用。