PulseAugur
实时 01:53:06
实体 SpaCy

SpaCy

PulseAugur coverage of SpaCy — every cluster mentioning SpaCy across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 8
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_185368 ·

    New spaCy-based POS tagger achieves high accuracy for Scottish Gaelic

    研究人员使用 spaCy 自然语言处理框架,为苏格兰盖尔语(一种濒危且形态复杂的语言)开发了一个词性标注器。在最少的预处理和配置下训练了两个模型:一个使用细粒度标签集,准确率达到 88.6%;另一个使用粗粒度标签集,准确率达到 93.7%。这些结果表明,即使在标注数据有限和语言结构复杂的情况下,直接的、现成的 NLP 管道也能取得出色的性能。

  2. TOOL · CL_167362 ·

    新方法增强医学领域视觉语言模型的可解释性

    研究人员开发了一种名为ParseFIxLIP的新方法,旨在提高视觉语言模型(VLMs)在医学应用中的可解释性。该新方法将树形语法分析(Tree-Gram Parsing)整合到Banzhaf交互博弈中,解决了临床术语中分词器(tokenizers)造成的概念碎片化问题。通过根据依赖分析树将语义相关的文本标记分组为连贯单元,ParseFIxLIP生成了更具可解释性的跨模态归因。该方法已在BiomedCLIP上使用ROCOv2的医学影像进…

  3. TOOL · CL_119635 ·

    新工具包增强了儿童-成人语言交互的句法分析

    研究人员开发了一个名为 CAIT 的新开源工具包,旨在改进 CHILDES语料库中儿童-成人交互的句法分析。该工具包包含一个专门的依存关系解析器,其性能优于 SpaCy 和 Stanza 等通用英语解析器。CAIT 还配备了词性标注器和话语级结构标注器,能够提高语言习得研究的准确性和可重复性。

  4. TOOL · CL_102278 ·

    Claude Code 的“扩展思考”输出被发现不真实

    最近的一项发现表明,AI 模型 Claude Code 生成的“扩展思考”输出并非真实。这一发现引发了对 AI 生成内容的可靠性和可信度的担忧,尤其是在 AI 被广泛应用于各行各业的背景下。建议开发者在使用此类输出时要谨慎,并考虑使用 NLP 工具对生成文本进行更深入的分析。

  5. TOOL · CL_65857 ·

    新数据集提升马来西亚英语的自然语言处理能力

    研究人员开发了一个名为马来西亚英语新闻(MEN)数据集的新数据集,其中包含200篇标注了实体和关系的新闻文章。该资源旨在改进针对马来西亚英语的自然语言处理(NLP)任务,马来西亚英语与标准英语不同,并对现有的NLP模型提出了挑战。实验表明,使用此定制数据集对spaCy NER工具进行微调,显著提高了其在马来西亚英语新闻上的性能。

  6. RESEARCH · CL_48842 ·

    新流程为古希腊议会文本创建自然语言处理资源

    研究人员开发了一个新的、可复现的流程,用于为古希腊语议会文本创建类似通用依存关系的解析资源。该工作流程解决了当前自然语言处理工具在处理古希腊历史文献方面的局限性,整合了光学字符识别(OCR)重建、大型语言模型(LLM)辅助标注和自动化验证。由此产生的数据集和方法旨在使历史议会档案更容易用于自然语言处理研究。

  7. TOOL · CL_40814 ·

    新工具包CAIT增强了儿童-成人语言交互的句法分析

    研究人员开发了CAIT,一个新开源工具包,旨在分析CHILDES数据集中儿童-成人交互的句法结构。该工具包包含一个在UD-English-CHILDES树库上专门训练的最先进的依存关系解析器,与SpaCy和Stanza等通用英语解析器相比,其准确性更高。CAIT还配备了词性标注器和话语级结构标注器,能够为语言习得领域的研究提供更强大、可复现的支持。

  8. RESEARCH · CL_18259 ·

    自然语言处理工具比较地名识别和主题模型用于气候事件新闻

    两篇新研究论文探讨了用于分析德国媒体对极端气候事件新闻报道的自然语言处理技术。一篇论文比较了 Flair、Spacy 和 Stanza 等现成命名实体识别 (NER) 工具在识别地名和对事件进行地理定位方面的性能。第二篇论文研究了使用主题模型作为二元分类器来改进相关新闻文章的检索,并将这种方法与微调的文本嵌入分类器和开源大语言模型进行了比较。

  9. RESEARCH · CL_08654 ·

    FGDM: 软件错误检测的推理感知多智能体框架,使用思维链和思维树提示

    研究人员开发了一个名为FGDM的新框架,用于检测和修复软件错误。这个多智能体系统利用具有思维链和思维树提示的大型语言模型(LLMs)来理解代码依赖关系。该框架将代码转换为流程图,识别错误并生成修复方案,并与FAISS向量数据库集成以检索过去的类似问题。在C和Python的100多个程序上进行的实验表明,FGDM的性能优于现有方法,显著降低了Levenshtein距离并提高了余弦相似度。

  10. TOOL · CL_13967 ·

    YourMemory 为 AI 代理添加生物衰减记忆,提高召回率

    一款名为 YourMemory 的新开源工具已发布,旨在为 AI 代理提供模仿人类回忆的持久记忆能力。它允许 AI 助手在会话中记住用户的偏好和过去的互动,避免每次都从头开始。该系统使用受艾宾浩斯遗忘曲线启发的衰减机制,重要信息保留时间更长,而过时事实会自动替换。