SpaCy
PulseAugur coverage of SpaCy — every cluster mentioning SpaCy across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
AI/ML技术回顾:Scikit-learn、LangGraph及其他60种评估
对62种AI和ML技术的审查,重点介绍了哪些工具被持续选择重复使用,以及五种被搁置的工具和评估者之间的分歧领域。分析涵盖了广泛的库和平台,包括scikit-learn、Pandas、NumPy、PyTorch、TensorFlow、Keras和Hugging Face Transformers等热门选择。它还涉及了SpaCy和Natural Language Toolkit等自然语言处理工具,以及OpenAI、Anthropic、Go…
-
使用 OpenCV、Presidio 和 LangGraph 构建安全的文档处理流程
本教程指导开发者构建一个名为 SecureKiosk AI 的安全文档处理流程。该系统使用 OpenCV 和 Tesseract 等本地工具进行图像处理和文本提取,然后使用 Microsoft Presidio 和 spaCy 检测和编辑个人身份信息(PII)。LangGraph 用于将此流程管理为有弹性的状态机,确保敏感数据在传输到外部 LLM API 之前被屏蔽,从而降低隐私风险。
-
Python脚本使用spaCy从文本中提取实体
一个Python脚本已被开发用于对原始文本执行命名实体识别(NER),提取组织、人物和地缘政治实体。这个中级工具,用216行Python代码编写,利用spaCy库,专为分类和商业智能任务设计。
-
设备端 NER 模型在准确性、成本和可靠性方面接受评估
一项新近发表在 arXiv 上的研究评估了九种用于设备端部署的命名实体识别 (NER) 系统,考虑了准确性、成本、可靠性和置信度。该研究比较了各种参数大小和数据集上的经典标签器、双向编码器专家以及生成式大型语言模型 (LLM)。研究结果表明,虽然较大的 LLM 在准确性方面具有竞争力,但较小的编码器模型由于其较小的尺寸和更快的延迟,在可部署性方面提供了显著优势,尽管生成式模型可能产生相当比例的无效输出。
-
Telveguard AI 网关为合规性屏蔽土耳其个人数据
一个名为 Telveguard 的开源 AI 网关已被开发出来,以帮助公司遵守数据保护法规,尤其是在土耳其。该工具充当反向代理,在将请求发送到外部 AI 模型之前屏蔽土耳其身份证号 (TCKN) 和 IBAN 等敏感个人数据。它确保这些数据保留在公司的控制之下,解决了通用 PII 检测工具经常遗漏的、与土耳其数据格式和字符集相关的特定挑战。Telveguard 通过在外部调用期间用占位符替换敏感信息并在收到响应后恢复这些信息,来支持 …
-
新数据集HUMAID-NER助力灾难推文分析
研究人员推出HUMAID-NER,一个用于从灾难相关推文中提取结构化信息的新型数据集。该数据集基于HumAID基准构建,包含60,000条英文灾难推文,标注了十种与操作相关的实体类型,产生了约175,000个标注实体跨度。标注过程结合了spaCy transformer模型、领域特定模式和正则表达式的混合流水线。此外,还提出了一种利用RoBERTa-large编码器的联合多任务学习框架,以同时执行命名实体识别和人道主义事件分类,并取得…
-
开源工具为 Anthropic 的 Claude API 增加了治理功能
一位开发者创建了一个名为 enterprise-claude-kit 的开源 Python 库,为 Anthropic Claude API 增加了治理层。该层位于应用程序和 Claude API 之间,提供诸如 PII 过滤、关键字阻止、提示长度限制、成本监控和防篡改审计日志记录等功能。该工具设计易于集成,无需外部服务,并使用 SQLite 进行持久化,开销极小。
-
新研究揭示 PII 检测系统在真实数据偏移下表现不佳
一篇题为“Mind the Gap: PII 检测系统中的鲁棒性风险”的新研究论文,强调了当前个人身份信息 (PII) 检测系统存在的重大漏洞。该研究评估了基于编码器的 NER、基于规则的混合检测以及生成式 LLM 提取方法,发现所有这些方法在面对现实世界分布偏移(如嘈杂或非结构化输入)时,性能都会显著下降。研究提出了一个带有 QA 驱动反馈循环的混合检测流程,以改进风险缓解,并发布了一个新的基准,以促进 PII 系统的分布外 (OO…
-
可执行评分标准框架提升LLM评估效率
研究人员推出了一种名为ExecRubrics的新框架,该框架将评估评分标准表示为可执行的Python程序。这种方法旨在通过提供固定、可检查的决策程序来提高语言模型评估的透明度和效率。ExecRubrics可以替代昂贵的黑盒LLM裁判,提供更快、更少歧义的评估,尤其适用于长篇回复。该框架在HealthBench、HelpSteer和ArgQuality等基准测试中取得了成功,其准确性与传统的自然语言评分标准相当或更高,同时显著降低了评估延迟。
-
New spaCy-based POS tagger achieves high accuracy for Scottish Gaelic
研究人员使用 spaCy 自然语言处理框架,为苏格兰盖尔语(一种濒危且形态复杂的语言)开发了一个词性标注器。在最少的预处理和配置下训练了两个模型:一个使用细粒度标签集,准确率达到 88.6%;另一个使用粗粒度标签集,准确率达到 93.7%。这些结果表明,即使在标注数据有限和语言结构复杂的情况下,直接的、现成的 NLP 管道也能取得出色的性能。
-
新方法增强医学领域视觉语言模型的可解释性
研究人员开发了一种名为ParseFIxLIP的新方法,旨在提高视觉语言模型(VLMs)在医学应用中的可解释性。该新方法将树形语法分析(Tree-Gram Parsing)整合到Banzhaf交互博弈中,解决了临床术语中分词器(tokenizers)造成的概念碎片化问题。通过根据依赖分析树将语义相关的文本标记分组为连贯单元,ParseFIxLIP生成了更具可解释性的跨模态归因。该方法已在BiomedCLIP上使用ROCOv2的医学影像进…
-
新工具包增强了儿童-成人语言交互的句法分析
研究人员开发了一个名为 CAIT 的新开源工具包,旨在改进 CHILDES语料库中儿童-成人交互的句法分析。该工具包包含一个专门的依存关系解析器,其性能优于 SpaCy 和 Stanza 等通用英语解析器。CAIT 还配备了词性标注器和话语级结构标注器,能够提高语言习得研究的准确性和可重复性。
-
Claude Code 的“扩展思考”输出被发现不真实
最近的一项发现表明,AI 模型 Claude Code 生成的“扩展思考”输出并非真实。这一发现引发了对 AI 生成内容的可靠性和可信度的担忧,尤其是在 AI 被广泛应用于各行各业的背景下。建议开发者在使用此类输出时要谨慎,并考虑使用 NLP 工具对生成文本进行更深入的分析。
-
新数据集提升马来西亚英语的自然语言处理能力
研究人员开发了一个名为马来西亚英语新闻(MEN)数据集的新数据集,其中包含200篇标注了实体和关系的新闻文章。该资源旨在改进针对马来西亚英语的自然语言处理(NLP)任务,马来西亚英语与标准英语不同,并对现有的NLP模型提出了挑战。实验表明,使用此定制数据集对spaCy NER工具进行微调,显著提高了其在马来西亚英语新闻上的性能。
-
新流程为古希腊议会文本创建自然语言处理资源
研究人员开发了一个新的、可复现的流程,用于为古希腊语议会文本创建类似通用依存关系的解析资源。该工作流程解决了当前自然语言处理工具在处理古希腊历史文献方面的局限性,整合了光学字符识别(OCR)重建、大型语言模型(LLM)辅助标注和自动化验证。由此产生的数据集和方法旨在使历史议会档案更容易用于自然语言处理研究。
-
新工具包CAIT增强了儿童-成人语言交互的句法分析
研究人员开发了CAIT,一个新开源工具包,旨在分析CHILDES数据集中儿童-成人交互的句法结构。该工具包包含一个在UD-English-CHILDES树库上专门训练的最先进的依存关系解析器,与SpaCy和Stanza等通用英语解析器相比,其准确性更高。CAIT还配备了词性标注器和话语级结构标注器,能够为语言习得领域的研究提供更强大、可复现的支持。
-
自然语言处理工具比较地名识别和主题模型用于气候事件新闻
两篇新研究论文探讨了用于分析德国媒体对极端气候事件新闻报道的自然语言处理技术。一篇论文比较了 Flair、Spacy 和 Stanza 等现成命名实体识别 (NER) 工具在识别地名和对事件进行地理定位方面的性能。第二篇论文研究了使用主题模型作为二元分类器来改进相关新闻文章的检索,并将这种方法与微调的文本嵌入分类器和开源大语言模型进行了比较。
-
FGDM: 软件错误检测的推理感知多智能体框架,使用思维链和思维树提示
研究人员开发了一个名为FGDM的新框架,用于检测和修复软件错误。这个多智能体系统利用具有思维链和思维树提示的大型语言模型(LLMs)来理解代码依赖关系。该框架将代码转换为流程图,识别错误并生成修复方案,并与FAISS向量数据库集成以检索过去的类似问题。在C和Python的100多个程序上进行的实验表明,FGDM的性能优于现有方法,显著降低了Levenshtein距离并提高了余弦相似度。
-
YourMemory 为 AI 代理添加生物衰减记忆,提高召回率
一款名为 YourMemory 的新开源工具已发布,旨在为 AI 代理提供模仿人类回忆的持久记忆能力。它允许 AI 助手在会话中记住用户的偏好和过去的互动,避免每次都从头开始。该系统使用受艾宾浩斯遗忘曲线启发的衰减机制,重要信息保留时间更长,而过时事实会自动替换。