named-entity recognition
PulseAugur coverage of named-entity recognition — every cluster mentioning named-entity recognition across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新的ContractScrub基准测试揭示了LLM在法律合同审查中的弱点
研究人员推出了ContractScrub,这是第一个专门用于评估大型语言模型(LLM)在合同审查能力方面的基准测试。这项任务涉及审查法律协议中的错误和不一致之处,由于其常规性和注重细节的性质,对于自动化至关重要。尽管LLM在长上下文推理和命名实体识别方面具有潜力,但前沿模型在此基准测试上的表现却出人意料地差,只有一个模型达到了0.75的宏平均召回率。这凸显了当前模型的局限性,以及需要进行特定领域的评估来衡量实际影响。
-
新的AWED-PIPER框架提供36种语言的FgNER和PII匿名化
研究人员开发了AWED-PIPER,一个开源框架,用于细粒度命名实体识别(FgNER)和个人身份信息(PII)匿名化。该系统集成了代理工具、Web应用程序和54个专家探测器模型,支持36种语言。AWED-PIPER可以识别上下文实体(如人物和地点),以及技术性PII(如电子邮件和电话号码),提供提取和可逆匿名化功能。该框架因其广泛的语言支持(包括极低资源语言)而备受关注。
-
新的几何过滤方法增强了用于文本分类的LLM生成数据
研究人员开发了一种新颖的几何过滤框架,以提高大型语言模型(LLM)为文本分类任务生成的合成数据的质量。该方法根据LLM生成的样本在嵌入空间中到真实数据点的欧氏距离进行评估,仅选择在几何上与目标类别一致的样本。该方法在各种数据集和分类器上均显示出显著的改进,优于SMOTE等现有方法,并在命名实体识别任务中表现出特别的功效。
-
CoffeeBSD寻求Codeberg上open-slopware问题的帮助
CoffeeBSD项目正在Codeberg平台上寻求与“open-slopware”相关问题的协助。具体来说,需要帮助来解决在Codeberg上的问题跟踪器中记录的问题。此求助呼吁强调了该项目与开源社区的互动以及其对协作解决问题的依赖。
-
AssemblyAI 推出全面的语音 AI 代理评估方法
AssemblyAI 推出了一种评估语音 AI 代理的方法,重点关注超越简单语音转文本基准的全面测试。他们的方法结合了基于模拟的测试,以衡量关键绩效指标,如响应时间、语义准确性、命名实体识别和任务完成率。这个详细的评估框架旨在为代理的真实能力提供更强大的评估。
-
CNM-BERT 通过嵌入汉字结构增强中文NLP
研究人员开发了CNM-BERT,一种增强基于BERT的中文自然语言处理模型的创新方法。该方法融入了汉字(通常被标准基于词元的编码器忽略)的组合结构。通过解析表意描述序列(IDS)为树状结构并使用递归Tree-MLP进行编码,CNM-BERT在不改变Transformer架构核心组件的情况下,将结构化信息注入现有模型。评估结果表明,CNM-BERT在罕见字和未登录字上的性能显著提升,优于ChineseBERT等强大基线模型,并在CLUE…
-
渥太华大学使用Gemini和Claude LLM赢得拉丁语NER任务
渥太华大学的研究人员在古典拉丁语的EvaLatin 2026命名实体识别(NER)共享任务中取得了顶级成果。通过采用大型语言模型Gemini 2.5 Pro和Claude Sonnet 4.5的提示工程,他们证明了跨语言迁移学习对于代表性不足的古代语言的有效性。他们的系统在粗粒度和细粒度NER子任务中均获得第一名,在各种评估指标上均优于所有其他提交。
-
新的HomoEnsNER模型提升了古吉拉特语NER性能
研究人员开发了HomoEnsNER,一种针对古吉拉特语的命名实体识别(NER)的新方法。该方法利用了五个独立微调的GujaratiBERT模型的同质集成,与单个GujaratiBERT基线和六个异质替代方案相比,其F1分数达到了0.8442。研究表明,对于像古吉拉特语这样的低资源语言,通过同质集成实现的语言对齐比架构多样性更有效的策略。
-
DE-NER框架通过LLM对话增强零样本NER
研究人员开发了DE-NER,一个利用大型语言模型(LLM)对话能力的新型零样本命名实体识别(NER)框架。该方法旨在通过对话引导直接从LLM中提取知识,克服传统提示和演示工程的局限性。实验表明,DE-NER在各种基准测试中的F1分数平均提高了3.75%,显著优于现有方法。
-
Graph RAG系统应对知识图谱更新挑战
本文探讨了维护企业知识图谱所面临的挑战,特别是处理增量更新时的问题。作者开发了一个用于东亚企业情报的Graph-RAG系统,并强调了边界实体解析和缺乏时间上下文的事实取代等问题。提出的解决方案包括用于实时实体匹配的“resolve_against_live_graph”模式,以及将属性值建模为有时间限制的断言以有效管理历史数据。
-
新研究探索了在数据有限的情况下进行命名实体识别的无监督方法
本文研究了在处理多个领域中小型或无标签数据集时的命名实体识别(NER)的无监督方法。它提出使用无监督预训练来识别实体而无需标注,然后在有限的数据集上进行迁移学习。该研究通过探索数据增强、少样本学习和域对抗训练等技术来解决域变化和数据稀疏性等挑战,以提高NER系统的性能和适应性。
-
新的LA-RL框架增强大型语言模型信息抽取能力
研究人员开发了LA-RL,一个旨在提高大型语言模型信息抽取能力的新型框架。该方法使用任务特定的诊断标签来指导自我纠正,使模型能够识别和修复与缺失跨度、不正确标签或无效关系顺序相关的错误。在命名实体识别、关系抽取和事件抽取任务上的实验表明,与标准的监督微调相比,性能有了显著提升,在SciER和DuEE1.0等数据集上尤为突出。
-
新的两步法提高了职业编码的准确性
研究人员推出了一种新颖的两步职业编码方法,这项任务对于将职位名称链接到职业分类的劳动力市场研究至关重要。与现有的单步方法相比,这种新方法将职位名称的识别与编码的分配分离开来,提高了准确性、鲁棒性和可解释性。该系统最初是为德语文档开发的,它使用领域特定的命名实体识别(NER)模型进行标题提取,并使用基于边距的置信度标准映射到分类。源代码和评估脚本是公开的,以确保可重复性。
-
AI利用OCR和NLP实现房地产数据提取的变革
人工智能正在通过采用光学字符识别(OCR)、自然语言处理(NLP)和命名实体识别(NER)等技术,彻底改变房地产数据提取。这些方法将契约、抵押和法律记录等非结构化文档转换为结构化的房地产数据。这种转变通过使信息更易于访问和使用,从而简化了房地产业务。
-
CrimeNER Demo 推出用于犯罪数据提取和分类的 AI
研究人员开发了 CrimeNER Demo,这是一个专为从文档中提取和分类犯罪相关信息而设计的 AI 平台。该平台提供在 CrimeNER 数据库上训练的预训练命名实体识别 (NER) 模型,并允许用户使用自己的标注数据对这些模型进行微调。该工具旨在推进犯罪相关 NER 的研究,并为执法部门和研究人员提供自动提取犯罪信息的实用解决方案。
-
人工智能关键词提取研究强调众包数据的道德管理
牛津大学的一篇新论文探讨了使用人工智能从众包数据集中提取关键词,并以“他们的最佳时光在线档案馆”为例进行了案例研究。该研究评估了三种自然语言处理方法:命名实体识别、关键词提取和主题建模,测试了从统计方法到生成式人工智能的各种人工智能技术。研究结果表明,虽然自然语言处理方法在对大规模关键词提取方面显示出潜力,但没有一种单一的方法是足够的,并且模型选择会影响结果。该论文还强调了与从涉及在世贡献者的数据集中进行自动关键词提取相关的道德管理责…
-
论文详述学术会议数据的知识图谱构建
本文探讨了深度学习和知识图谱技术在科学技术学术会议数据分析中的应用。文章详细介绍了命名实体识别、语义文本相似度、趋势预测等关键技术,以构建精准的会议画像。旨在帮助研究人员从海量的会议数据中高效提取有价值的信息,支持会议知识服务的发展。
-
新论文提出使用知识图谱构建详细的科学资源画像
一篇新论文提出了一种方法,通过整合知识图谱技术、文本表示学习和实体提取,来创建科学资源的详细表示。作者们强调了在线科学数据的爆炸式增长以及当前管理标准在准确捕捉这些资源中的关系和信息方面的局限性。他们的方法旨在构建全面的科学材料“画像”,以更好地挖掘其潜在价值。
-
新型CrimeNER数据集和NER系统发布,服务于执法部门
研究人员开发了CrimeNER,一个旨在从犯罪相关文档中提取关键信息的新型命名实体识别(NER)系统和数据库。CrimeNER-db包含1500多份经过标注的文档,这些文档来自关于恐怖袭击的公开报告和美国司法部的新闻稿。该系统定义了4个粗粒度和21个细粒度的实体类型,并通过全监督和少样本学习模型的实验证明了其有效性。
-
新框架评估LLM输出的可认证性,识别理论极限
研究人员开发了一个框架,用于评估大型语言模型(LLM)在命名实体识别和问答等结构化生成任务中的输出可认证性。他们得出了一个不可能性的结果,指出了在何种情况下,一致性风险控制(CRC)无法满足用户指定的风险目标。该研究还分析了一系列界限,包括Hoeffding、经验Bernstein和e-CRC,证明了认证率的显著提高,尤其是在Hoeffding到Bernstein之间。在数据集迁移下,自适应一致性推理(ACI)被验证可以减少风险目标违…