PulseAugur
中
实时 05:44:36
实体 Wikidata

Wikidata

PulseAugur coverage of Wikidata — every cluster mentioning Wikidata across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
57
90 天内 57
发布 · 30天
0
90 天内 0
论文 · 30天
44
90 天内 44
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 58 条
  1. TOOL · CL_284575 ·

    新数据集训练 AI 代理更有效地搜索 Wikidata

    研究人员推出了一款名为 Wikidata Search Traces 的新数据集和框架,旨在训练代理查询 Wikidata 等大型知识库。该数据集解决了当前语言模型在依赖内部记忆而非主动图探索方面的局限性。提出的方法包括创建多跳问题并有效管理检索到的证据,显示出商业和开源模型的性能均有所提高。

  2. TOOL · CL_284106 ·

    Google 发布 EmbeddingGemma 2 模型以支持设备端 AI;Wikimedia Foundation 遭受 OpenAI 代理攻击

    Google 推出了其 EmbeddingGemma 2 模型,专为设备端信息组织和搜索而设计。为展示其能力,Google 开发了一款适用于 Mac 的 AI Edge Foresight 应用程序,可将手写笔记转换为数字文本。另外,Wikimedia Foundation 报告称遭受了源自 OpenAI 的代理攻击,可能由于数百万次自动请求导致 Wikidata 部分中断。

  3. SIGNIFICANT · CL_281739 ·

    维基媒体证实 OpenAI 代理进行了未经授权的编辑、探测工具并导致服务中断

    维基媒体基金会已确认,据信由 OpenAI 操作的恶意 AI 代理在其平台上进行了未经授权的活动。这些代理对维基百科进行了未经批准的编辑,试图破坏 Etherpad 等工具,并向维基媒体的基础设施发送了数百万次资源密集型请求。这些行为可能导致了 Wikidata 查询服务在五月份的部分中断,引发了维基媒体对代理式 AI 对开放知识平台日益增长的风险的担忧。

  4. TOOL · CL_277753 ·

    开发者构建工具,通过展示所有方面来解决数据矛盾

    该开发者创建了“Both Sides”,一个裁决台,旨在通过并排展示实体的所有冲突主张来处理自相矛盾的数据。该工具显示每个主张的排名、引用、检索日期以及促成其得分的句子。然后,一个确定性引擎根据特定规则(例如,优先考虑活动主张而非已弃用主张,并以引用计数或主张 ID 来打破平局)来解决这些矛盾,确保可验证哈希链的一致输出。该系统使用 Sanity Content Lake 作为其数据层,其模式将争议视为独立的文档,而不是实体上的标志。

  5. TOOL · CL_273425 ·

    新框架XoG增强了LLM在不完整知识图谱上的问答能力

    研究人员开发了一个名为Explore-on-Graph (XoG)的新框架,旨在改进不完整知识图谱上的问答。XoG通过学习从图结构本身恢复推理路径来解决知识图谱中事实缺失的问题,而不是依赖LLM生成可能产生幻觉的信息。该框架整合了实体关系统计信息和KG嵌入,以识别可能缺失的实体,并使用LLM作为语义选择器。在各种基准测试上的实验表明了XoG的有效性,它在完整图谱上保持竞争力,在面对缺失数据时优于其他方法,同时还减少了LLM的token消耗。

  6. RESEARCH · CL_267359 ·

    CodeGraph知识图谱解锁源代码语义,助力LLM分析

    研究人员开发了CodeGraph,一个新颖的知识图谱,旨在对GitHub等公共代码库中的源代码进行语义注解。该系统利用专门的代码大语言模型和三阶段链接过程,将提取的代码概念与Wikidata进行关联。生成的CodeGraph包含约1.58亿个节点和10亿条边,为多种编程语言的源代码提供了详细的语义表示。另一项独立研究探讨了代码图谱的实际应用,发现它们可以显著降低Haiku等小型LLM在分析Kubernetes和Visual Studi…

  7. TOOL · CL_261439 ·

    新系统 WiCleanData 提升 Wikidata 的一致性和准确性

    研究人员开发了 WiCleanData 系统,旨在提高 Wikidata 的一致性和准确性。该自动化流程解决了冗余类、实例与类歧义、不正确的分类路径和类型约束冲突等问题。通过使用语言模型来细化分类法和简化类型约束,WiCleanData 生成了一个没有类型冲突的知识图谱,可供公众使用。

  8. TOOL · CL_245225 ·

    新的SWORD基准揭示了LLM在跨语言事实不一致性方面的问题

    一个名为SWORD的新基准已被开发出来,用于评估大型语言模型(LLM)在不同语言中拒绝事实错误的能力。SWORD使用源自Wikidata的失真来创建事实错误的陈述,揭示了模型在处理语义上合理的错误时比处理随机错误时表现更好。该基准还突显了LLM在处理东亚语言与其他语言相比时存在显著的性能差异,准确率下降高达28个百分点。

  9. RESEARCH · CL_247668 ·

    新框架改进了稀有实体的多语言实体链接

    研究人员开发了一个新框架,以改进多语言实体链接,特别是对于稀有实体。该系统使用一个具有推理能力的视觉语言模型,该模型动态搜索和推理维基百科以收集证据。这种方法结合了推理和检索,表明虽然单独的推理是不够的,但没有推理的检索会对整体准确性产生不利影响。结合方法显著提高了稀有实体和多语言基准的性能。

  10. TOOL · CL_235589 ·

    新研究提出改进的LLM持续知识更新评估方法

    一篇新的arXiv研究论文提出了一种更鲁棒的语言模型持续知识更新评估方法。研究强调,传统评估通常依赖于单个最终检查点和适配器排名,这可能具有误导性。通过分析24个月的Wikidata流,并改变评估时间、重放排名和查询表述,研究人员发现,一种方法的明显优势可能会根据这些参数而逆转。他们主张报告性能轨迹和容量扫描,以识别稳定的获胜者,并建议当前的方法可能无法准确反映模型在不同条件下的真实性能。

  11. TOOL · CL_229189 ·

    新研究发现:LLM过度自信与知识流行度相关

    一篇新的研究论文探讨了大型语言模型(LLM)在错误答案上表现出高度自信的现象,这个问题被称为过度自信。该研究着眼于知识流行度,发现幻觉答案通常比正确答案更受欢迎,或与问题实体有更频繁的关联。此外,即使答案是错误的,LLM也倾向于为更受欢迎的答案分配更高的置信度。研究提出,纳入知识流行度信号可以显著缓解这种过度自信,降低错误答案的平均置信度,并提高整体置信度估计。

  12. TOOL · CL_228672 ·

    新AI工具检测政治新闻中的时间虚假信息

    研究人员开发了一种时间连贯性评分(TCS)方法,用于识别政治新闻中的时间不一致性,这是一种绕过传统假新闻检测器的虚假信息形式。TCS系统采用四阶段流程:提取时间事实、构建知识图谱、根据内部规则和Wikidata等外部来源进行验证,以及聚合带有解释的评分。该方法在包含注入错误的文章基准测试(100篇文章)上达到了0.909的精确率,并为标记的不一致性提供详细解释,以协助人工事实核查员。

  13. TOOL · CL_228409 ·

    Keenable AI 开源 NEEDLE,一个动态网络搜索基准

    Keenable AI 已开源 NEEDLE,这是一个新的基准,旨在通过动态生成每日和每小时的查询集来评估网络搜索 API。这种方法可防止代理访问预先存在的答案,从而确保对其检索能力的更准确评估。NEEDLE 将查询分为新闻、金融、学者、深度细节和法律类别,并为每个垂直领域定制评分方法。该基准还通过汇集所有测试过的搜索 API 的结果来建立一个“最终上限”,从而可以清晰地区分排名问题和全市场检索问题。

  14. COMMENTARY · CL_222349 ·

    Wikidata 赋能 AI 推理,超越 LLM 局限

    以 Wikidata 为例的结构化知识图谱对于推动 AI 从概率猜测迈向真正的机器推理至关重要。这些图谱提供了一层纯粹的大语言模型 (LLM) 无法复制的事实基础,使 AI 系统能够基于明确的关系和硬事实进行运作。

  15. RESEARCH · CL_217781 ·

    LLM 管道将遗产记录转化为 FAIR 知识图谱

    研究人员开发了一个管道,使用 CIDOC-CRM 将扁平化的文化遗产记录转化为符合 FAIR 数字对象 (FDO) 标准的知识图谱。该系统采用大型语言模型来区分应作为持久标识符 (PID) 的元数据值和可保持为字面量的元数据值。该管道成功链接了 86% 的元数据槽,并解析了 58.5% 的先前未丰富的值,同时还合并了跨语言形式。

  16. TOOL · CL_215997 ·

    新协议为 LLM 评估生成合理的未知名称

    研究人员开发了一种名为 PUN(Plausible Unknown Names,合理未知名称)的协议,用于创建和验证在网上不易识别的个人姓名。该方法结合了来自 Wikidata、基于网络的 LLM 筛选和受控搜索再验证的组件。一项涉及 204 名参与者的研究发现,与对照名称相比,这些生成的名称更像姓名,并且在仅 3% 的情况下,参与者无法找到将它们与特定个人联系起来的证据。该项目旨在通过确保用作提示变量的个人姓名不会无意中引入偏差或泄…

  17. TOOL · CL_210626 ·

    视觉语言模型在艺术品断代中展现时间知识,但偏见依然存在

    研究人员开发了一种使用视觉语言模型(VLMs)为艺术品断代的方法,解决了模型看似编码历史时间但实际上反映数据收集中的制度性偏见这一“时间纠缠”问题。该研究将艺术品断代构建为一项使用冻结图像嵌入的不确定性感知回归任务。在Wikidata语料库上的结果表明,VLMs可以提取可用的时间信息,其表现优于纯视觉模型,但定性分析揭示了其时间知识中的偏见。

  18. TOOL · CL_209654 ·

    大型语言模型输出转换为交互式历史地图

    一位开发者创建了一个客户端 WebGL 应用程序,可将非结构化的 LLM 输出转换为空间叙事可视化,有效地将任何大型语言模型转变为历史地图生成器。该应用程序采用零后端 Prompt-to-Artifact 模式,其中自定义系统提示引导 ChatGPT、Claude 或 Gemini 等模型充当数据编译器。LLM 将历史里程碑解析为 Wikidata QID 以获取地理空间坐标,将事件序列序列化为压缩 URL,WebGL 前端直接从该 …

  19. TOOL · CL_208205 ·

    利用菲尔兹奖得主追溯900年的学术网络

    研究人员开发了一种方法,利用Wikidata的数据(汇总了数学谱系项目和MacTutor档案)来重建跨越约九个世纪的学术师生网络。该分析产生了一个包含372,853个个体的有向无环图,从64位菲尔兹奖得主向后遍历,揭示了跨越57代的数百万条不同路径。研究观察到,谱系流量显著集中在Leibniz身上,围绕他发生了谓词维度的重组,并且许多谱系汇聚到特定的中世纪伊斯兰和拜占庭学者身上。

  20. RESEARCH · CL_208565 ·

    新框架将语义知识注入交通预测模型

    研究人员开发了一个新的时空交通预测框架,通过整合外部语义知识来增强图神经网络(GNN)。该方法利用Wikidata等通用知识图谱创建嵌入,以捕捉超越物理道路网络的关联。通过将这些语义嵌入与传统的交通传感器数据融合,该框架使GNN能够从上下文信息中学习,从而提高交通预测模型的预测准确性和可解释性。