XML
PulseAugur coverage of XML — every cluster mentioning XML across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
AI代理审核博文;PPTX转换器遗漏SmartArt文本
一位用户测试了两个AI子代理对其AI辅助撰写的博文的表现,发现一个代理的得分是25分中的15.1分。用户还遇到了一个问题,即一个PPTX转换器未能处理SmartArt文本,该文本存储在Office Open XML演示文稿文档内的单独XML部分中。
-
分析发现,LLM提示中的漂亮JSON比CSV多使用3倍的token
最近的一项分析比较了七种数据格式在LLM提示中的token使用情况,发现漂亮的JSON比CSV消耗的token多约三倍。这种差异归因于重复的键、标点符号和不必要的缩进,这些都会增加token数量,但对模型没有好处。研究建议在提示中使用CSV或TSV来处理简单的表格数据,使用最小化JSON来处理结构化输出,使用Markdown来处理人类可读的表格,同时建议不要在提示中使用漂亮的JSON和XML,以优化成本。
-
O-Funnel 库提供从不断变化的文档中进行无损数据提取
研究人员开发了 O-Funnel,一个新颖的 Python 库,旨在无需手动编写模式即可从异构且不断变化的文档中提取数据。O-Funnel 将结构捕获与值提取分离,将 XML、JSON 和 HTML 等各种文档格式转录为统一的树状结构。这种方法确保即使在模式发生变化时,数据提取仍然健壮,正如其在模式重命名后对 PubMed 记录的完美准确性所证明的那样,其性能优于传统的基于正则表达式的解析器。
-
开发者创建工具以模拟数据渲染 Android UI 布局
一位开发者创建了一个名为 `android-ui-renderer-mcp` 的工具,可以将 Android XML 布局渲染成 PNG 图片并提供视图树数据。该工具超越了简单的布局渲染,通过整合 Activity、Fragment 和 RecyclerView 等元素以及显式的状态数据,而不是运行完整的应用程序代码。该系统使用真实的 UI 资源,但注入用于列表和覆盖的确定性测试数据,并冻结动画以确保自动化检查的一致视觉输出。
-
新的基准测试套件旨在对工业PLC程序进行形式化验证
研究人员开发了一个新的基准测试套件,用于形式化验证IEC 61131-3梯形图程序,解决了该领域缺乏标准评估工具的问题。该套件包含来自十个工业领域的50个程序,以图形化(梯形图)和文本化(结构化文本)两种格式呈现。一项关键贡献是建立了一个地面实况方法,以确保可靠的判断,这些判断通过构造、故障注入或审计的跨工具共识来确立。该语料库、模式、验证器和复查工具被作为开放工件发布,以促进可复现的进展度量。
-
RAG分块策略影响LLM检索性能
优化检索增强生成(RAG)系统需要仔细考虑分块策略,因为嵌入质量直接影响性能。对于文本,通常建议块大小在256-512个标记之间,重叠10-20%,以平衡语义完整性和上下文保留。对于表格、JSON或XML等结构化数据,至关重要的是将每一行或每个元素转换为结构化文本片段,以保留层次关系和属性上下文,确保有意义的嵌入。
-
使用 XML 标签构建 Claude Opus 提示的指南
本文提供了一篇关于如何使用 XML 标签有效地为 Anthropic 的 Claude Opus 模型构建提示的指南。文章解释了通过以清晰、分层的方式组织输入数据和指令,这种方法如何有利于管理复杂的工作流并提高模型的性能。
-
json-repair 在提取 LLM 封装的 JSON 方面表现出色,优于 jsonshim
一项新的基准测试 MALFORMED-300 评估了解析器从格式错误的 LLM 输出中提取 JSON 的能力,特别是当 JSON 被封装在 XML、HTML 或 SQL 等其他格式中时。json-repair 工具在此特定类别中取得了完美的 25/25 分,优于 jsonshim (17/25) 和标准库 (0/25)。然而,在整个 300 个案例的基准测试中,jsonshim 仍以 94.0% 的总分领先,json-repair 以…
-
研究发现:AI智能体通过结构化条件改进文档创作
一篇新论文探讨了多智能体系统在正式文档创作中的有效性,特别是针对投标响应。研究发现,将文档转换为XML等结构化标记可以改善信息提取,但在用于条件化时会降低生成散文的质量。研究还观察到,明确命名禁止的构造会适得其反地集中错误,并且确定性窗口函数与随机标注相结合可以减少提取的需求。
-
LLM 输出的 JSON 解析器测试:jsonrepair 领先,JSON.parse 失败
对三个 JavaScript JSON 解析器——标准的 JSON.parse、jsonrepair 3.15.0 和 JSON5 2.2.3——的比较显示,它们在处理格式错误的 LLM 输出方面的能力存在显著差异。JSON.parse 能够正确识别无法恢复的错误,而 JSON5 只能修复简单的对象字面量。jsonrepair 3.15.0 表现出最强大的性能,成功修复了五种常见的 LLM 输出错误,包括尾随逗号、未加引号的键、注释以…
-
Anthropic、OpenAI的提示工程风格在分隔符上存在差异
Anthropic和OpenAI的提示工程指南有所不同,Anthropic推荐使用XML标签,而OpenAI则倾向于使用Markdown标题。这种区别产生的原因是语言模型不像解析代码那样解析提示;相反,分隔符的有效性是从训练数据中学习到的。分隔符的选择会影响代币成本,因为XML标签比Markdown标题消耗更多的代币,因此后者对于频繁提示来说更经济。
-
AI 文本重写 DOCX 面临结构和语义障碍
开发用于重写 DOCX 文件中文本的 AI 工具,其挑战超出了简单的文本提取和插入。DOCX 文件复杂的 XML 结构,包含字段代码、运行级格式和容器对象等元素,意味着简单的文本处理会破坏文档的完整性和含义。为解决此问题,一种更稳健的方法是在段落级别进行就地重写,小心地隔离关键元素,如引文、表格和公式。此外,有效的分块策略至关重要,需要语义边界和共享上下文来在整个文档中保持一致性,防止风格漂移,并确保 AI 的输出读起来是一个有凝聚力的整体。
-
XML提示提升小型语言模型性能
XML提示是一种旨在通过提供结构化上下文来提高小型语言模型(SLM)性能的技术。该方法使用类似于HTML的格式来区分提示中的指令、变量和示例,帮助通常在上下文维护和记忆方面遇到困难的SLM更清晰地处理信息。通过明确定义提示的不同部分,XML提示旨在产生更可预测和结构化的输出,这对于需要速度和遵守特定约束的应用特别有用。
-
XML标记增强LLM提示清晰度和输出一致性
在提示中使用XML标签可以显著提高Claude和GPT等大型语言模型响应的一致性和准确性。该技术通过创建明确的边界,帮助模型清晰地区分提示的不同部分,例如指令、上下文和示例。Anthropic特别推荐此方法用于Claude,它还可以用于请求结构化的、带标签的输出,从而简化对响应的程序化解析。
-
通过改进提示词来改善 Claude AI 交互的 6 种方法
本文提供了六种改进与 AI 模型 Claude 交互的技巧,强调有效的提示词是获得更好结果的关键。策略包括提供明确的成功标准、使用 XML 标签来区分代码和指令、在为复杂任务生成代码之前要求制定计划,以及使用少量示例来保持一致的编码风格。作者还建议将大型任务分解为更小的、链式步骤,并有意识地管理上下文,特别是在 Claude Code 等工具中,以防止性能下降并确保专注的问题解决。
-
Databricks 使 Variant 数据类型正式可用,以加快数据摄取速度
Databricks 宣布其 Variant 数据类型现已正式可用,旨在改进半结构化数据的摄取和查询。此功能与 Variant Shredding 一起,使用预测性优化来提高查询性能,与将数据存储为字符串相比,读取速度提高了 30 倍。已有超过 5,000 个团队使用 Variant 来摄取来自各种数据库的流式事件、API 负载和无模式数据,从而消除了数据模式化的前期成本。
-
Database Workbench 7.0.5 增加 AI 助手,加快导入速度
Database Workbench 发布了 7.0.5 版本,带来多项改进。此次更新包括对其 AI 助手的改进、更强大的 XML 数据导出功能,以及显著加快 ODS 和 XLS 文件格式的导入能力。此外,欢迎窗口也得到了优化。
-
新研究探索了本体驱动的检索和基于LLM的本体生成
两篇研究论文探讨了信息检索和本体生成的先进方法。第一篇已撤回的论文提出了一种本体驱动的方法,通过整合语义资源和用户配置文件,实现从XML文档中个性化信息检索。第二篇论文介绍了RIGOR,一个检索增强的迭代生成管道,它使用LLM将关系数据库模式转换为语义丰富的OWL2DL本体,只需最少的人工干预。两篇论文都强调了语义网技术和LLM在增强数据理解和可访问性方面的潜力。
-
新框架简化了领域专家的数据质量分析
研究人员开发了一个名为质量模式模型(QPM)的新框架,以帮助领域专家定义数据质量分析,而无需深厚的技术专长。QPM 使用独立于技术的查询模板,简化了该过程,并避免了为不同数据库技术重新定义分析的需要。概念验证实现证明了 QPM 在 XML、RDF 和 Neo4j 数据库上的表达能力和可用性,表明领域专家可以独立创建基于模板的质量分析。
-
AI日益增长的作用将网络开发重点从传统SEO转移
网络开发者越来越需要优化他们的网站,不仅是为了搜索引擎,也是为了AI系统。虽然传统的SEO侧重于检索和排名,但AI助手旨在理解上下文并评估信息内的关系。Schema.org、Open Graph Protocol和XML站点地图等技术对于构建数据至关重要,以帮助机器更有效地理解网站内容和个人专业身份。