XML
PulseAugur coverage of XML — every cluster mentioning XML across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
研究发现:AI智能体通过结构化条件改进文档创作
一篇新论文探讨了多智能体系统在正式文档创作中的有效性,特别是针对投标响应。研究发现,将文档转换为XML等结构化标记可以改善信息提取,但在用于条件化时会降低生成散文的质量。研究还观察到,明确命名禁止的构造会适得其反地集中错误,并且确定性窗口函数与随机标注相结合可以减少提取的需求。
-
LLM 输出的 JSON 解析器测试:jsonrepair 领先,JSON.parse 失败
对三个 JavaScript JSON 解析器——标准的 JSON.parse、jsonrepair 3.15.0 和 JSON5 2.2.3——的比较显示,它们在处理格式错误的 LLM 输出方面的能力存在显著差异。JSON.parse 能够正确识别无法恢复的错误,而 JSON5 只能修复简单的对象字面量。jsonrepair 3.15.0 表现出最强大的性能,成功修复了五种常见的 LLM 输出错误,包括尾随逗号、未加引号的键、注释以…
-
Anthropic、OpenAI的提示工程风格在分隔符上存在差异
Anthropic和OpenAI的提示工程指南有所不同,Anthropic推荐使用XML标签,而OpenAI则倾向于使用Markdown标题。这种区别产生的原因是语言模型不像解析代码那样解析提示;相反,分隔符的有效性是从训练数据中学习到的。分隔符的选择会影响代币成本,因为XML标签比Markdown标题消耗更多的代币,因此后者对于频繁提示来说更经济。
-
AI 文本重写 DOCX 面临结构和语义障碍
开发用于重写 DOCX 文件中文本的 AI 工具,其挑战超出了简单的文本提取和插入。DOCX 文件复杂的 XML 结构,包含字段代码、运行级格式和容器对象等元素,意味着简单的文本处理会破坏文档的完整性和含义。为解决此问题,一种更稳健的方法是在段落级别进行就地重写,小心地隔离关键元素,如引文、表格和公式。此外,有效的分块策略至关重要,需要语义边界和共享上下文来在整个文档中保持一致性,防止风格漂移,并确保 AI 的输出读起来是一个有凝聚力的整体。
-
XML提示提升小型语言模型性能
XML提示是一种旨在通过提供结构化上下文来提高小型语言模型(SLM)性能的技术。该方法使用类似于HTML的格式来区分提示中的指令、变量和示例,帮助通常在上下文维护和记忆方面遇到困难的SLM更清晰地处理信息。通过明确定义提示的不同部分,XML提示旨在产生更可预测和结构化的输出,这对于需要速度和遵守特定约束的应用特别有用。
-
XML标记增强LLM提示清晰度和输出一致性
在提示中使用XML标签可以显著提高Claude和GPT等大型语言模型响应的一致性和准确性。该技术通过创建明确的边界,帮助模型清晰地区分提示的不同部分,例如指令、上下文和示例。Anthropic特别推荐此方法用于Claude,它还可以用于请求结构化的、带标签的输出,从而简化对响应的程序化解析。
-
通过改进提示词来改善 Claude AI 交互的 6 种方法
本文提供了六种改进与 AI 模型 Claude 交互的技巧,强调有效的提示词是获得更好结果的关键。策略包括提供明确的成功标准、使用 XML 标签来区分代码和指令、在为复杂任务生成代码之前要求制定计划,以及使用少量示例来保持一致的编码风格。作者还建议将大型任务分解为更小的、链式步骤,并有意识地管理上下文,特别是在 Claude Code 等工具中,以防止性能下降并确保专注的问题解决。
-
Databricks 使 Variant 数据类型正式可用,以加快数据摄取速度
Databricks 宣布其 Variant 数据类型现已正式可用,旨在改进半结构化数据的摄取和查询。此功能与 Variant Shredding 一起,使用预测性优化来提高查询性能,与将数据存储为字符串相比,读取速度提高了 30 倍。已有超过 5,000 个团队使用 Variant 来摄取来自各种数据库的流式事件、API 负载和无模式数据,从而消除了数据模式化的前期成本。
-
Database Workbench 7.0.5 增加 AI 助手,加快导入速度
Database Workbench 发布了 7.0.5 版本,带来多项改进。此次更新包括对其 AI 助手的改进、更强大的 XML 数据导出功能,以及显著加快 ODS 和 XLS 文件格式的导入能力。此外,欢迎窗口也得到了优化。
-
新研究探索了本体驱动的检索和基于LLM的本体生成
两篇研究论文探讨了信息检索和本体生成的先进方法。第一篇已撤回的论文提出了一种本体驱动的方法,通过整合语义资源和用户配置文件,实现从XML文档中个性化信息检索。第二篇论文介绍了RIGOR,一个检索增强的迭代生成管道,它使用LLM将关系数据库模式转换为语义丰富的OWL2DL本体,只需最少的人工干预。两篇论文都强调了语义网技术和LLM在增强数据理解和可访问性方面的潜力。
-
新框架简化了领域专家的数据质量分析
研究人员开发了一个名为质量模式模型(QPM)的新框架,以帮助领域专家定义数据质量分析,而无需深厚的技术专长。QPM 使用独立于技术的查询模板,简化了该过程,并避免了为不同数据库技术重新定义分析的需要。概念验证实现证明了 QPM 在 XML、RDF 和 Neo4j 数据库上的表达能力和可用性,表明领域专家可以独立创建基于模板的质量分析。
-
AI日益增长的作用将网络开发重点从传统SEO转移
网络开发者越来越需要优化他们的网站,不仅是为了搜索引擎,也是为了AI系统。虽然传统的SEO侧重于检索和排名,但AI助手旨在理解上下文并评估信息内的关系。Schema.org、Open Graph Protocol和XML站点地图等技术对于构建数据至关重要,以帮助机器更有效地理解网站内容和个人专业身份。
-
作者认为AI的采用与过去的XML过度使用相似
作者将过去XML的过度使用与当前将AI应用于解决问题的趋势进行了类比。他们认为,就像XML经常被过度应用来解决问题一样,现在AI也经常被用作解决方案,而不考虑它是否是最合适的工具。这一观察引出了一个更广泛的问题,即这种过度应用的模式是否是所有革命性技术的共同点。
-
PromptPack 为推荐平台将 LLM 注释成本降低 89%
研究人员开发了 PromptPack,这是一个旨在降低在线推荐平台使用大型语言模型 (LLM) 的成本并提高效率的新系统。该系统通过实现上下文批处理来解决与单个 LLM 调用相关的高令牌成本问题,该批处理结合了共享系统提示和严格的 XML 结构来同时处理多个广告素材。据报道,与现有方法相比,这种方法将 LLM 成本降低了 89%,吞吐量提高了 2.5 倍,同时保持了 AUC 等性能指标,并引入了一个名为 Volume-Weighted…
-
新的VCG-Bench基准评估视觉语言模型在结构化图表任务上的表现
研究人员推出了VCG-Bench,这是一个旨在评估视觉语言模型(VLMs)在结构化图表生成和编辑任务上的新基准。该基准采用“图表即代码”方法,使用mxGraph XML来实现创建和修改图表的精确符号逻辑,超越了传统的基于像素的合成。VCG-Bench包含一个跨越六个领域的1,449个图表的数据集,以及一个具有执行成功率和风格一致性分数等指标的定制评估协议,突显了当前VLMs在结构保真度和推理方面的局限性。
-
开发者为ShapeCraft添加GBNF语法支持,以控制本地LLM输出
一位开发者通过添加对GBNF语法的支持,增强了ShapeCraft结构化输出库,使用户能够让本地LLM生成严格遵循预定义格式的输出。此新功能通过`gbnf`模式类型实现,可防止模型产生格式错误的响应,这是本地部署中常见的问题。该实现包括一个原生的`llama.cpp`后端,可在令牌级别强制执行语法,并为OpenAI和Groq等其他后端提供尽力而为的方法,其中语法被注入到提示中,并对输出进行验证。
-
WordPress迁移到Neleto:一个现实的、耗时一天的过程
一个详细的演练描述了将一个40页的网站从WordPress迁移到Neleto的过程,并强调虽然核心内容的导出和导入可以在一小时内完成,但包括重建页面构建器布局和设置重定向在内的整个过程大约需要一整天。此次迁移的驱动因素是客户希望获得可预测的欧盟托管服务、减少插件带来的维护开销,以及更用户友好的内容编辑体验,尤其是在通用数据保护条例(GDPR)下的数据隐私方面。
-
XML提示通过为模型构建提示来提高AI准确性
使用XML标签进行提示工程可以显著提高AI模型输出的准确性和相关性,超越通用响应,提供可用于决策的信息。这种结构化方法有助于Claude和ChatGPT等模型区分上下文、数据和指令,从而获得更精确的结果。通过使用标签明确定义这些部分,用户可以指导AI理解具体情况和受众,从而克服非结构化文本提示的局限性。
-
MCP:用于动态工具发现的 AI 集成层
模型上下文协议 (MCP) 是一种集成层,旨在帮助 AI 代理发现和利用外部工具和服务。与允许开发人员直接使用的特定端点的传统 API 不同,MCP 为 AI 模型与这些功能进行交互提供了一种标准化方式。MCP 服务器充当现有系统的包装器,允许 AI 代理动态发现可用工具、理解其参数并执行它们以实现复杂的工作流。虽然 REST API 在服务到服务通信中仍然至关重要,但 MCP 促进了由 AI 驱动的决策和工具使用,从而实现了更复杂的…
-
新的LLM微调方法优化停电报告生成
研究人员开发了POTracker,一种新颖的LLM微调方法,旨在生成符合严格行业标准的停电报告。该方法使用了一种新的损失函数POTrackerLoss,该函数同时考虑了与真实报告的文本相似性和结构相似性。当应用于Qwen2.5-7B-Instruct模型时,POTracker在对1000份报告的研究中显示出显著的改进,准确率提高了51%,结构准确率达到了86.47%。领域专家还将生成的报告评分为4.03分(满分5分),平均得分很高。