regular expression
PulseAugur coverage of regular expression — every cluster mentioning regular expression across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
视觉语言模型在文档提取方面的评估揭示了权衡取舍
一项新的研究论文探讨了使用视觉语言模型(VLM)从业务文档中提取结构化数据所涉及的权衡。该研究在一个合成支票数据集上评估了包括 GPT-5 等商业产品和 Claude Sonnet 4.5 等开源模型在内的十一个系统。微调开源 VLM 可显著提高其性能,在某些情况下甚至超过商业系统,而 GPT-5 在整体准确性方面领先,Claude Sonnet 4.5 在日期提取方面则表现不佳。该研究还引入了一个框架,帮助从业者根据质量、延迟、治理…
-
大型语言模型在评论分类测试中表现优于正则表达式
对正则表达式和Anthropic的Sonnet 5大型语言模型在评论分类方面的比较显示,该大型语言模型表现更优。正则表达式出现了三次致命错误,并且在处理上下文和新关键词方面遇到困难,而Sonnet 5的准确率达到了80%,能够正确识别上下文,甚至在没有明确关键词的情况下对关于AI工具Cursor+的评论进行分类。该大型语言模型还展示了标记不确定分类的能力,这是正则表达式所不具备的。
-
AI系统对放射学报告进行结构化并改进质量保证
一个新开发的多智能体AI系统用于放射学报告的结构化和质量保证。该系统使用本地大型语言模型和正则表达式规则,成功地将CT检查的发现组织成标准化的解剖学部分。在两位放射科医师的评估中,该系统表现良好,84%的报告在整体质量保证方面被评为“优秀”或“良好”。
-
AI代理误认身份为另一个代理,自信地完成了任务
一个AI代理因根据其工作目录推断出的身份而错误地将自己识别为另一个代理,并执行了任务。此错误发生在7月17日,导致该代理将结果写入了错误的内存文件夹,并以不正确的名称发布到团队日志中。开发人员在批准输出的过程中途发现了该问题,并意识到之前可能发生过类似的错误。根本原因被确定为基于正则表达式的钩子,该钩子从目录路径推断代理身份,而不是依赖于声明的身份文件。
-
“AI”只是“Regex Plus Marketing”吗?
“AI”一词常被用作“Regex Plus Marketing”的替代说法,这表明许多被标记为人工智能的应用实际上是基于更简单的模式匹配技术,而非真正的智能。这一观点质疑了当前技术中人工智能的广泛采用和定义。
-
关于正则表达式和网络性能的技术深度探讨
该集群包含两篇较早的技术文章,一篇来自2012年,讨论了正则表达式的威力;另一篇较新的文章详细介绍了如何通过半桥接配置来提高UniFi设备上缓慢的PPPoE性能。这两篇文章都分享在Mastodon和Hacker News上,突出了具体的技术挑战和解决方案。
-
开发者提出大型语言模型分级安全方案,避免过度依赖昂贵模型
一位开发者反对将大型语言模型(LLMs)作为AI应用的唯一安全措施,提议采用分级方法。该策略包括对大多数请求使用更便宜、更快的正则表达式和经典机器学习等方法,仅在处理复杂或模糊的案例时才升级到更强大但成本更高的LLMs。这种分级系统旨在通过避免仅依赖单一昂贵LLM进行所有威胁检测的固有漏洞,来降低延迟、控制成本并增强安全性。
-
AI 代理通过新的 MCP 工具获得结构化数据能力
开发人员可以通过集成专门的工具来增强 AI 代理,例如 UserStack 用户代理查找 MCP 服务器,来处理用户代理字符串等复杂数据。这种方法超越了 Claude 和 Cursor 等通用 LLM 的局限性,这些 LLM 在面对非结构化数据时可能会出现幻觉或猜测。通过让 AI 代理直接访问结构化情报,工程师可以通过自然语言对话大规模地执行生产日志的高级分析、识别机器人活动、调试前端不一致性以及进行技术审计。
-
《毁灭战士》通过正则表达式运行,每帧耗时180秒
一位程序员成功地仅使用正则表达式运行了经典视频游戏《毁灭战士》。这种非常规的方法涉及一个96MB的文本字符串,模拟了游戏的CPU、RAM和视频输出。渲染单个帧需要近1400万次替换,导致极低的帧率,每帧耗时180秒,使得游戏体验如同“玩带霰弹枪的国际象棋”。该项目展示了通过复杂的文本匹配和替换技术可以挖掘出惊人的计算能力。
-
LLM 在可靠的 JSON 输出方面遇到困难,促使采用稳健的验证策略
开发人员在大型语言模型 (LLM) 返回格式错误的 JSON 方面遇到了持续存在的问题,这可能导致生产事故。虽然 LLM 有很高的概率生成语法上有效的 JSON,但它们通常无法遵守特定的模式、包含多余的文本或存在类型不匹配。解决方案包括约束解码(在生成过程中屏蔽无效令牌)或使用 Zod 等工具在 Next.js 等框架中进行强大的后处理和验证层,以确保数据完整性,然后再将其输入应用程序管道。
-
KDAI2026 讲座涵盖 SPARQL、DBpedia 与 Wikidata 以及 OWL
本条目详细介绍了 KDAI2026 的第 11 讲,重点关注 SPARQL 审讯策略。讲座内容包括 FILTER、REGEX、OPTIONAL、UNION、否定、BIND 和 GROUP BY 聚合。还对 DBpedia 和 Wikidata 进行了比较,指出 DBpedia 的 13.2 亿个三元组来自 Wikipedia 信息框,而 Wikidata 的 176 亿个三元组由约 29,000 名编辑维护。会议最后讨论了 OWL 描…
-
Textforge.co API 简化了清理 LLM 生成的 JSON 输出的过程
由于尾部逗号、Markdown 围栏或单引号等常见错误,开发人员经常难以清理大型语言模型 (LLM) 生成的混乱的 JSON 输出。传统的基于正则表达式的解决方案很脆弱,并且在遇到多个问题时可能会中断。来自 textforge.co 的新 API 提供了一种管道方法来系统地修复这些格式问题,从而实现更可靠的 JSON 解析。
-
AI脚本根据英文描述生成正则表达式
一位开发者创建了一个15行的Python脚本,该脚本利用AI根据英文描述生成正则表达式。该脚本通过aibridge-api.com API使用DeepSeek Coder模型,将自然语言提示转换为正则表达式模式。该工具旨在消除手动编写和调试正则表达式的需要,为使用各种编程语言和Grep等工具的开发人员提供更有效的方法。
-
新的Hamm-Grams算法通过强大的特征增强了恶意软件检测能力
研究人员开发了一种名为Hamm-Grams的新算法,旨在通过创建比传统n-grams更强大的特征来改进恶意软件的检测和分类。这些Hamm-grams是一种包含单字符通配符的正则表达式,使其不易碎。该算法使用一种新颖的局部敏感哈希和聚类技术来有效地查找常见的Hamm-grams,在识别和分类恶意软件方面显示出显著优势。
-
社交媒体帖子谴责“人工智能”是低效的正则表达式
一篇社交媒体帖子批评当前所谓的“人工智能”系统,认为它们只是过度营销的正则表达式实现。作者声称这些系统效率低下,消耗大量能源和水进行冷却。
-
LLM为非结构化文档数据提取提供可扩展解决方案
本文认为,传统的基于正则表达式的数据提取方法不足以应对非结构化文档的复杂性和多变性。文章提出利用大型语言模型(LLMs)构建更强大、更可扩展的数据管道,实现结构化提取。作者强调了正则表达式在处理各种文档格式方面的局限性,并建议LLMs为提取有价值信息提供更具适应性的解决方案。