Unicode
PulseAugur coverage of Unicode — every cluster mentioning Unicode across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
网站使用隐藏文本来‘煤气灯’AI机器人
网站开始采用隐藏文本和不可见的Unicode字符来欺骗AI代理,使其在自动化过程中暴露身份或失败。这种防御策略颠覆了传统的提示注入攻击,旨在识别和扰乱机器人,而不是依赖传统的验证码。虽然这种方法很巧妙,但预计其寿命不会太长,因为AI代理开发者将适应将所有摄入的网络内容视为潜在的对抗性。
-
Wine 11.19 发布,支持 Wayland、Unicode 和 DNS 改进
Wine 兼容层最新版本 11.19 现已发布。此次更新带来多项增强功能,包括改进的 Wayland 色彩管理、Unicode 支持升级以及 DNS 查询缓存。该版本还修复了开源软件中的各种问题。
-
新的通用字节级编码提升了多语言文本的 LLM 效率
研究人员开发了一种通用字节级编码 (UBE),以提高多语言大型语言模型的效率。UBE 解决了某些脚本在标准字节对编码 (BBPE) 分词器中产生更高 token 成本的问题,从而导致费用增加和上下文窗口减小。通过将特定脚本的字符通过 UTF-16 进行路由,UBE 在不负面影响英语文本效率的情况下,降低了高溢价脚本的分词成本。该方法保持了精确解码,并已被验证可以往返所有 Unicode 标量值并通过各种 Unicode 测试套件。
-
代理技能中的隐藏Unicode字符带来安全风险
在代理技能中发现了一个安全漏洞,恶意指令可以利用不可见的Unicode字符隐藏,而模型仍然可以解释这些字符。作者开发的扫描器agent-skill-audit-mcp可以检测到这些隐藏消息、提示注入技术以及其他风险模式,如不受限制的shell访问或凭证泄露。Snyk的ToxicSkills审计此前在36%的公共技能中发现了提示注入,并在76个技能中确认了恶意载荷,凸显了这些安全问题的普遍性。
-
古兰经文本映射和诵读验证器发布
研究人员开发了一种新的方法,用于在奥斯曼体和标准阿拉伯语拼写形式之间映射古兰经文本,解决了由Unicode字符U+0670引起的差异。这项工作包括一个2,290对单词的映射和一个七步标准化流程,实现了90.9%的经文对齐。在此基础上,创建了一个确定性的、不依赖LLM的验证器,用于评估古兰经诵读的准确性,在测试套件上达到了98.4%,并在所有测试的阿拉伯语ASR转录本中正确识别了经文。
-
AI攻击技术ASCII隐写术现被垃圾邮件发送者使用
一种被称为ASCII隐写术的技术,此前用于提示注入等AI攻击,现在被垃圾邮件发送者采用以绕过电子邮件过滤器。该方法利用不可见的Unicode标签嵌入恶意指令,使安全系统更难检测。微软每天观察到数百万个此类签名,表明该技术被利用的方式发生了重大转变。
-
复古迷你液晶电视众筹活动24小时内超10万美元目标
Unico的“复古”迷你液晶电视在其众筹活动的最初24小时内已成功筹集超过10万美元。这款设计具有复古美学的小型电视,获得了支持者的大量关注和支持。该活动旨在将这件怀旧科技产品带给更广泛的受众。
-
垃圾邮件发送者利用不可见的Unicode字符进行ASCII隐写术
ASCII隐写术是一种利用不可见的Unicode字符来隐藏文本的技术,正被垃圾邮件发送者越来越多地采用。这种方法曾经主要用于绕过AI检测系统,但现在被用来规避垃圾邮件过滤器。该技术涉及将恶意内容嵌入看似无害的文本中,使得人类和自动化系统都难以识别。
-
Timeline Studio 为 React 视频编辑器添加了对代理友好的标记
一个基于 React 的开源视频编辑器 Timeline Studio 已更新,增加了持久化时间轴标记。这些标记可以代表章节点或审查范围,现在可以通过编辑器的 CLI 和 MCP 适配器访问,从而实现对代理友好的操作。此次更新的重点是使这些注释精确、可检查且适用于批量编辑,并引入了一个新的数据模型,确保标记不会影响渲染视频的时长。该编辑器还改进了管理这些标记的用户界面,并通过将像素容差转换为项目时间来改进捕捉行为。
-
Unico的Traveller ULW10复古电视显示器可隐藏游戏机,提供现代输入接口
Unico推出了Traveller ULW10,这是一款10英寸、4:3宽高比的显示器,旨在模仿复古电视的外观和感觉。这款现代显示器提供RGB SCART、VGA和HDMI输入接口,可兼容各种复古游戏机。值得注意的是,它设有一个秘密后舱用于存放游戏机,并能模拟CRT视觉效果,但由于空间限制省略了复合视频输入。Traveller ULW10即将在Kickstarter上推出,早期支持者将获得折扣。
-
少年推出亚毫秒级API以应对AI提示注入攻击
一位16岁的开发者创建了一个新的API,旨在检测和缓解AI应用程序中的提示注入攻击。该API名为llm-guardrail-sanitizer,它利用正则表达式和启发式方法等确定性逻辑,而非机器学习模型,来实现低于1毫秒的响应时间。这种方法旨在提供即时安全判断,避免了机器学习模型相关的延迟或不可预测的误报率,使其适合实时集成到AI系统中。该API可在RapidAPI上免费使用,并支持检测多种混淆技术,包括Base64编码、Unicod…
-
Gemini 覆盖层在 Android 上获得多任务处理功能;出现新的 AI 安全风险
Google 的 Gemini 覆盖层在 Android 上已更新,增加了多任务处理选项,允许用户将覆盖层最小化为浮动气泡快捷方式。另外,已发现一种涉及 ASCII 走私的新安全风险,网络钓鱼者正在利用不可见的 Unicode 标签字符。
-
LLM 管道在罕见的 Unicode 字符上中断,开发者分享修复方法
一位开发者在处理多语言法律文档的生产 LLM 管道中遇到了持续的 UnicodeEncodeError。该错误,特别是与 UTF-8 编码中不允许的代理项有关,源于三个不同的问题:LLM 分词器创建未配对的代理项序列、流式响应中损坏的 UTF-8 字节序列以及终端或文件输出中的编码不匹配。作者提供了对这些故障模式的详细技术解释,并提供了一个强大的基于 Python 的解决方案,以确保处理不同字符集的 AI 应用程序中的数据完整性。
-
垃圾邮件发送者利用人工智能的 ASCII 走私技巧绕过电子邮件过滤器 · 已追踪 4 个来源
一种称为 ASCII 走私的技术,最初是为了在人工智能攻击中隐藏恶意提示而开发的,现在正被垃圾邮件发送者广泛采用以绕过电子邮件过滤器。该方法使用计算机可读但人类无法检测到的不可见 Unicode 字符,使垃圾邮件发送者能够隐藏关键词并逃避检测。Microsoft Defender for Office 365 观察到使用 ASCII 走私的垃圾邮件数量急剧增加,今年早些时候每日检测量从数千激增至数百万,这表明垃圾邮件发送策略发生了重大转变。
-
开发者发布Unicode字符串语料库,暴露文本处理缺陷
一位开发者创建了一个包含300个Unicode字符串的语料库,旨在暴露朴素文本处理函数(尤其是`len()`)的缺陷。该语料库包含各种复杂的Unicode特性,如零宽度连接符(ZWJ)序列和Astral平面码点,其中20个案例根据CC0许可免费提供。完整数据集可供购买,旨在帮助开发者识别其文本处理代码在处理用户可粘贴字符串时的行为,并强调像表情符号处理这样的简单测试并不能保证全面的覆盖。
-
AI文本中的Unicode水印:检测、移除和归因挑战
Unicode水印被讨论为识别AI生成文本的潜在方法,尽管其有效性和归因仍不确定。已开发出一种工具来检测和移除这些可以编码隐藏信息的不可见字符。虽然这些水印可能表明AI的作者身份,但目前它们不能提供确凿的证据,也不能将文本归因于特定的模型或代理,目前的实现可能源自Anthropic等API端点,而不是模型本身。
-
Unicode中的“幽灵字符”带来安全风险
Unicode标准中的一个字符,被称为“幽灵字符”,已被发现具有潜在的安全隐患。该字符不可见且无宽度,可以插入文本中而不易被用户察觉。它的存在可能被利用来创建欺骗性链接或以损害安全的方式操纵文本。
-
Unicode水印方法针对LLM进行测试,结果好坏参半
arXiv上的一篇新论文分析了Unicode文本水印方法针对各种大型语言模型的安全性和可检测性。研究人员在六种模型上测试了十种水印技术,包括GPT-5、GPT-4o、Llama 3.3和Claude Sonnet 4。研究发现,虽然高级推理模型可以检测到带水印的文本,但它们通常在无法访问源代码的情况下无法提取水印。
-
OCR系统难以处理蒙古文传统竖排草书
传统的蒙古文(称为“蒙古文”)给标准的OCR系统带来了独特的挑战。这些系统通常假定文本是横向排列的,无法处理蒙古文的竖排、从上到下的列。即使将文本旋转,使列看起来像行,但该脚本的草书性质和依赖于上下文的字母形式(其中多个字符共享相同的中间形状)意味着仅凭视觉信息不足以进行准确识别。确定正确的字符通常依赖于语言上下文,例如元音和谐和词义,而不是仅仅依赖于图像中存在的墨迹模式。
-
由于预处理和训练数据限制,带尼库德的希伯来语文本的光学字符识别面临挑战
带尼库德(元音符号)的希伯来语文本的光学字符识别(OCR)常常难以处理这些符号,因为在识别模型看到文本之前,多个预处理阶段会移除这些精细的标记。这些阶段包括分辨率缩放、二值化阈值处理、去噪点滤波和行分割裁剪。此外,主要在省略尼库德的现代希伯来语上训练的模型,即使尼库德得以保留,也缺乏识别这些标记所需的训练数据。常见的混淆出现在外观相似的元音符号之间,例如卡马茨(qamats)和帕塔赫(patah),或塞戈尔(segol)和舍瓦(she…