robots.txt
PulseAugur coverage of robots.txt — every cluster mentioning robots.txt across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
New bot directive file standard emerges beyond llms.txt
The success of Anna's Archive's llms.txt suggests a growing need for more nuanced bot directives than robots.txt offers. It's plausible that other organizations will adopt or create similar convention-based files to guide AI crawlers for specific purposes, potentially leading to a new de facto standard for AI-specific web access control.
Websites increasingly block AI crawlers via IP ranges, not just robots.txt
Evidence shows users are actively exploring and recommending blocking Google's AI search scans via IP ranges, rather than solely relying on robots.txt. This indicates a shift in strategy as websites become wary of AI crawlers' impact and the perceived inadequacy of robots.txt for controlling AI-specific access.
Google to deprecate robots.txt for AI crawlers due to complexity
Given the documented issues with Google's crawler documentation and the increasing complexity of AI content access needs, it's plausible Google may eventually move away from relying solely on robots.txt for its AI crawlers. They might introduce a more sophisticated, AI-specific directive system or API to manage access, especially as they shift to an AI-first search model.
-
AI爬虫在日本网站上被阻止;ChatGPT广告扩展;Kaggle启动挑战赛 · 跟踪3个来源
一项研究分析了 300 个日本网站,发现 248 个可访问网站中有 23 个通过 robots.txt 阻止了 AI 爬虫。另外,OpenAI 正在通过一种新的视觉广告格式扩展其 ChatGPT 广告。此外,Kaggle 的一个基准测试挑战专注于时间知识图谱对齐。
-
新的 llms.txt 标准旨在提高 AI 搜索引擎数据的准确性
一种名为 llms.txt 的新标准正在出现,旨在为 Perplexity、ChatGPT 和 Claude 等 AI 搜索引擎提供关于网站的结构化、事实性数据。该标准的功能类似于 robots.txt 和站点地图,但专为 LLM 的机器可读性而设计。实施 llms.txt 的最佳实践包括在域的根目录提供服务,使用 text/plain MIME 类型和 200 OK 状态,使用分层 Markdown 结构来描述和陈述事实,最重要的是…
-
Cloudflare 允许选择退出 AI 训练,同时保留搜索索引
Cloudflare 推出一项新功能,允许网站所有者区分用于搜索引擎的内容索引和用于 AI 训练的内容使用。从 2026 年 9 月 15 日开始,网站可以选择退出 AI 训练,同时仍允许搜索引擎爬虫访问,解决了之前如果禁止 AI 训练则完全阻止的绝大部分网络流量。这项集成到 Cloudflare 安全设置中并通过 robots.txt 或 HTTP 标头进行通信的新控件,还包括一个单独的选项来管理代表用户行事的 AI 代理的访问权限。
-
指南:使用robots.txt、Nginx和WAF控制AI爬虫
本文提供了一份技术指南,介绍网站管理员如何使用robots.txt、Nginx配置和Web应用程序防火墙(WAF)规则来控制AI爬虫。旨在帮助网站所有者管理其内容哪些部分可供AI模型和其他自动化机器人访问。
-
新的 `llms.txt` 标准指导 AI 代理进行网站访问
一份新的技术指南解释了 `llms.txt` 的目的和实现方式,该文件旨在指导 AI 代理如何访问和交互网站。与搜索引擎的 `robots.txt` 类似,`llms.txt` 为 AI 代理提供了网站内容和结构的清晰摘要。该指南详细介绍了技术设置、它与 GPTBot 和 ClaudeBot 等 AI 爬虫的关系,以及“自主导航”审计的概念。
-
GPTBot等AI机器人可能因robots.txt而错过Google排名的内容
GPTBot和ClaudeBot等网络爬虫可能无法访问在Google搜索结果中排名的内容。这是因为网站的robots.txt文件可以阻止这些AI机器人索引特定页面,即使这些页面对传统搜索引擎可见。开发者需要考虑其robots.txt配置可能如何影响AI模型训练数据。
-
Robots.txt 无法有效阻止 AI 爬虫;需要服务器级控制
虽然 robots.txt 可以要求 AI 爬虫避免抓取网站,但它无法实际阻止它们。通过服务器、CDN 或 WAF 进行限制可以提供更强大的保护,但这需要更多的技术资源。选择哪种方法取决于网站的具体需求和技术能力。
-
新方法使用“Canary Tokens”识别用于 LLM 的 AI 网络爬虫
研究人员开发了一种新颖的方法,可以识别哪些大型语言模型(LLM)是在从特定网站抓取的数据上训练的。该技术涉及托管动态网站,这些网站向访问的网络爬虫提供独特的“Canary Tokens”。通过提示 LLM 并观察它们是否生成包含这些独特令牌的输出,研究人员可以推断出哪些 LLM 已经接触了来自这些站点的数据。事实证明,这种方法可以可靠地识别用于 22 个不同 LLM 系统的爬虫,包括一些公司未公开披露的系统,从而为第三方提供了了解 L…
-
AI代理易受`llms.txt`供应链攻击导致代码执行
研究人员展示了财富500强公司使用的AI代理存在重大漏洞,允许他们通过供应链攻击执行任意代码。通过操纵AI代理用于理解如何与网站代码和文档交互的`llms.txt`指导文件,攻击者可以欺骗这些代理运行恶意脚本。这种漏洞利用凸显了数据和代码之间界限的模糊,因为这些指导文件中过时或被破坏的包引用可能导致恶意软件的执行,而更自主的AI模型对此类攻击的易感性更高。
-
作者在 robots.txt 中命名八个 AI 爬虫
一位作者在其 robots.txt 文件中识别并命名了八个特定的 AI 爬虫。此举旨在提高透明度并控制允许哪些 AI 系统访问和处理其网站上的内容。作者的方法凸显了内容创作者对 AI 模型不受限制的数据收集日益增长的担忧。
-
Cloudflare 推出 Bot Preference Sync 以管理 AI 机器人
Cloudflare 推出了 Bot Preference Sync,一项旨在协调 robots.txt 指令与特定 AI 机器人配置的新功能。此工具允许网站所有者管理搜索引擎爬虫、AI 代理和机器学习模型训练流量如何与其内容进行交互。该服务对所有 Cloudflare 客户开放,无论其订阅级别如何。
-
AI 训练数据和版权引发关于 robots.txt 的激烈争论
关于将受版权保护的材料用于 AI 训练的争论正在加剧,特别关注 robots.txt 文件所扮演的角色。人们越来越希望 AI 开发人员能够遵守这些文件,这些文件指示了网站的哪些部分不应被爬取或用于训练。这个问题凸显了数据使用权与 AI 发展需求之间的重大冲突。
-
新的 `llms.txt` 约定旨在指导 AI 助手和代理
一项名为 `llms.txt` 的新约定被提出,作为网站与 AI 助手和代理直接沟通的一种方式。这个位于网站根目录的单一 Markdown 文件将作为 AI 模型的指南,类似于 `robots.txt` 指导爬虫。它旨在改善 LLM 理解和总结网站内容的方式,有可能提高网站在 AI 生成的搜索结果中的可见性。该格式很简单,需要网站名称、描述和重要页面列表,并且可以为大型网站自动生成。
-
新型 ShieldFont 通过改变机器人文本来干扰 AI 爬虫
一款名为 ShieldFont 的新字体已被开发出来,用于打击未经授权的 AI 数据抓取。ShieldFont 由设计师 Isaque Seneda 和 Gabriel Abrucio 创造,通过连字(ligatures)微妙地改变网页上的单词,使文本对 AI 爬虫来说毫无意义,但对人类用户来说仍然完全可读。此方法旨在扰乱训练数据的收集,而无需采用更容易检测或可逆的技术。
-
Apache服务器管理员使用mod_qos对抗AI爬虫
一位服务器管理员在Apache2服务器上实施了mod_qos,以缓解来自AI爬虫的过量请求,这些爬虫忽略了robots.txt。这些爬虫通过低效的请求(例如查询单个文件而不是克隆存储库)压垮了Git托管服务。管理员对当前的AI格局表示沮丧,并敦促其他人拒绝使用AI。
-
AI 爬虫难以访问 27% 的 Show HN 产品
最近对 Show HN 上发布的 383 个产品的扫描显示,AI 爬虫在访问方面存在严重问题。大约 27% 的产品对自动化系统来说是不可读的,这通常是由于客户端渲染且没有可解析的服务器响应,或者存在激进的机器人过滤器。更令人惊讶的是,17% 的产品主动阻止了像 Claude 这样的 AI 助手,这通常是由内容分发网络或 Web 应用程序防火墙实现的,而不是产品创始人明确的决定。这种不可见性意味着创始人可能会误解 AI 驱动的需求不足为…
-
Cloudflare 质疑 robots.txt 的遵守性,因机器人主导互联网
Cloudflare 的总法律顾问正在质疑网站是否应该遵守其 robots.txt 文件中的指令,尤其是在机器人日益主导互联网流量的情况下。这一考虑出现的原因是,互联网上充斥着自动化代理,促使人们重新评估网站所有者如何管理机器人访问和交互。
-
网站SEO审计指南侧重于机器可读性
一份技术指南概述了20项网站优化检查,侧重于搜索引擎爬虫的机器可读性。审计分为四个组:访问、传递、结构和内容,每个组都有具体的说明和通过/失败条件。关键检查包括验证robots.txt和站点地图,确保内容可被OAI-SearchBot等机器人访问,并确认页面和重定向的正确HTTP状态码。
-
Claude 共享链接因公开分享而通过 Google 搜索暴露
2026 年 7 月的报道指出,公开分享的 Claude 聊天记录和 Artifacts 出现在 Google 搜索结果中,这并非安全漏洞所致,而是用户将内容设为了公开。这凸显了一个普遍的误解:用户将“知道链接的人”视为私密,但实际上,未经身份验证的共享链接本质上就是公开网站。文章强调,robots.txt 或 noindex 标签等机制并不能提供真正的隐私,隐私需要身份验证和授权,或者干脆不发布敏感数据。
-
Anthropic 的 Claude 聊天记录通过 Google 和 Bing 搜索结果泄露
由于共享页面缺少“noindex”标签,通过 Anthropic 的 Claude 聊天机器人共享的对话无意中通过 Google 和 Bing 搜索结果暴露。这使得搜索引擎可以索引用户公开的链接,从而泄露了加密货币密钥、个人详细信息和法律策略讨论等敏感信息。虽然 Anthropic 表示共享链接不可猜测,并且用户必须明确共享它们,但缺少“noindex”标签意味着任何公开张贴这些链接都可能导致广泛的可发现性。该问题之前已被报道过,并且…