GPTBot
PulseAugur coverage of GPTBot — every cluster mentioning GPTBot across labs, papers, and developer communities, ranked by signal.
- developed by OpenAI 100%
- instance of PerplexityBot 90%
- used by /llms.txt 90%
- instance of ChatGPT User Experience: Implications for Education 90%
- competes with ClaudeBot 70%
- competes with PerplexityBot 70%
- used by OAI-SearchBot 70%
- used by robots.txt 70%
- uses ChatGPT User Experience: Implications for Education 70%
- competes with Googlebot 70%
- used by CCBot 70%
- used by Bytespider 70%
6 天有情绪数据
-
万事达卡按名称阻止 88 个机器人,维萨的 robots.txt 为空
万事达卡(Mastercard)实施了一个 robots.txt 文件,按名称明确阻止了 88 个机器人,其中一些可追溯到 2000 年代初,包括一个自称为 Windows 95 的机器人。相比之下,维萨(Visa)的 robots.txt 文件为空。值得注意的是,这两个文件都没有明确命名或阻止 AI 爬虫,默认情况下不对其进行限制,尽管在 GPTBot 等机器人出现后,这两个文件都在 2025 年进行了更新。
-
AI 爬虫忽略了自定义 LLM 上下文文件,日志显示
一位个人网站所有者分析了 15 天的 nginx 日志,以查看是否有任何 AI 爬虫访问了他们的 /llms.txt 和 /llms-full.txt 文件,这些文件为语言模型总结了网站。尽管有来自具有已知爬虫令牌(如 GPTBot 和 ClaudeBot)的机器人的 46,000 多次请求,但没有一个访问了这些特定文件。相反,所有 67 次对上下文文件的请求都来自非爬虫客户端,主要是像 curl 这样的命令行 HTTP 客户端。
-
AI用户面临测试、合规和验证挑战 · 已追踪5个来源
Mastodon上的几篇帖子讨论了使用AI工具的实际挑战和影响。一篇帖子强调了一个快速测试,用于识别不可靠的AI生成测试;另一篇则讨论了为什么AI试点项目常常因合规问题和需要人工监督而无法扩展。第三篇帖子提供了一个免费的API服务器,用于加密货币新闻和市场数据,兼容各种AI客户端。此外,一个讨论指出服务器日志中存在GPTBot和ClaudeBot等AI爬虫,引发了是否应阻止它们的疑问;一位用户分享了他们的经验,即验证AI生成内容所需的…
-
新的 `llms.txt` 标准指导 AI 代理进行网站访问
一份新的技术指南解释了 `llms.txt` 的目的和实现方式,该文件旨在指导 AI 代理如何访问和交互网站。与搜索引擎的 `robots.txt` 类似,`llms.txt` 为 AI 代理提供了网站内容和结构的清晰摘要。该指南详细介绍了技术设置、它与 GPTBot 和 ClaudeBot 等 AI 爬虫的关系,以及“自主导航”审计的概念。
-
GPTBot等AI机器人可能因robots.txt而错过Google排名的内容
GPTBot和ClaudeBot等网络爬虫可能无法访问在Google搜索结果中排名的内容。这是因为网站的robots.txt文件可以阻止这些AI机器人索引特定页面,即使这些页面对传统搜索引擎可见。开发者需要考虑其robots.txt配置可能如何影响AI模型训练数据。
-
Cloudflare 默认阻止 AI 机器人,导致 JSON-RPC 错误
一位开发者遇到了一个问题,他们的 MCP 服务器返回了 HTML 错误消息,而不是预期的 JSON-RPC 响应。在对其自身代码进行了广泛的调试后,他们发现问题不在于他们的应用程序,而在于 Cloudflare 的一项托管规则阻止了 AI 爬虫。此规则默认启用,导致来自特定用户代理(如 ClaudeBot 和 GPTBot)的请求收到 403 Forbidden 响应和 HTML 错误页面,而像 `curl` 这样的标准工具则不受影响。
-
网站的 AI 焦点文件被 Google 的 AI 功能忽略,但被工具使用
一个名为 hashlock.markets 的网站发现,其用于 AI 代理的 `llms-full.txt` 文件在标准 Google 搜索中的展示次数超过了其网站上的任何其他 URL。然而,该文件在 Google 的生成式 AI 功能中展示次数为零,这表明 AI 模型并未利用这种机器可读格式。SE Ranking 和 Limy 的研究也支持了这一点,表明 `llms.txt` 文件在很大程度上被主要的 LLM 引用来源所忽略,而 G…
-
OpenAI 详解用于 AI 模型训练的 GPTBot 网络爬虫
OpenAI 详细介绍了 GPTBot,这是其为训练基础模型而设计的网络爬虫。该公司提供了有关该爬虫的用户代理版本、IP 地址范围和 robots.txt 指令的信息。此举旨在解决有关 AI 训练数据收集的担忧和争议。
-
新的 GEO 策略旨在提高内容在 AI 搜索引擎中的可见性
文章概述了一种名为生成引擎优化 (GEO) 的策略,内容创作者可以通过该策略来提高其在 ChatGPT 和 Perplexity 等 AI 驱动的搜索引擎中的可见性。关键建议包括配置 robots.txt 以允许 AI 爬虫,创建 `llms.txt` 文件以进行结构化内容摘要,以及实施 JSON-LD 来构建实体图。作者还强调了结果优先的文案(包含具体数字)以及维护新鲜的内部链接内容的重要性。
-
AI 机器人抓取网站数据,引发站主担忧
网站报告称,ClaudeBot 和 GPTBot 等 AI 模型正在抓取其网站数据。这种做法引起了网站所有者对未经授权使用其内容进行 AI 训练的担忧。
-
GPTBot 和 ClaudeBot 等 AI 爬虫重塑 LLM 训练的网络发现方式
AI 搜索引擎爬虫,如 GPTBot、ClaudeBot 和 Perplexity 的爬虫,正在从根本上改变互联网的发现和索引方式。与专注于为搜索结果编制索引的传统爬虫不同,这些特定于 AI 的爬虫旨在收集海量数据来训练大型语言模型。这一转变意味着网络发现的新时代,其主要目的不仅是检索,还有 AI 系统的持续学习和改进。
-
OpenAI 详解用于模型训练的 GPTBot 网络爬虫
OpenAI 详细介绍了其网络爬虫 GPTBot,该爬虫用于收集数据以训练其基础模型。该公司提供了有关其 robots.txt 令牌、用户代理版本、IP 地址范围和阻止率的信息。此举旨在解决疑虑并阐明 GPTBot 的运行方式。
-
2026年,是否应该阻止AI爬虫?
2026年,网站所有者面临着关于AI爬虫的战略决策,大多数建议允许它们以增加在AI助手答案中的可见性。阻止像OpenAI的GPTBot和Anthropic的ClaudeBot这样的AI训练机器人可能会导致在AI生成的回应中丢失发现和引用份额。虽然对于敏感或专有内容存在特定例外,但普遍共识表明,允许这些爬虫为内容传播带来更大的长期利益。
-
答案引擎优化:让网站可被AI发现
答案引擎优化(AEO)专注于让网站可被AI答案系统发现和引用,这与传统的SEO不同,后者旨在提供排名列表而非直接答案。该过程包括确保爬虫可以访问内容,关键信息存在于HTML中,并且实体被准确描述。开发者应精确管理爬虫访问,检查服务器响应和日志,并考虑为不同的AI用户代理(如OpenAI的GPTBot和PerplexityBot)制定单独的策略。
-
网站未能授予明确的 AI 内容再利用许可
对十个网站进行的近期审计显示,其中八个网站并未明确授予商业再利用其内容的许可,尽管其中一些网站拥有允许性的 robots.txt 文件。作者区分了 robots.txt 文件(管理机器人访问)和许可(规定重新发布权)。虽然 Troy Hunt 的网站等提供清晰的许可,但 Julia Evans 的网站等明确禁止 LLM 抓取,而 The Pragmatic Engineer 则为 AI 训练提供了机器可读信号。作者强调,许可检查应在数…
-
日志分析显示,AI 助手很少读取 `llms.txt` 文件
对 GoodBarber 的 Web 服务器日志进行的回顾显示,在四个月内收到的 1,321 次总请求中,仅有 26 次请求来自 AI 助手,而 `llms.txt` 文件是专为 AI 系统设计的。其中,只有四次请求真正来自 OpenAI 的 GPTBot,而这四次中的三次源自 AI 就绪检查器 `agentready.md`。分析还识别出三起冒充 AI 机器人(使用通用用户代理字符串和不在供应商公布范围内的 IP 地址)的请求,这表…
-
尽管提供 `llms.txt`,但大部分中国出口品牌尚未准备好应对 AI 爬虫
对 59 个中国跨境品牌的最新扫描显示,虽然大多数品牌不阻止 GPTBot 等 AI 搜索引擎爬虫,但提供 `llms.txt` 文件的品牌大多使用的是通用的 Shopify 模板。在可检查 `llms.txt` 文件的 43 个网站中,67.4% 提供了此类文件。然而,检查发现,这些文件中有五分之四的内容没有具体的品牌信息,而是提供了与支付协议相关的模板化文本。只有 Anker 提供了一个包含品牌定位和产品信息的详细 `llms.t…
-
《时代》杂志为AI机器人提供一个单独的、充满广告的网站版本
《时代》杂志现在为人类读者和AI机器人提供不同版本的网站。人类读者看到的是完整的网站及其常规内容和设计,而AI爬虫则看到一个精简的markdown版本。这个版本包含广告和赞助内容,例如Ally Bank的FAQ,而这些内容人类访客是看不到的。这种做法允许《时代》杂志记录AI机器人的广告展示次数,据报道,机器人流量在大多数日子里都超过了人类流量。
-
用户用马尔可夫生成的数据愚弄AI抓取器
某人正故意向包括GPTBot在内的AI抓取器提供大量使用马尔可夫链生成的数据。此行为被描述为一种愚弄行为,旨在干扰或误导这些AI系统。用户已实施速率限制措施,以防止其行为导致拒绝服务情况。
-
Mastodon 用户成为 AI 抓取器(包括 OpenAI 和 Meta 机器人)的目标
一位 Mastodon 用户正遭受拒绝服务攻击,其网站每分钟收到 193 次请求。该用户将这些攻击归因于 AI 抓取器,特别提到了 GPTBot、OpenAI 以及可能与 Meta 和 Apple 相关的机器人。他们表达了沮丧,并质疑此类攻击对小型网站的有效性和成本。