Google-Extended
PulseAugur coverage of Google-Extended — every cluster mentioning Google-Extended across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
网站的 AI 焦点文件被 Google 的 AI 功能忽略,但被工具使用
一个名为 hashlock.markets 的网站发现,其用于 AI 代理的 `llms-full.txt` 文件在标准 Google 搜索中的展示次数超过了其网站上的任何其他 URL。然而,该文件在 Google 的生成式 AI 功能中展示次数为零,这表明 AI 模型并未利用这种机器可读格式。SE Ranking 和 Limy 的研究也支持了这一点,表明 `llms.txt` 文件在很大程度上被主要的 LLM 引用来源所忽略,而 G…
-
新的 GEO 策略旨在提高内容在 AI 搜索引擎中的可见性
文章概述了一种名为生成引擎优化 (GEO) 的策略,内容创作者可以通过该策略来提高其在 ChatGPT 和 Perplexity 等 AI 驱动的搜索引擎中的可见性。关键建议包括配置 robots.txt 以允许 AI 爬虫,创建 `llms.txt` 文件以进行结构化内容摘要,以及实施 JSON-LD 来构建实体图。作者还强调了结果优先的文案(包含具体数字)以及维护新鲜的内部链接内容的重要性。
-
网站未能授予明确的 AI 内容再利用许可
对十个网站进行的近期审计显示,其中八个网站并未明确授予商业再利用其内容的许可,尽管其中一些网站拥有允许性的 robots.txt 文件。作者区分了 robots.txt 文件(管理机器人访问)和许可(规定重新发布权)。虽然 Troy Hunt 的网站等提供清晰的许可,但 Julia Evans 的网站等明确禁止 LLM 抓取,而 The Pragmatic Engineer 则为 AI 训练提供了机器可读信号。作者强调,许可检查应在数…
-
FLOSS社区开发技术防御措施以应对LLM代码抓取
自由和开源软件(FLOSS)社区正在制定策略,以保护其代码不被未经同意用于训练大型语言模型(LLM)。Codeberg等平台正在实施限制自动抓取的政策,超越法律措施转向技术防御。这包括先进的机器人识别技术、用于降低训练数据质量的数据投毒策略,以及通过要求仓库进行身份验证访问来加强架构。
-
MCP注册表在2026年将从目录转向排名
模型上下文协议(MCP)注册表的格局正在演变,不同的平台为寻求MCP服务器和代理技能的开发者提供了不同的服务。官方MCP注册表(registry.modelcontextprotocol.io)充当安装元数据的权威、机器优先的命名空间。mcpmarket.com侧重于数量,并根据GitHub星数提供排名,但它故意阻止AI爬虫。其他目录如mcp.so提供广泛的集合,而Glama在其AI工作区中整合了一个目录。Skillselion旨在根…
-
人工智能就绪网站:FAQ Schema和Robots.txt最有效,分析发现
根据对数千个网站数据的分析,关于使网站“人工智能就绪”的大多数建议都是噪音。最有效的策略包括确保人工智能爬虫可以通过robots.txt访问内容,并实施FAQ Schema,这已被证明能显著提高人工智能引用率。虽然实体优化和像llms.txt这样的未来赌注显示出希望,但当前数据显示它们对人工智能可见性的影响较小。
-
AI 代理即将主导互联网流量,对现有网站构成挑战
互联网正迅速转向原生代理架构,AI 机器人已占流量的 57% 以上。为人类交互而构建的现有网站,在这种新范式下显得准备不足。关键技术转变,如 Anthropic 的模型上下文协议 (MCP) 被广泛用于 AI 代理连接,以及 HTTP 402 被用于机器原生微支付,正在推动这一转变。虽然主要云服务提供商提供了解决方案,但它们通常复杂且昂贵,这使得绝大多数需要更简单、更易于访问的方式来为代理做好准备的网站面临差距。
-
生成式引擎优化(GEO)成为AI引用的新SEO
生成式引擎优化(GEO)是一种新的网站可见性方法,它侧重于被AI系统引用,而不是传统的搜索引擎排名。GEO的关键因素包括确保GPTBot和ClaudeBot等AI爬虫能够访问网站内容,实施JSON-LD等结构化数据,创建易于引用的内容,以及维护强大的技术基础。CiteReady等工具可以进行快速审核,以识别网站可引用性方面的改进领域。
-
生成式引擎优化(GEO)随着AI搜索的兴起而出现 · 已追踪2个来源
随着ChatGPT和Gemini等AI模型成为主要的搜索渠道,生成式引擎优化(GEO)正成为一项关键的学科。与传统的SEO不同,GEO侧重于确保内容被AI系统理解、引用和推荐。引用份额项目和普林斯顿大学牵头的一项研究强调,AI搜索引擎依赖于事实密度、来源权威性和语义一致性等因素来决定在其生成的答案中引用哪些来源,而不是关键词堆砌。这一转变为了小型出版商和新网站在AI驱动的发现中获得可见性提供了新的机会。
-
AI爬虫检查器解析10个主要AI爬虫的robots.txt
一款名为AI爬虫检查器的新工具已被开发出来,用于分析主要的AI爬虫如何与网站的robots.txt文件进行交互。该工具能够识别特定的AI爬虫,如OpenAI的GPTBot或Google的Google-Extended,是否被允许、屏蔽或部分屏蔽访问内容。该检查器解析robots.txt中复杂的指令,区分完全站点屏蔽和特定路径限制,从而提供对爬虫访问更细致的理解。
-
网站可以通过提高内容可读性和允许 AI 爬虫来优化 AI 搜索
网站所有者可以通过确保内容易于阅读和被 AI 爬虫引用来优化其内容以适应 AI 搜索引擎。这包括服务器端渲染内容、使用清晰的章节进行结构化以及添加 schema 标记。此外,网站应通过检查其 robots.txt 文件来允许 GPTBot 和 ClaudeBot 等 AI 爬虫访问。目标是在 AI 生成的答案中被引用为来源,因为预计 AI 搜索的流量将超过传统搜索。