实体
web scrapers
web scrapers
PulseAugur coverage of web scrapers — every cluster mentioning web scrapers across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新方法使用“Canary Tokens”识别用于 LLM 的 AI 网络爬虫
研究人员开发了一种新颖的方法,可以识别哪些大型语言模型(LLM)是在从特定网站抓取的数据上训练的。该技术涉及托管动态网站,这些网站向访问的网络爬虫提供独特的“Canary Tokens”。通过提示 LLM 并观察它们是否生成包含这些独特令牌的输出,研究人员可以推断出哪些 LLM 已经接触了来自这些站点的数据。事实证明,这种方法可以可靠地识别用于 22 个不同 LLM 系统的爬虫,包括一些公司未公开披露的系统,从而为第三方提供了了解 L…
-
Wiki 运营者谴责遭受恶意网络爬虫滥用
一位 Wiki 运营者描述了恶意网络爬虫带来的挑战,他将这些爬虫比作“clankers”。这些自动化机器人消耗大量服务器资源和带宽,扰乱了他自定义 Wiki 网站的正常运行。该运营者强调需要更好的工具或协议来管理和减轻此类抓取活动的影响。
-
新方法使用唯一令牌识别 LLM 网页抓取器
研究人员开发了一种新颖的方法,可以自动识别哪些大型语言模型 (LLM) 被特定的网页抓取器喂养数据。该技术涉及托管动态网站,为每个访问的抓取器提供唯一的“金丝雀令牌”。通过提示 LLM 并观察它们是否持续生成包含这些唯一令牌的输出,研究人员可以推断出哪些抓取器正在向哪些 LLM 提供数据。对 22 个生产 LLM 系统进行的实验证明了该方法在识别先前未知的抓取器-LLM 连接方面的可靠性,为非特权第三方提供了一种了解数据来源并可能控制…