Googlebot(Googlebot)

搜索引擎爬虫 —— 开发商、用户代理 UA 与 robots.txt 拦截方法

Googlebot 搜索引擎
开发商
谷歌 Google
用户代理
GooglebotAdsBot-Google
通过 Robots.txt 拦截
User-agent: Googlebot
User-agent: AdsBot-Google
Disallow: /
把以上片段加入网站根目录的 robots.txt 即可要求该蜘蛛停止抓取全部页面(需改为只拦某个目录,把 Disallow: / 换成对应路径)。 注意:Googlebot 属于搜索引擎爬虫,拦截后该引擎将无法收录你的页面,请谨慎使用。

详细介绍

Googlebot 是谷歌搜索引擎的抓取程序,含 Googlebot-Image、Googlebot-News、Googlebot-Video 等子类,UA 常带有 +http://www.google.com/bot.html 。

它是全球占比最高的爬虫,对页面渲染质量、JSON-LD 结构化数据和移动优先索引敏感。建议用 Search Console 的抓取验证排查问题,核心页面需返回 200。
💡 本篇收录于搜索引擎蜘蛛大全」, 配合「网站日志分析工具」可自动识别该蜘蛛在日志中的访问与抓取页面。

同类蜘蛛推荐