百度蜘蛛(Baiduspider)

搜索引擎爬虫 —— 开发商、用户代理 UA 与 robots.txt 拦截方法

百度蜘蛛 搜索引擎
开发商
百度 Baidu
用户代理
Baiduspider
通过 Robots.txt 拦截
User-agent: Baiduspider
Disallow: /
把以上片段加入网站根目录的 robots.txt 即可要求该蜘蛛停止抓取全部页面(需改为只拦某个目录,把 Disallow: / 换成对应路径)。 注意:百度蜘蛛 属于搜索引擎爬虫,拦截后该引擎将无法收录你的页面,请谨慎使用。

详细介绍

百度蜘蛛(Baiduspider)是百度搜索的网页抓取程序,负责 PC 端与移动端内容的收录与更新,附带的 Baiduspider-image、Baiduspider-video 等子类分别抓取图片和视频数据。

它的 UA 形如:Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

行为特点:抓取频率高、并发大,对页面存活状态敏感。建议在 robots.txt 中放行,并对动态页面做好缓存与限流。
💡 本篇收录于搜索引擎蜘蛛大全」, 配合「网站日志分析工具」可自动识别该蜘蛛在日志中的访问与抓取页面。

同类蜘蛛推荐