678PDF
首页
软件
博客
工具箱
注册
登录
CCBot(CCBot)
AI 爬虫爬虫 —— 开发商、用户代理 UA 与 robots.txt 拦截方法
首页
›
工具箱
›
搜索引擎蜘蛛大全
›
CCBot
CCBot
AI 爬虫
开发商
Common Crawl
用户代理
CCBot
通过 Robots.txt 拦截
User-agent: CCBot Disallow: /
把以上片段加入网站根目录的
robots.txt
即可要求该蜘蛛停止抓取全部页面(需改为只拦某个目录,把
Disallow: /
换成对应路径)。 注意:CCBot 抓取的内容用于 AI 模型训练与问答,不参与搜索引擎收录,拦截它不影响你在搜索结果中的排名;如不希望站点内容被用于 AI 训练,建议直接按上方片段拦截。
详细介绍
CCBot 是 Common Crawl 基金会的爬虫,其抓取的网页数据被公开为免费语料库,是许多大模型训练数据的来源之一。
如不希望内容进入公开语料库,可用 User-agent: CCBot 拦截。
💡
本篇收录于
「
搜索引擎蜘蛛大全
」, 配合「
网站日志分析工具
」可自动识别该蜘蛛在日志中的访问与抓取页面。
同类蜘蛛推荐
GPTBot
ChatGPT-User
OAI-SearchBot
ClaudeBot