GPTBot
AI 爬虫
开发商
OpenAI
用户代理
GPTBot
通过 Robots.txt 拦截
User-agent: GPTBot
Disallow: /
把以上片段加入网站根目录的 robots.txt 即可要求该蜘蛛停止抓取全部页面(需改为只拦某个目录,把 Disallow: / 换成对应路径)。
注意:GPTBot 抓取的内容用于 AI 模型训练与问答,不参与搜索引擎收录,拦截它不影响你在搜索结果中的排名;如不希望站点内容被用于 AI 训练,建议直接按上方片段拦截。
详细介绍
GPTBot 是 OpenAI 用于抓取公开网页、训练 AI 模型的爬虫,UA 形如 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot 。
它只抓取公开可访问的内容,遵循 robots.txt。如不希望站点内容被用于 OpenAI 模型训练,可用 User-agent: GPTBot 拦截。