先看结论
| 爬虫标识 | 主要用途 | 希望获得什么结果时允许 | 常见配置建议 |
|---|---|---|---|
| Googlebot | Google搜索抓取和索引 | 希望网页出现在Google搜索中 | 通常允许 |
| OAI-SearchBot | ChatGPT搜索发现和引用 | 希望内容可能进入ChatGPT搜索答案 | 通常允许 |
| GPTBot | 获取可能用于改进模型的公开内容 | 接受内容可能用于模型训练 | 根据授权政策决定 |
| ChatGPT-User | 用户主动触发的网页访问 | 希望用户能通过ChatGPT打开页面 | 不应与自动爬虫混为一谈 |
| Bytespider | 字节系爬虫常见标识 | 结合业务目标和服务器负载判断 | 独立设置并观察日志 |
多数公开企业官网可以从以下策略开始:允许Googlebot和OAI-SearchBot;根据内容授权政策决定GPTBot;对Bytespider等其他爬虫单独监测、限速或禁止;真正的私密内容使用登录和权限保护,而不是依赖robots.txt。
Googlebot:决定网页能否被Google正常抓取
希望网站正常进入Google搜索时,不要阻止Googlebot:
User-agent: Googlebot
Allow: /
以下配置会禁止Googlebot抓取全站:
User-agent: Googlebot
Disallow: /
需要注意,阻止抓取不等于绝对阻止URL被发现。如果其他网站仍然链接某个被禁止抓取的URL,搜索系统仍可能记录这个地址,只是无法读取页面正文。真正需要禁止搜索展示时,应结合noindex、删除页面或访问权限处理。
不要只根据User-Agent字符串验证Googlebot,因为任何程序都能伪装。更可靠的方式是将来源IP与官方范围匹配,或者执行反向DNS与正向DNS双重验证。
OAI-SearchBot:影响网站能否进入ChatGPT搜索发现
希望网站可能进入ChatGPT搜索时,可允许:
User-agent: OAI-SearchBot
Allow: /
还要检查:
- CDN和WAF没有拦截对应请求;
- 页面返回正常的200状态码;
- 正文无需登录即可读取;
- 关键内容不是只存在于图片或前端交互中;
- 页面没有
noindex; - 服务端没有向机器人返回验证码页。
允许OAI-SearchBot只代表允许搜索发现,不代表页面一定会被引用。
GPTBot:是否允许模型训练用途,应单独决定
希望拒绝GPTBot时,可以单独禁止:
User-agent: GPTBot
Disallow: /
企业可以允许搜索发现,同时拒绝GPTBot:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
以下网站更需要认真评估GPTBot:付费数据库、原创行业报告、摄影和设计作品站、内容授权严格的网站,以及医疗、法律、财务等高风险知识网站。
robots.txt只是爬虫沟通信号,不是安全控制。客户资料、内部文件和付费内容必须使用身份验证和权限系统保护。
ChatGPT-User不是普通自动爬虫
ChatGPT-User通常与用户在ChatGPT中主动发起访问有关。管理ChatGPT搜索发现,应配置OAI-SearchBot;管理模型训练用途,应配置GPTBot;管理用户触发访问,则要依靠登录、接口权限和服务器安全策略。
Bytespider:独立设置并观察访问行为
希望暂时允许:
User-agent: Bytespider
Allow: /
希望表达禁止意愿:
User-agent: Bytespider
Disallow: /
无论允许还是禁止,都建议记录每日请求量、高频访问目录、4xx/5xx比例、参数页抓取和服务器负载。如果robots.txt禁止后仍持续大量访问,应在CDN、WAF或服务器层面处理。
四种常用配置方案
全部公开
User-agent: Googlebot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: Bytespider
Allow: /
Sitemap: https://www.example.com/sitemap.xml
允许搜索,拒绝GPTBot
User-agent: Googlebot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Sitemap: https://www.example.com/sitemap.xml
只开放公开内容目录
User-agent: Googlebot
Allow: /articles/
Disallow: /admin/
Disallow: /account/
User-agent: OAI-SearchBot
Allow: /articles/
Disallow: /admin/
Disallow: /account/
User-agent: GPTBot
Disallow: /
服务器负载优先
User-agent: Googlebot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Bytespider
Disallow: /
Disallow: /search/
Disallow: /*?sort=
Disallow: /*?filter=
配置后的验证
- 确认
/robots.txt返回HTTP 200和纯文本; - 检查规则是否误封首页、服务页、文章页和资源文件;
- 检查CDN、WAF和海外IP策略;
- 确认初始HTML包含标题、品牌、正文和联系方式;
- 在服务器日志中验证真实访问;
- 持续观察抓取、引用和咨询变化。
允许爬虫只是获得访问条件,不保证收录、排名、引用或转化。