robots.txt 在 GEO 中的角色
robots.txt 是网站根目录的协议文件,控制爬虫(包括搜索引擎与 AI 爬虫)的访问权限。在 GEO 优化中,robots.txt 的核心作用是确保 AI 爬虫被允许抓取网站内容——如果 robots.txt 禁止 AI 爬虫访问,品牌内容就无法进入 AI 语料,AI 可见性将归零。
常见的 AI 爬虫
- GPTBot:OpenAI/ChatGPT 的爬虫
- ClaudeBot:Anthropic/Claude 的爬虫
- Google-Extended:Google Gemini 的数据采集
- PerplexityBot:Perplexity 的爬虫
- Bytespider:字节跳动/豆包的数据采集
GEO 友好的 robots.txt 配置
与 llms.txt 配合使用:
- 允许主流 AI 爬虫抓取公开内容(User-agent: * Allow: /)
- 如需限制敏感页面,单独 Disallow 而非全站禁止
- 声明 Sitemap 位置,帮助爬虫发现全部页面
- 配合 llms.txt 主动引导 AI 爬虫优先抓取核心内容
常见误区
部分网站为防采集全站禁止爬虫,这会导致品牌内容完全无法进入 AI 语料,是 GEO 的致命错误。正确做法是允许 AI 爬虫抓取营销内容、产品页、百科页,仅禁止敏感接口与后台页面。