如何优化 robots.txt 适配 AI 爬虫?

robots.txt 对 GEO 的影响

robots.txt 控制搜索引擎与 AI 爬虫的访问权限。误屏蔽 AI 爬虫会导致品牌内容无法被 AI 抓取,严重影响AI 可见性。详见robots.txt 百科

常见误区

  • 误用 Disallow: / 屏蔽所有爬虫(包括 AI 爬虫)
  • 只允许 Googlebot,屏蔽其他爬虫(AI 爬虫被误伤)
  • 屏蔽 /api、/blog 等核心内容路径
  • 未配置 sitemap 指令,AI 难以发现页面

优化建议

  • 1. 允许 AI 爬虫:明确允许主流 AI 爬虫 User-Agent 访问核心内容
  • 2. 开放核心路径:确保产品、关于、FAQ、博客等路径 Allow
  • 3. 屏蔽低价值路径:仅屏蔽 /admin、/search、/cart 等无 SEO 价值路径
  • 4. 配置 sitemap:在 robots.txt 添加 Sitemap: https://example.com/sitemap.xml
  • 5. 配合 llms.txt:部署llms.txt 进一步引导 AI

验证

用 Google Search Console 的 robots.txt 测试工具验证 AI 爬虫能否访问核心页面。用GEO 审计检测抓取障碍,参考AI 抓取优化