Robots.txt 生成器 2026 完整语法指南(附12个现成模板,防止错误封禁全站)
在线免费生成 Robots.txt 2026 最新语法:User-agent Allow Disallow Sitemap Crawl-delay 通配符规则一次搞懂。内置 WordPress、Shopify、Next.js、Nuxt、Cloudflare Pages 等12套开箱即用模板,避免误封整站被K。
1. 什么是 robots.txt?错误语法为什么会让你整站被降权
robots.txt 是放在网站根目录 /robots.txt 的纯文本,告诉搜索引擎爬虫哪些页面该抓、哪些跳过。一行写错的 Disallow: / 就能让你整站在 72 小时内从 Google 索引消失。本教程用 Korelyy 生成器按 2026 最新标准(新增 ClaudeBot、GPTBot、Google-Extended 等 AI 爬虫拦截规则)安全构建。
1.1 2026 年必须拦截的 AI 爬虫清单
- GPTBot / ChatGPT-User — OpenAI 用你网站数据训练下一代大模型,截至 2026-07 已有 70% 企业站拦截。
- ClaudeBot / anthropic-ai — Anthropic 抓取用于训练 Claude 系列模型。
- Google-Extended — Google 的 AI 训练专用爬虫,和 Googlebot 索引用爬虫完全独立,拦截不影响搜索收录。
- Amazonbot / Bytespider(抖音爬虫)/ PetalBot(华为)— 2026 年消耗带宽最快的 3 个第三方爬虫。
2. Korelyy robots.txt 生成器 — 30 秒安全生成零错误
打开 Korelyy → 工具 → SEO 工具 → Robots.txt 生成器。① 选择平台预设(WordPress / Shopify / Next.js 静态导出 / 纯静态站);② 一键拦截 AI 爬虫(推荐开启,不影响正常搜索收录);③ 粘贴 sitemap.xml 地址;④ 按需添加目录级规则(例如 WordPress:Allow /wp-admin/admin-ajax.php, Disallow /search/、/tag/、/author/、/page/、/feed/);⑤ 点生成 → 复制 → 通过 SFTP 或 Cloudflare Pages Assets 上传到根目录。Korelyy 自动校验通配符写法(禁止 /* 后加 $、Allow 优先级高于 Disallow 等 2026 Google 标准)。
2.1 12 个开箱即用模板(直接复制粘贴)
- 模板1. 纯静态博客(Jekyll/Hugo/Cloudflare Pages):Allow 全部公开目录,Disallow /private/ /draft/ /admin/,拦截 AI 爬虫,加 sitemap.xml。
- 模板2. WordPress 2026:Allow /wp-admin/admin-ajax.php;Disallow /xmlrpc.php、/wp-json/、/?s=*、/search/、comment-page-*、tag、category分页、author、feed;拦截 AI。
- 模板3. Shopify:使用 Shopify 自带的「在线商店→偏好设置→robots.txt 编辑器」追加 AI 爬虫拦截行;Sitemap 默认 /sitemap.xml。
- 模板4. Next.js 静态导出(Korelyy 实际在用):Disallow /_next/ 和 *.json;Sitemap 用 /sitemap-index.xml;AI 拦截。
3. 2026 年 7 个 robots.txt 致命错误
- 错误1. 本想写 Disallow /private/,手抖写成 Disallow: /,整站被 Google 清索引。
- 错误2. 对 Googlebot 写 Crawl-delay。Google 从 2019 年起就忽略 Crawl-delay,应该去 Google Search Console 调整抓取速度。
- 错误3. WordPress Disallow /wp-admin/ 但漏掉 Allow /wp-admin/admin-ajax.php — 无数插件会挂(因为前端也调用 admin-ajax 做动态内容)。
- 错误4. 写 Disallow /*.pdf$ 想屏蔽 PDF。Google 不支持 $ 结尾匹配,正确做法是给 PDF 加 X-Robots-Tag: noindex HTTP 头。
- 错误5. 只靠 robots.txt 想隐藏私密页面 — 如果有外链连到,Google 依然会索引。必须配合 meta robots noindex + 密码保护。
4. 上传后验证+监控步骤
步骤 1:curl -I https://你的域名/robots.txt → 返回 HTTP 200 + Content-Type: text/plain。步骤 2:Google Search Console → 设置 → robots.txt 测试器。粘贴 /search/、/wp-admin/ 等可疑路径确认生效。步骤 3:GSC → 网址检查工具 → 实时测试 → 请求编入索引。步骤 4:连续 4 周每周看「覆盖面报告」—警惕「已抓取但未编入索引」突然爆增。