Générateur Robots.txt 2026 : Guide Syntaxe + 12 Modèles Prêts
Générateur robots.txt gratuit en ligne 2026. Syntaxe : User-agent, Allow, Disallow, Sitemap, Crawl-delay, wildcards. Modèles WordPress, Shopify, Next.js, Nuxt, Cloudflare Pages.
1. Qu'est-ce que robots.txt ? Pourquoi une mauvaise syntaxe vous déréférence
robots.txt est un fichier texte dans /robots.txt qui indique aux crawlers les pages à ignorer. Un Disallow: / mal placé vous déréférence de Google en 72h. Guidez-vous avec Korelyy sur la norme 2026 (ClaudeBot, GPTBot).
1.1 Les nouveaux crawlers 2026 à bloquer absolument
- GPTBot / ChatGPT-User — OpenAI scrappe pour entraîner ses modèles. 70% des sites enterprise le bloquent en 2026.
- ClaudeBot / anthropic-ai — Anthropic scrappe pour entraîner Claude.
- Google-Extended — Crawler d'entraînement IA de Google, indépendant de Googlebot (pas d'impact SEO).
- Amazonbot / Bytespider (TikTok) / PetalBot (Huawei) — scrapers les plus gourmands en bande passante en 2026.
2. Générateur Korelyy robots.txt — Génération sûre en 30 secondes
Ouvre Korelyy → SEO → Générateur robots.txt : 1. Plateforme. 2. Blocage IA. 3. Sitemap. 4. Règles par dossier. 5. Génère + copie + upload. Korelyy valide syntaxe wildcards.
2.1 12 Modèles prêts à copier-coller
- T1. Blog statique Jekyll/Hugo/Cloudflare : Allow public, Disallow private/draft/admin, bloque IA, Sitemap.
- T2. WordPress 2026 : Allow admin-ajax. Disallow xmlrpc, wp-json, /?s=, tag, author, feed. Blocage IA.
- T3. Shopify : Éditeur robots.txt intégré. Ajout lignes blocage IA. Sitemap auto /sitemap.xml.
- T4. Next.js Export statique : Disallow /_next/, *.json. Sitemap /sitemap-index.xml. Bloc IA.
3. 7 Erreurs fatales robots.txt en 2026
- E1. Disallow: / — erreur de frappe au lieu de /private. Déréférence tout le site.
- E2. Crawl-delay pour Googlebot — ignoré depuis 2019. Utilisez Search Console.
- E3. Disallow /wp-admin/ sans Allow admin-ajax.php — casse des plugins frontend.
- E4. Disallow /*.pdf$ — Google ignore le $. Utilisez X-Robots-Tag sur les PDF.
- E5. Robots.txt pour cacher des pages privées — Google indexe si liens externes existent. Ajoutez meta noindex + mot de passe.
4. Vérification + suivi après upload
1. curl -I → 200 text/plain. 2. GSC → Testeur robots.txt. 3. Demander réindexation. 4. Surveiller rapport Couverture GSC 4 semaines.