Robots.txt: Guía Completa para SEO Técnico y Control de Bots de IA
El archivo robots.txt nació en 1994. Treinta años después, sigue siendo uno de los archivos más importantes de cualquier web. Pero si tu configuración actual es la misma que hace dos años, probablemente necesita una revisión.
Y es que en 2025 y 2026 ha pasado algo que cambia bastante el juego: los bots de inteligencia artificial —GPTBot de OpenAI, ClaudeBot de Anthropic, GoogleBot-Extended, CCBot de Common Crawl y otros— han empezado a rastrear la web de forma masiva para alimentar sus modelos de lenguaje. Y el robots.txt es, ahora mismo, la única herramienta estándar que tienes para controlar quién accede a tu contenido y quién no.
Esta guía está actualizada a 2026. Cubre todo lo que necesitas saber: desde la configuración básica hasta la gestión de bots de IA, pasando por la relación con el crawl budget, los errores más habituales, y cuándo usar robots.txt frente a noindex.
¿Qué es el archivo robots.txt y para qué sirve en 2026?
El robots.txt es un archivo de texto plano que se aloja en la raíz de tu dominio (tudominio.com/robots.txt) y que contiene instrucciones para los bots que rastrean tu web. Su función principal es indicarles qué partes del sitio pueden explorar y cuáles deben ignorar.
Lo que no hace: el robots.txt no es un mecanismo de seguridad. Un bot malicioso puede ignorarlo perfectamente. Lo que sí hace es que los bots que respetan el protocolo —la gran mayoría de los relevantes, incluido Googlebot— sigan las instrucciones al pie de la letra.
La sintaxis básica no ha cambiado:
User-agent: *
Disallow: /admin/
Allow: /public/
Sitemap: https://tudominio.com/sitemap.xml
Pero el contexto en el que opera sí ha cambiado mucho.
La novedad de 2025-2026: controlar los bots de IA
Esta es la parte que no existía en la versión anterior de este artículo y que ahora es crítica.
Desde 2023, los grandes modelos de lenguaje (ChatGPT, Claude, Gemini, Perplexity…) entrenan sus modelos rastreando la web. Cada uno de estos sistemas tiene su propio bot identificado, y todos respetan el robots.txt si se lo indicas correctamente.
¿Por qué importa esto? Porque estás tomando una decisión estratégica: ¿quieres que la IA aprenda de tu contenido o no? La respuesta depende de tu negocio.
Si quieres que la IA te cite en sus respuestas (lo que se conoce como visibilidad GEO o Generative Engine Optimization), necesitas que los bots de IA puedan acceder a tu contenido. Bloqueándolos, te vuelves invisible para ChatGPT, Claude o Perplexity aunque estés en el top 3 de Google.
Si no quieres que la IA use tu contenido para entrenar sus modelos sin compensación, puedes bloquear específicamente los bots de entrenamiento mientras permites los bots de búsqueda de IA (que son distintos).
Los bots de IA más relevantes en 2026
Esta es la lista actualizada de los principales bots de IA y sus identificadores para robots.txt:
| Bot | Empresa | User-agent | Función |
|---|---|---|---|
| GPTBot | OpenAI | GPTBot |
Entrenamiento de modelos |
| ChatGPT-User | OpenAI | ChatGPT-User |
Búsqueda en tiempo real (ChatGPT) |
| ClaudeBot | Anthropic | ClaudeBot |
Entrenamiento de modelos |
| Claude-Web | Anthropic | Claude-Web |
Búsqueda web en tiempo real |
| GoogleBot-Extended | Google-Extended |
Entrenamiento de Gemini | |
| Gemini (búsqueda) | Googlebot |
Búsqueda estándar (no bloquear) | |
| PerplexityBot | Perplexity | PerplexityBot |
Rastreo para respuestas |
| CCBot | Common Crawl | CCBot |
Corpus de entrenamiento |
| Applebot | Apple | Applebot |
Apple Intelligence |
| Bytespider | ByteDance | Bytespider |
Entrenamiento TikTok IA |
| FacebookBot | Meta | FacebookBot |
Rastreo Meta IA |

Configuraciones según tu estrategia
Opción A: Permitir todo (máxima visibilidad en IA)
User-agent: *
Disallow:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
Opción B: Bloquear entrenamiento pero permitir búsqueda en tiempo real
# Bloquear bots de entrenamiento
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
# Permitir bots de búsqueda IA (visibilidad en respuestas)
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
Opción C: Bloquear todos los bots de IA
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-Web
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Applebot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: FacebookBot
Disallow: /
La opción correcta para tu caso depende de tu modelo de negocio. No existe una respuesta universal. Un medio de comunicación con contenido de pago probablemente elija la opción C. Una agencia SEO que quiere aparecer en las respuestas de ChatGPT elegirá la opción A. Un ecommerce probablemente opte por la B.

Para qué sirve el robots.txt en SEO técnico tradicional
Más allá de los bots de IA, las funciones clásicas del robots.txt siguen siendo igual de relevantes.
Controlar el presupuesto de rastreo (Crawl Budget)

El crawl budget es el número de páginas que Googlebot está dispuesto a rastrear en tu sitio durante un período determinado. En sitios grandes —con miles o decenas de miles de páginas— gestionarlo bien marca la diferencia entre tener todo indexado o tener páginas importantes que Google no visita.
El robots.txt te permite dirigir ese presupuesto hacia las páginas que importan:
User-agent: *
# Evitar rastreo de URLs que generan contenido duplicado o sin valor SEO
Disallow: /search?
Disallow: /tag/
Disallow: /author/
Disallow: /page/
Disallow: /wp-json/
Disallow: /feed/
Disallow: /?s=
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Nota importante sobre ecommerce: Las páginas de carrito, checkout y cuenta de usuario deben estar bloqueadas no solo para ahorrar crawl budget, sino para evitar que Google intente indexar páginas de sesión sin contenido válido.
Evitar la indexación de contenido duplicado
Muchos CMS generan automáticamente URLs duplicadas: paginaciones, filtros de facetas, versiones de impresión, parámetros UTM… Si no se controlan, pueden dividir la autoridad de tus páginas y confundir a Google sobre cuál es la versión canónica.
Configuración habitual para WordPress:
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-json/
Disallow: /?p=
Disallow: /feed/
Disallow: /trackback/
Allow: /wp-admin/admin-ajax.php
Configuración habitual para ecommerce con filtros:
User-agent: *
Disallow: /*?color=
Disallow: /*?size=
Disallow: /*?sort=
Disallow: /*?page=
Disallow: /search/
Proteger áreas privadas o de administración
Las áreas de administración, paneles de login y secciones privadas no deben ser rastreadas. No porque suponga un riesgo de seguridad (el robots.txt no protege nada, como ya dijimos), sino porque es contenido sin ningún valor SEO que consume recursos de rastreo.
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /login/
Disallow: /private/
Disallow: /staging/
Robots.txt y sitemap.xml: la combinación que optimiza el rastreo
Incluir la ruta del sitemap en el robots.txt es una práctica estándar que facilita a todos los bots —incluidos los de IA— encontrar directamente las páginas más importantes de tu sitio.
User-agent: *
Disallow: /admin/
Disallow: /search?
Allow: /
Sitemap: https://tudominio.com/sitemap.xml
Sitemap: https://tudominio.com/sitemap-products.xml
Sitemap: https://tudominio.com/sitemap-blog.xml
Si tienes múltiples sitemaps (uno por sección o categoría), puedes incluirlos todos. En 2026, con sitios que gestionan contenido en varios idiomas o tiendas con miles de productos, esta práctica es especialmente relevante para asegurarte de que el crawl budget se dirige a donde debe.
Robots.txt vs. meta noindex: cuándo usar cada uno

Este es uno de los puntos de mayor confusión en SEO técnico. La diferencia fundamental es esta:
robots.txtcon Disallow: impide el rastreo. El bot no puede ver la página.- Meta noindex: permite el rastreo, pero impide la indexación. El bot ve la página pero no la muestra en resultados.
La consecuencia práctica es importante: si bloqueas una página con robots.txt, Google no puede leer su etiqueta noindex. Resultado: la página puede aparecer en resultados de búsqueda si otros sitios la enlazan, aunque sin snippet de descripción.
Cuándo usar robots.txt (Disallow)
- Áreas de administración y páginas técnicas sin valor SEO
- Contenido de staging o entornos de desarrollo que no deben indexarse nunca
- Archivos de sistema, scripts, estilos (aunque en 2026 Google puede rastrear CSS y JS para entender mejor el renderizado)
- Bots de IA que quieres excluir completamente
Cuándo usar meta noindex
- Páginas de resultados de búsqueda interna (quieres que Google siga los enlaces dentro, pero no indexe la URL)
- Páginas de paginación de categorías donde el contenido se solapa
- Páginas de agradecimiento o confirmación de formularios
- Páginas de política de privacidad, aviso legal y cookies (opcionales pero habituales)
- Páginas de usuario o perfil en comunidades
El caso especial: noindex + allow en robots.txt
Para páginas donde quieres que Google siga los enlaces pero no las indexe:
User-agent: *
Allow: /categoria/
# (y en cada página de categoría, añadir <meta name="robots" content="noindex, follow">)
Errores críticos que debes evitar en 2026

1. Bloquear tu propio sitio con Disallow: /
El error más grave. Ocurre con más frecuencia de lo que parece, especialmente en migraciones o cuando alguien toca el robots.txt de un entorno de staging y lo sube a producción por error.
Revisa siempre el robots.txt en producción después de cualquier migración o cambio de servidor.
# ❌ NUNCA en producción
User-agent: *
Disallow: /
2. Bloquear CSS y JavaScript
En 2026, Google renderiza las páginas casi como un navegador. Si bloqueas los archivos CSS o JS, puede ver una versión distorsionada de tu web, lo que afecta al renderizado y potencialmente al posicionamiento.
# ❌ Error habitual
User-agent: *
Disallow: /wp-content/themes/
Disallow: /wp-content/plugins/
La excepción: puedes bloquear scripts de analytics, tracking o herramientas de terceros que no afectan al renderizado visual.
3. No actualizar la lista de bots de IA
Si configuraste tu robots.txt en 2023 o 2024 y no lo has revisado, probablemente no tienes controlados varios bots de IA que han aparecido desde entonces. Revisa la lista al menos cada seis meses.
4. Usar el robots.txt como medida de seguridad
El robots.txt es público. Cualquiera puede verlo en tudominio.com/robots.txt. Si pones ahí las rutas de tus páginas privadas o sensibles, estás indicando exactamente dónde están. Para proteger contenido privado usa autenticación, no robots.txt.
5. Bloquear el sitemap
Algunos configuran el robots.txt para bloquear directorios completos e incluyen sin querer el sitemap. Comprueba siempre que la ruta del sitemap no esté cubierta por ningún Disallow.
6. Olvidarse de revisar el robots.txt después de una migración
Cambios de CMS, migraciones a nuevo servidor, actualizaciones de WordPress… cualquiera de estos cambios puede sobrescribir el robots.txt. Ponlo en tu checklist de post-migración.
Cómo verificar que tu robots.txt funciona correctamente

Google Search Console
La herramienta más fiable para verificar cómo ve Googlebot tu robots.txt. En el informe de Configuración (antes llamado herramienta de prueba de robots.txt), puedes introducir cualquier URL de tu sitio y comprobar si está bloqueada o permitida.
También es donde recibirás alertas si Google detecta que tu robots.txt bloquea páginas importantes que estaban siendo indexadas.
Screaming Frog
Configura el rastreo con «Respect robots.txt» activado y compara con un rastreo sin esa opción. La diferencia te muestra exactamente qué páginas están siendo bloqueadas a los bots.
En la versión 20+ de Screaming Frog puedes también ver en la columna de «Robots.txt» el estado de cada URL rastreada.
Verificación manual
Accede directamente a tudominio.com/robots.txt y revisa el contenido. Para comprobar si una URL específica está bloqueada, puedes usar el parámetro de comprobación en Search Console o herramientas como robots.txt Checker de Ahrefs o de Semrush (ambas gratuitas para uso básico).
Herramienta de Microsoft Clarity (novedad 2025-2026)
Microsoft Clarity añadió en 2025 un panel de «AI Visibility» que incluye el análisis de bots de IA que rastrean tu sitio. Desde ahí puedes ver qué bots de IA te visitan, con qué frecuencia, y cuánto tráfico de referencia te devuelven. Es la herramienta más práctica actualmente para tomar la decisión informada sobre si bloquear o no los bots de IA en tu robots.txt.
Plantilla de robots.txt actualizada para 2026

Esta es una plantilla base que puedes adaptar a tu caso:
# =============================================
# robots.txt — Actualizado agosto 2026
# tudominio.com
# =============================================
# --- MOTORES DE BÚSQUEDA TRADICIONALES ---
# Permitir acceso completo a Googlebot
User-agent: Googlebot
Allow: /
# Permitir acceso completo a Bingbot
User-agent: Bingbot
Allow: /
# --- BOTS DE IA (ajusta según tu estrategia) ---
# OpenAI: entrenamiento bloqueado, búsqueda en tiempo real permitida
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Allow: /
# Anthropic: entrenamiento bloqueado, búsqueda en tiempo real permitida
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-Web
Allow: /
# Google: entrenamiento de Gemini bloqueado
User-agent: Google-Extended
Disallow: /
# Perplexity: permitido (búsqueda en tiempo real)
User-agent: PerplexityBot
Allow: /
# Common Crawl: bloqueado (corpus de entrenamiento masivo)
User-agent: CCBot
Disallow: /
# ByteDance: bloqueado
User-agent: Bytespider
Disallow: /
# --- REGLAS GENERALES ---
User-agent: *
# Administración y técnico
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-json/
Disallow: /wp-login.php
Disallow: /xmlrpc.php
Disallow: /feed/
Disallow: /trackback/
# Ecommerce (si aplica)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /order-confirmation/
# Parámetros de búsqueda y filtros que generan duplicados
Disallow: /*?s=
Disallow: /*?p=
Disallow: /*?replytocom=
Disallow: /search/
# Permitir recursos necesarios para el renderizado
Allow: /wp-content/uploads/
Allow: /wp-content/themes/*.css
Allow: /wp-content/themes/*.js
Allow: /wp-admin/admin-ajax.php
# --- SITEMAPS ---
Sitemap: https://tudominio.com/sitemap.xml
Sitemap: https://tudominio.com/sitemap-posts.xml
Adapta la sección de bots de IA según la opción estratégica que hayas elegido (A, B o C de la sección anterior).
La decisión estratégica sobre los bots de IA: preguntas para tomarla
Antes de configurar la sección de IA de tu robots.txt, responde estas preguntas:
¿Tu negocio se beneficia de aparecer en respuestas de ChatGPT, Perplexity o Google AI Overviews? Si sí, necesitas que los bots de búsqueda de IA puedan rastrear tu contenido.
¿Tienes contenido que es tu ventaja competitiva y que no quieres que forme parte del corpus de entrenamiento de una IA? Si sí, bloquea los bots de entrenamiento (GPTBot, Google-Extended, CCBot).
¿Tienes un modelo de negocio basado en contenido de pago o suscripción? Probablemente quieras bloquear todos los bots de IA o usar paywalls en combinación.
¿Eres una agencia, consultora o empresa de servicios que quiere posicionarse como referente? Probablemente la opción A (permitir todo) sea la más beneficiosa para tu visibilidad.
No existe una respuesta correcta universal. Lo importante es que la decisión sea consciente y no el resultado de no haber pensado en ello.
El robots.txt sigue siendo, treinta años después de su creación, uno de los archivos más estratégicos de cualquier sitio web. Lo que ha cambiado en 2025-2026 es el número y la variedad de bots que lo respetan, con los sistemas de IA añadiendo una dimensión completamente nueva a la decisión.
Revisar tu robots.txt una vez al año ya no es suficiente. Con el ritmo al que están apareciendo nuevos bots de IA, conviene hacer una revisión cada seis meses y después de cualquier cambio significativo en tu sitio.
Si tienes dudas sobre qué configuración es la correcta para tu caso, o si quieres que revisemos el robots.txt de tu web dentro de una auditoría técnica completa, estamos disponibles para ayudarte.
Antonio López es CEO de y Director SEO de Seostar. Cuenta con casi 20 años de experiencia en proyectos SEO.








Dejar un comentario
¿Quieres unirte a la conversación?Siéntete libre de contribuir!