Seostar Agencia SEO y marketing digital
  • Inicio
  • Servicios
    • Posicionamiento SEO
      • Auditoría SEO
      • Estrategia SEO
      • Dirección SEO
      • Formación SEO
      • Linkbuilding
    • Branding
      • Reputación Online
      • Branding deportivo
    • Traffic.
    • CRO y UX
    • Estrategia Ecommerce
    • Consultoría estratégica
  • Blog
  • Soporte
  • Trabaja con nosotros
  • Contacto
  • Click to open the search input field Click to open the search input field Buscar
  • Menú Menú
SEO

Robots.txt: Guía Completa para SEO Técnico y Control de Bots de IA

Robots.txt en SEO y GEO
Resumir el contenido con IA

El archivo robots.txt nació en 1994. Treinta años después, sigue siendo uno de los archivos más importantes de cualquier web. Pero si tu configuración actual es la misma que hace dos años, probablemente necesita una revisión.

Y es que en 2025 y 2026 ha pasado algo que cambia bastante el juego: los bots de inteligencia artificial —GPTBot de OpenAI, ClaudeBot de Anthropic, GoogleBot-Extended, CCBot de Common Crawl y otros— han empezado a rastrear la web de forma masiva para alimentar sus modelos de lenguaje. Y el robots.txt es, ahora mismo, la única herramienta estándar que tienes para controlar quién accede a tu contenido y quién no.

Esta guía está actualizada a 2026. Cubre todo lo que necesitas saber: desde la configuración básica hasta la gestión de bots de IA, pasando por la relación con el crawl budget, los errores más habituales, y cuándo usar robots.txt frente a noindex.


¿Qué es el archivo robots.txt y para qué sirve en 2026?

El robots.txt es un archivo de texto plano que se aloja en la raíz de tu dominio (tudominio.com/robots.txt) y que contiene instrucciones para los bots que rastrean tu web. Su función principal es indicarles qué partes del sitio pueden explorar y cuáles deben ignorar.

Lo que no hace: el robots.txt no es un mecanismo de seguridad. Un bot malicioso puede ignorarlo perfectamente. Lo que sí hace es que los bots que respetan el protocolo —la gran mayoría de los relevantes, incluido Googlebot— sigan las instrucciones al pie de la letra.

La sintaxis básica no ha cambiado:

User-agent: *
Disallow: /admin/
Allow: /public/
Sitemap: https://tudominio.com/sitemap.xml

Pero el contexto en el que opera sí ha cambiado mucho.


La novedad de 2025-2026: controlar los bots de IA

Esta es la parte que no existía en la versión anterior de este artículo y que ahora es crítica.

Desde 2023, los grandes modelos de lenguaje (ChatGPT, Claude, Gemini, Perplexity…) entrenan sus modelos rastreando la web. Cada uno de estos sistemas tiene su propio bot identificado, y todos respetan el robots.txt si se lo indicas correctamente.

¿Por qué importa esto? Porque estás tomando una decisión estratégica: ¿quieres que la IA aprenda de tu contenido o no? La respuesta depende de tu negocio.

Si quieres que la IA te cite en sus respuestas (lo que se conoce como visibilidad GEO o Generative Engine Optimization), necesitas que los bots de IA puedan acceder a tu contenido. Bloqueándolos, te vuelves invisible para ChatGPT, Claude o Perplexity aunque estés en el top 3 de Google.

Si no quieres que la IA use tu contenido para entrenar sus modelos sin compensación, puedes bloquear específicamente los bots de entrenamiento mientras permites los bots de búsqueda de IA (que son distintos).

Los bots de IA más relevantes en 2026

Esta es la lista actualizada de los principales bots de IA y sus identificadores para robots.txt:

Bot Empresa User-agent Función
GPTBot OpenAI GPTBot Entrenamiento de modelos
ChatGPT-User OpenAI ChatGPT-User Búsqueda en tiempo real (ChatGPT)
ClaudeBot Anthropic ClaudeBot Entrenamiento de modelos
Claude-Web Anthropic Claude-Web Búsqueda web en tiempo real
GoogleBot-Extended Google Google-Extended Entrenamiento de Gemini
Gemini (búsqueda) Google Googlebot Búsqueda estándar (no bloquear)
PerplexityBot Perplexity PerplexityBot Rastreo para respuestas
CCBot Common Crawl CCBot Corpus de entrenamiento
Applebot Apple Applebot Apple Intelligence
Bytespider ByteDance Bytespider Entrenamiento TikTok IA
FacebookBot Meta FacebookBot Rastreo Meta IA

Distintos Bots para IA

Configuraciones según tu estrategia

Opción A: Permitir todo (máxima visibilidad en IA)

User-agent: *
Disallow:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

Opción B: Bloquear entrenamiento pero permitir búsqueda en tiempo real

# Bloquear bots de entrenamiento
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

# Permitir bots de búsqueda IA (visibilidad en respuestas)
User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

Opción C: Bloquear todos los bots de IA

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-Web
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Applebot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: FacebookBot
Disallow: /

La opción correcta para tu caso depende de tu modelo de negocio. No existe una respuesta universal. Un medio de comunicación con contenido de pago probablemente elija la opción C. Una agencia SEO que quiere aparecer en las respuestas de ChatGPT elegirá la opción A. Un ecommerce probablemente opte por la B.

Configuración de robots.txt


Para qué sirve el robots.txt en SEO técnico tradicional

Más allá de los bots de IA, las funciones clásicas del robots.txt siguen siendo igual de relevantes.

Controlar el presupuesto de rastreo (Crawl Budget)

Controlar el presupuesto de rastreo

 

El crawl budget es el número de páginas que Googlebot está dispuesto a rastrear en tu sitio durante un período determinado. En sitios grandes —con miles o decenas de miles de páginas— gestionarlo bien marca la diferencia entre tener todo indexado o tener páginas importantes que Google no visita.

El robots.txt te permite dirigir ese presupuesto hacia las páginas que importan:

User-agent: *
# Evitar rastreo de URLs que generan contenido duplicado o sin valor SEO
Disallow: /search?
Disallow: /tag/
Disallow: /author/
Disallow: /page/
Disallow: /wp-json/
Disallow: /feed/
Disallow: /?s=
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

Nota importante sobre ecommerce: Las páginas de carrito, checkout y cuenta de usuario deben estar bloqueadas no solo para ahorrar crawl budget, sino para evitar que Google intente indexar páginas de sesión sin contenido válido.

Evitar la indexación de contenido duplicado

Muchos CMS generan automáticamente URLs duplicadas: paginaciones, filtros de facetas, versiones de impresión, parámetros UTM… Si no se controlan, pueden dividir la autoridad de tus páginas y confundir a Google sobre cuál es la versión canónica.

Configuración habitual para WordPress:

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-json/
Disallow: /?p=
Disallow: /feed/
Disallow: /trackback/
Allow: /wp-admin/admin-ajax.php

Configuración habitual para ecommerce con filtros:

User-agent: *
Disallow: /*?color=
Disallow: /*?size=
Disallow: /*?sort=
Disallow: /*?page=
Disallow: /search/

Proteger áreas privadas o de administración

Las áreas de administración, paneles de login y secciones privadas no deben ser rastreadas. No porque suponga un riesgo de seguridad (el robots.txt no protege nada, como ya dijimos), sino porque es contenido sin ningún valor SEO que consume recursos de rastreo.

User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /login/
Disallow: /private/
Disallow: /staging/

Robots.txt y sitemap.xml: la combinación que optimiza el rastreo

Incluir la ruta del sitemap en el robots.txt es una práctica estándar que facilita a todos los bots —incluidos los de IA— encontrar directamente las páginas más importantes de tu sitio.

User-agent: *
Disallow: /admin/
Disallow: /search?
Allow: /

Sitemap: https://tudominio.com/sitemap.xml
Sitemap: https://tudominio.com/sitemap-products.xml
Sitemap: https://tudominio.com/sitemap-blog.xml

Si tienes múltiples sitemaps (uno por sección o categoría), puedes incluirlos todos. En 2026, con sitios que gestionan contenido en varios idiomas o tiendas con miles de productos, esta práctica es especialmente relevante para asegurarte de que el crawl budget se dirige a donde debe.


Robots.txt vs. meta noindex: cuándo usar cada uno

comparativa robots.txt Disallow vs meta noindex

 

Este es uno de los puntos de mayor confusión en SEO técnico. La diferencia fundamental es esta:

  • robots.txt con Disallow: impide el rastreo. El bot no puede ver la página.
  • Meta noindex: permite el rastreo, pero impide la indexación. El bot ve la página pero no la muestra en resultados.

La consecuencia práctica es importante: si bloqueas una página con robots.txt, Google no puede leer su etiqueta noindex. Resultado: la página puede aparecer en resultados de búsqueda si otros sitios la enlazan, aunque sin snippet de descripción.

Cuándo usar robots.txt (Disallow)

  • Áreas de administración y páginas técnicas sin valor SEO
  • Contenido de staging o entornos de desarrollo que no deben indexarse nunca
  • Archivos de sistema, scripts, estilos (aunque en 2026 Google puede rastrear CSS y JS para entender mejor el renderizado)
  • Bots de IA que quieres excluir completamente

Cuándo usar meta noindex

  • Páginas de resultados de búsqueda interna (quieres que Google siga los enlaces dentro, pero no indexe la URL)
  • Páginas de paginación de categorías donde el contenido se solapa
  • Páginas de agradecimiento o confirmación de formularios
  • Páginas de política de privacidad, aviso legal y cookies (opcionales pero habituales)
  • Páginas de usuario o perfil en comunidades

El caso especial: noindex + allow en robots.txt

Para páginas donde quieres que Google siga los enlaces pero no las indexe:

User-agent: *
Allow: /categoria/
# (y en cada página de categoría, añadir <meta name="robots" content="noindex, follow">)

Errores críticos que debes evitar en 2026

 

Errores críticos que debes evitar en SEO

 

1. Bloquear tu propio sitio con Disallow: /

El error más grave. Ocurre con más frecuencia de lo que parece, especialmente en migraciones o cuando alguien toca el robots.txt de un entorno de staging y lo sube a producción por error.

Revisa siempre el robots.txt en producción después de cualquier migración o cambio de servidor.

# ❌ NUNCA en producción
User-agent: *
Disallow: /

2. Bloquear CSS y JavaScript

En 2026, Google renderiza las páginas casi como un navegador. Si bloqueas los archivos CSS o JS, puede ver una versión distorsionada de tu web, lo que afecta al renderizado y potencialmente al posicionamiento.

# ❌ Error habitual
User-agent: *
Disallow: /wp-content/themes/
Disallow: /wp-content/plugins/

La excepción: puedes bloquear scripts de analytics, tracking o herramientas de terceros que no afectan al renderizado visual.

3. No actualizar la lista de bots de IA

Si configuraste tu robots.txt en 2023 o 2024 y no lo has revisado, probablemente no tienes controlados varios bots de IA que han aparecido desde entonces. Revisa la lista al menos cada seis meses.

4. Usar el robots.txt como medida de seguridad

El robots.txt es público. Cualquiera puede verlo en tudominio.com/robots.txt. Si pones ahí las rutas de tus páginas privadas o sensibles, estás indicando exactamente dónde están. Para proteger contenido privado usa autenticación, no robots.txt.

5. Bloquear el sitemap

Algunos configuran el robots.txt para bloquear directorios completos e incluyen sin querer el sitemap. Comprueba siempre que la ruta del sitemap no esté cubierta por ningún Disallow.

6. Olvidarse de revisar el robots.txt después de una migración

Cambios de CMS, migraciones a nuevo servidor, actualizaciones de WordPress… cualquiera de estos cambios puede sobrescribir el robots.txt. Ponlo en tu checklist de post-migración.


Cómo verificar que tu robots.txt funciona correctamente

Cómo verificar robots.txt

 

Google Search Console

La herramienta más fiable para verificar cómo ve Googlebot tu robots.txt. En el informe de Configuración (antes llamado herramienta de prueba de robots.txt), puedes introducir cualquier URL de tu sitio y comprobar si está bloqueada o permitida.

También es donde recibirás alertas si Google detecta que tu robots.txt bloquea páginas importantes que estaban siendo indexadas.

Screaming Frog

Configura el rastreo con «Respect robots.txt» activado y compara con un rastreo sin esa opción. La diferencia te muestra exactamente qué páginas están siendo bloqueadas a los bots.

En la versión 20+ de Screaming Frog puedes también ver en la columna de «Robots.txt» el estado de cada URL rastreada.

Verificación manual

Accede directamente a tudominio.com/robots.txt y revisa el contenido. Para comprobar si una URL específica está bloqueada, puedes usar el parámetro de comprobación en Search Console o herramientas como robots.txt Checker de Ahrefs o de Semrush (ambas gratuitas para uso básico).

Herramienta de Microsoft Clarity (novedad 2025-2026)

Microsoft Clarity añadió en 2025 un panel de «AI Visibility» que incluye el análisis de bots de IA que rastrean tu sitio. Desde ahí puedes ver qué bots de IA te visitan, con qué frecuencia, y cuánto tráfico de referencia te devuelven. Es la herramienta más práctica actualmente para tomar la decisión informada sobre si bloquear o no los bots de IA en tu robots.txt.


Plantilla de robots.txt actualizada para 2026

Plantilla Robots.txt

 

Esta es una plantilla base que puedes adaptar a tu caso:

# =============================================
# robots.txt — Actualizado agosto 2026
# tudominio.com
# =============================================

# --- MOTORES DE BÚSQUEDA TRADICIONALES ---
# Permitir acceso completo a Googlebot
User-agent: Googlebot
Allow: /

# Permitir acceso completo a Bingbot
User-agent: Bingbot
Allow: /

# --- BOTS DE IA (ajusta según tu estrategia) ---

# OpenAI: entrenamiento bloqueado, búsqueda en tiempo real permitida
User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Allow: /

# Anthropic: entrenamiento bloqueado, búsqueda en tiempo real permitida
User-agent: ClaudeBot
Disallow: /

User-agent: Claude-Web
Allow: /

# Google: entrenamiento de Gemini bloqueado
User-agent: Google-Extended
Disallow: /

# Perplexity: permitido (búsqueda en tiempo real)
User-agent: PerplexityBot
Allow: /

# Common Crawl: bloqueado (corpus de entrenamiento masivo)
User-agent: CCBot
Disallow: /

# ByteDance: bloqueado
User-agent: Bytespider
Disallow: /

# --- REGLAS GENERALES ---
User-agent: *

# Administración y técnico
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-json/
Disallow: /wp-login.php
Disallow: /xmlrpc.php
Disallow: /feed/
Disallow: /trackback/

# Ecommerce (si aplica)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /order-confirmation/

# Parámetros de búsqueda y filtros que generan duplicados
Disallow: /*?s=
Disallow: /*?p=
Disallow: /*?replytocom=
Disallow: /search/

# Permitir recursos necesarios para el renderizado
Allow: /wp-content/uploads/
Allow: /wp-content/themes/*.css
Allow: /wp-content/themes/*.js
Allow: /wp-admin/admin-ajax.php

# --- SITEMAPS ---
Sitemap: https://tudominio.com/sitemap.xml
Sitemap: https://tudominio.com/sitemap-posts.xml

Adapta la sección de bots de IA según la opción estratégica que hayas elegido (A, B o C de la sección anterior).


La decisión estratégica sobre los bots de IA: preguntas para tomarla

Antes de configurar la sección de IA de tu robots.txt, responde estas preguntas:

¿Tu negocio se beneficia de aparecer en respuestas de ChatGPT, Perplexity o Google AI Overviews? Si sí, necesitas que los bots de búsqueda de IA puedan rastrear tu contenido.

¿Tienes contenido que es tu ventaja competitiva y que no quieres que forme parte del corpus de entrenamiento de una IA? Si sí, bloquea los bots de entrenamiento (GPTBot, Google-Extended, CCBot).

¿Tienes un modelo de negocio basado en contenido de pago o suscripción? Probablemente quieras bloquear todos los bots de IA o usar paywalls en combinación.

¿Eres una agencia, consultora o empresa de servicios que quiere posicionarse como referente? Probablemente la opción A (permitir todo) sea la más beneficiosa para tu visibilidad.

No existe una respuesta correcta universal. Lo importante es que la decisión sea consciente y no el resultado de no haber pensado en ello.

El robots.txt sigue siendo, treinta años después de su creación, uno de los archivos más estratégicos de cualquier sitio web. Lo que ha cambiado en 2025-2026 es el número y la variedad de bots que lo respetan, con los sistemas de IA añadiendo una dimensión completamente nueva a la decisión.

Revisar tu robots.txt una vez al año ya no es suficiente. Con el ritmo al que están apareciendo nuevos bots de IA, conviene hacer una revisión cada seis meses y después de cualquier cambio significativo en tu sitio.

Si tienes dudas sobre qué configuración es la correcta para tu caso, o si quieres que revisemos el robots.txt de tu web dentro de una auditoría técnica completa, estamos disponibles para ayudarte.

Antonio López
Director SEO en Seostar | Web |  + postsBiografía

Antonio López es CEO de y Director SEO de Seostar. Cuenta con casi 20 años de experiencia en proyectos SEO.

  • Antonio López
    Visibilidad en IA: por qué tu web puede posicionar en Google y ser invisible para ChatGPT, Gemini o Claude
  • Antonio López
    ¿Cómo optimizar la velocidad de carga de una página web para mejorar el SEO?
  • Antonio López
    CheckList 7 pasos para posicionar contenido en AIO Overview.
  • Antonio López
    Pluging WordPress Clustering SEO by Seostar

Otros Post Relacionados

  • calendario ecommerce
    Calendario Ecommerce Prestashop
  • Feliz Navidad
    La magia de la Navidad… y del SEO
  • Search console paso a paso
    Search Console Guía completa
  • plugin wordpress cluster seo
    Pluging WordPress Clustering SEO by Seostar
  • Web invisible para la inteligencia artificial pese a posicionar en Google
    Visibilidad en IA: por qué tu web puede posicionar en Google y ser invisible para ChatGPT, Gemini o Claude
  • Ganadores de los premios día de Internet
    Caudal.es, mejor empresa en transformación digital: un premio que también es nuestro
  • SEO Local
    SEO Local en 2026: La Guía Definitiva para Aparecer Primero en Tu Ciudada
  • seonderground 2021
    Seonderground 2021 – Evento SEO en habla hispana.
0 Comentarios/por Antonio López
Compartir esta entrada
  • Compartir en Facebook
  • Compartir en X
  • Compartir en WhatsApp
  • Compartir en LinkedIn
0 comentarios

Dejar un comentario

¿Quieres unirte a la conversación?
Siéntete libre de contribuir!

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Search Search

Newsletter

Categorías del Blog

  • SEO
  • CRO
  • Analítica
  • Conferencias
  • Noticias corporativas

Recursos y Gestión

  • Acceso a Soporte
  • Agenda. Reserva horas.
  • Trabaja con nosotros
  • Acceso a Informes
  • Brand Seostar®
  • Guía de Search Console
  • Recursos Seostar
  • Generador Schema.org
  • Vectores Similitud Semántica
  • Cluster Keyword Ai

Servicios Seostar® Agencia SEO

  • Posicionamiento SEO
  • Auditoría SEO
  • Estrategia SEO
  • Linkbuilding
  • Formación SEO
  • Estrategia Ecommerce
  • Reputación Online
  • Consultoría estratégica

Agencia SEO Seostar®Central

C/ Círculo Agrícola, 1, 2ºA

CP.: 30012  – Patiño – Murcia

Tlf.: 868 92 89 23

mail: info – @ – seostar.es

Oficina Seostar en Murcia 

Oficina Seostar en Almería

Logo Seostar Agency

 

© Copyright - Seostar Agencia SEO y marketing digital
  • Link to Facebook
  • Link to X
  • Aviso Legal
  • Política de Privacidad
  • Política de Cookies
Link to: ¿Ha muerto el SEO por culpa de la IA? Lo que dicen los datos reales en 2026 Link to: ¿Ha muerto el SEO por culpa de la IA? Lo que dicen los datos reales en 2026 ¿Ha muerto el SEO por culpa de la IA? Lo que dicen los datos reales en 202...El SEO ha muerto. Larga vida al SEO Link to: El Big data será una realidad certera en 2015 Link to: El Big data será una realidad certera en 2015 big dataEl Big data será una realidad certera en 2015
Desplazarse hacia arriba Desplazarse hacia arriba Desplazarse hacia arriba

Utilizamos cookies propias y de terceros para mejorar nuestros servicios y mostrarle publicidad relacionada con sus preferencias mediante el análisis de sus hábitos de navegación. Si continua navegando, consideramos que acepta su uso. Puede cambiar la configuración u obtener más información

Configurar CookiesAceptar Cookies

Cookies y privacidad



Cómo se usan las Cookies

Podemos solicitar que se establezcan cookies en su dispositivo. Utilizamos cookies para informarnos cuando visita nuestros sitios web, cómo interactúa con nosotros, para enriquecer su experiencia de usuario y para personalizar su relación con nuestro sitio web.

Haga clic en los diferentes encabezados de categoría para obtener más información. También puede cambiar algunas de sus preferencias. Tenga en cuenta que el bloqueo de algunos tipos de cookies puede afectar su experiencia en nuestros sitios web y los servicios que podemos ofrecer.

Cookies Esenciales

Estas cookies son estrictamente necesarias para proporcionarle servicios disponibles a través de nuestro sitio web y para utilizar algunas de sus funciones.

Debido a que estas cookies son estrictamente necesarias para entregar el sitio web, no puede rechazarlas sin afectar el funcionamiento de nuestro sitio. Puede bloquearlos o eliminarlos cambiando la configuración de su navegador y forzando el bloqueo de todas las cookies en este sitio web.

Google Analytics Cookies

Estas cookies recopilan información que se usa en forma agregada para ayudarnos a comprender cómo se usa nuestro sitio web o cuán efectivas son nuestras campañas de marketing, o para ayudarnos a personalizar nuestro sitio web y nuestra aplicación para mejorar su experiencia.

Si no desea que rastreemos su visor a nuestro sitio, puede desactivar el seguimiento en su navegador aquí:

Servicios Externos

También utilizamos diferentes servicios externos como Google Webfonts, Google Maps y proveedores externos de video. Dado que estos proveedores pueden recopilar datos personales como su dirección IP, le permitimos bloquearlos aquí. Tenga en cuenta que esto podría reducir en gran medida la funcionalidad y la apariencia de nuestro sitio. Los cambios tendrán efecto una vez que vuelva a cargar la página.

Google Webfont Settings:

Google Map Settings:

Vimeo and Youtube video embeds:

Política de Privacidad

Puede leer sobre nuestras cookies y configuraciones de privacidad en detalle en nuestra Página de Política de Privacidad.

Política de Privacidad
No aceptar CookiesPolítica de CookiesAceptar Cookies