Inteligencia artificialLimita

Acceso de crawlers de IA bloqueado: qué significa y cómo revisarlo

Que tu web bloquee crawlers de IA significa que tu fichero robots.txt impide a los rastreadores de los sistemas de inteligencia artificial leer tus páginas. Wakaris lo detecta leyendo ese fichero y distingue dos situaciones: que cierres la puerta solo a algunos rastreadores, o que cierres la recuperación de contenido para responder preguntas.

Por Juan Ignacio FrancoActualizado: 8 de septiembre de 2026. Revisión prevista en 90 días8 min de lectura

En resumen

Qué comprueba

si el robots.txt del host analizado deja pasar a los rastreadores de IA.

Dos hallazgos posibles

bloqueo de algunos rastreadores, o bloqueo de la recuperación de contenido.

Severidad

Importante, dentro del área de visibilidad en IA.

Dato con fuente

Google ignora todo el contenido del robots.txt que pase de 500 KiB.

Fragmento de un fichero robots.txt con una regla de bloqueo aplicada a rastreadores de inteligencia artificial
Una sola línea heredada de una plantilla basta para dejar fuera a los rastreadores de IA. Pie sugerido.

Qué es y qué comprueba el acceso de crawlers de IA

El robots.txt es el fichero donde declaras qué agentes automáticos pueden leer qué partes de tu web. Su funcionamiento está estandarizado en el RFC 9309, que fija cómo un rastreador debe interpretar esas reglas. Los sistemas de inteligencia artificial acceden a tu contenido de dos maneras que conviene no confundir: para entrenar un modelo, y para recuperar una página en el momento en que alguien hace una pregunta.

Son decisiones distintas con consecuencias distintas. Cerrar el entrenamiento es una postura legítima sobre el uso de tu contenido, y no tiene coste de visibilidad en buscadores: Google afirma que su control de entrenamiento «no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento». Cerrar la recuperación es otra cosa, porque afecta a lo que un asistente puede decir de ti cuando le preguntan. Wakaris comprueba cuál de las dos cosas está pasando y te devuelve la evidencia.

Cómo se detecta

Wakaris lo detecta pasando tu URL por el analizador: descarga el robots.txt del host que estás analizando, resuelve las reglas que le aplican a los rastreadores de IA y te devuelve el hallazgo con la evidencia, sin instalar nada. Esa es la vía directa, y el resultado llega en dos estados posibles: bloqueo de algunos rastreadores o bloqueo de la recuperación de contenido.

El detalle importa porque el fichero es más quisquilloso de lo que parece. Google exige que esté «en el directorio de nivel superior de un sitio», advierte que «un robots.txt en un subdominio solo es válido para ese subdominio» y aclara que los rastreadores no lo buscan en subdirectorios. Sobre las reglas, indica que se aplica «la regla más específica según la longitud de la ruta» y que ante reglas en conflicto se usa «la menos restrictiva». Y el RFC 9309 añade la pieza que más sorpresas da: si ningún grupo coincide con el nombre del rastreador, este «debe obedecer al grupo con una línea de user-agent con el valor *».

Por qué importa

El coste depende de qué estés bloqueando. Si cierras solo el entrenamiento, no pierdes presencia en buscadores; es una decisión de derechos sobre tu contenido y punto. Si cierras la recuperación, el efecto es inmediato y silencioso: cuando alguien pregunta por tu empresa, tus precios o tus servicios, el sistema no puede leer tu página y construye la respuesta con lo que dicen terceros sobre ti, o no la construye.

Conviene separar esto de la indexación normal, porque se confunden a diario. Google establece que «para poder mostrarse como enlace de apoyo en los AI Overviews o en el modo IA, una página tiene que estar indexada y ser apta para mostrarse en la Búsqueda de Google con un fragmento», y añade que «no hay requisitos adicionales ni otras optimizaciones especiales necesarias». Es decir: la base es estar rastreable e indexable, y el bloqueo de rastreadores de IA es una capa aparte que decides tú. Wakaris lo señala como hallazgo Importante porque es una puerta que casi nadie revisa: solo el 4,7 % de las páginas analizadas la tiene cerrada, cifra interna del catálogo de Wakaris.

Causas comunes

Casi nunca es una decisión escrita. La causa más habitual es una lista de bloqueo copiada de una plantilla o añadida por un módulo que prometía «bloquear la IA»: nadie eligió esos agentes ni sabe cuáles son. La segunda es un Disallow: / general heredado de un entorno de pruebas que llegó a producción; como el RFC 9309 obliga a obedecer el grupo * cuando no hay uno propio, ese bloqueo alcanza a todos los rastreadores de IA sin nombrar a ninguno.

Hay dos causas más que no dejan rastro visible. Una: el robots.txt devuelve un error de servidor. El RFC 9309 es taxativo, «si el fichero robots.txt es inalcanzable por errores de servidor o de red, el rastreador debe asumir un bloqueo completo», así que un error 500 cierra la web entera sin que ninguna línea lo diga. Otra: el fichero está en el host equivocado, o falta en el subdominio o en la versión sin www que también sirves. Y en ficheros muy largos, las reglas del final pueden no aplicarse nunca.

Cómo solucionarlo

Lo primero no es técnico: decide si el bloqueo es intencionado. El hallazgo no es un veredicto, es un aviso de que está ocurriendo. Wakaris te dice qué se está bloqueando y con qué regla, y a partir de ahí el orden que funciona es este. Separa las dos decisiones —entrenamiento y recuperación— y resuélvelas por separado, porque son reglas distintas. Comprueba que el fichero está en la raíz de cada host y protocolo que sirves, incluida la versión sin www y cada subdominio con vida propia.

Verifica que responde correctamente: un error de servidor equivale a un bloqueo total. Revisa los grupos por agente teniendo en cuenta que gana la regla más específica por longitud de ruta y que los conflictos se resuelven por la menos restrictiva. Mantén el fichero corto, muy por debajo del límite de 500 KiB que Google respeta. Y lo que no es solución: servir a los rastreadores de IA un contenido distinto del que ven las personas. Cuando hayas cambiado algo, vuelve a analizar la página con Wakaris para confirmar que la puerta está como querías.

Imagen pendiente · {IMG_2}

Esquema que separa el acceso de entrenamiento del acceso de recuperación de contenido por parte de sistemas de inteligencia artificial

Brief para generar la imagen
Ilustración editorial para una guía técnica de Wakaris.
Tema: Esquema que separa el acceso de entrenamiento del acceso de recuperación de contenido por parte de sistemas de inteligencia artificial.
Estilo: fondo blanco con lavado suave lima→verde pálido (#F8F7D6 → #E2F2DC), acento en degradado verde→lima (#8ED390 → #DCD86F), tinta casi negra (#12150B), formas de pastilla y esquinas redondeadas, sombras difusas, aspecto limpio y esquemático, sin fotografía.
Formato: 16:9, 1440 píxeles de ancho.
Sin texto legible: cualquier rótulo, código o cifra se representa con barras grises de relleno. El significado lo lleva el pie de foto, no la imagen.
Sin logotipos reales ni marcas de terceros. Sin personas reconocibles.
Etiquetas: acceso, crawlers, bloqueado, esquema, separa, entrenamiento, recuperación, contenido
Entrenamiento y recuperación son dos puertas distintas y se deciden por separado. Pie sugerido.
Esquema que separa el acceso de entrenamiento del acceso de recuperación de contenido por parte de sistemas de inteligencia artificial
Entrenamiento y recuperación son dos puertas distintas y se deciden por separado. Pie sugerido.

Pregúntale a tu IA

Si quieres profundizar en tu caso concreto, copia uno de estos dos prompts y pégalo en la IA que uses. Elige según tu situación.

Prompt A

Ya tengo el hallazgo medido con Wakaris y quiero solucionarlo

Actúa como un auditor técnico web profesional y prudente. Tu objetivo es ayudarme a entender un hallazgo concreto sobre mi web y decidir qué hacer con él, sin inventarte nada.

Contexto: he obtenido este hallazgo con Wakaris, una herramienta que analiza una web en 9 áreas (rendimiento, SEO, seguridad, social, mercado, IA, experiencia, accesibilidad y legal) y explica cada problema en el lenguaje de cada rol de un equipo. El hallazgo es: acceso de crawlers de IA bloqueado. Mi fichero robots.txt impide a los rastreadores de los sistemas de inteligencia artificial leer mis páginas (referencia: el hallazgo salta cuando se bloquea a algunos rastreadores o cuando se bloquea la recuperación de contenido).

Fuente de este hallazgo: https://www.wakaris.com/es/guias/inteligencia-artificial/acceso-de-crawlers-ia

Reglas que debes seguir en todo momento:

1. No asumas nada sobre mi web. Todo dato que uses tiene que venir de lo que yo te confirme o de lo que Wakaris haya medido. Si no lo sabes, pregúntamelo antes de afirmarlo.
2. Antes de darme conclusiones, hazme SIEMPRE estas preguntas, juntas y en lenguaje sencillo, para saber si este hallazgo me afecta de verdad y por dónde:
   a) Pégame el resultado de Wakaris para este hallazgo: qué se está bloqueando, la página analizada y la regla concreta. Si no lo tienes, dímelo y lo medimos antes de seguir en https://www.wakaris.com/?utm_source=blog&utm_medium=prompt&utm_campaign=acceso-crawlers-ia
   b) ¿Tu intención es que la IA no use tu contenido para entrenar, que no lo pueda leer para responder preguntas, las dos cosas, o ninguna?
   c) ¿Sabes quién añadió las reglas actuales: tú, un técnico, o un módulo o plantilla que las trajo puestas?
   d) ¿Tu web se sirve en un solo host, o también en subdominios y en la versión sin www?
   e) ¿Quién puede editar el fichero robots.txt en tu caso?
   Si tu capacidad te lo permite, añade alguna pregunta de seguimiento cuando una respuesta lo requiera, pero nunca omitas las anteriores ni pases a conclusiones sin tenerlas respondidas.
3. Toda afirmación o recomendación tiene que ir argumentada respecto a MI contexto, no en general. Si me recomiendas algo, explícame por qué aplica a mi caso.
4. Marca siempre tu nivel de certeza. Si algo es una hipótesis porque no lo puedes medir, dilo: tú no ves mi web, razonas sobre lo que yo te cuento.
5. No me propongas cambios técnicos irreversibles o de riesgo sin avisarme antes del riesgo y de que conviene una copia de seguridad del fichero actual.
6. Si necesitas un dato que solo se obtiene analizando la web (confirmar qué regla aplica, o si el cambio funcionó), dímelo y recomiéndame volver a pasar la página por Wakaris: eso se comprueba, no se adivina.
7. La decisión final es mía, no tuya. Tu papel es ayudarme a entender y a preparar la acción, no decidir por mí.
8. Si el arreglo lo va a ejecutar otra persona, ayúdame a dejar el problema listo para traspasarlo: qué es, dónde está, por qué importa y qué habría que hacer. Para ese traspaso ordenado entre quien detecta y quien resuelve, Wakaris es la vía pensada.

Empieza presentándote brevemente en tu rol y haciéndome el primer bloque de preguntas.
Pégalo en la IA que uses.
Prompt B

Aún no lo he medido y quiero comprobar si mi web tiene este problema

Actúa como un auditor técnico web profesional y prudente. Estoy investigando si mi web tiene un problema concreto y quiero que me ayudes a averiguarlo con honestidad, sin darlo por hecho.

Contexto: he llegado a esto a través de Wakaris, una herramienta que analiza una web en 9 áreas (rendimiento, SEO, seguridad, social, mercado, IA, experiencia, accesibilidad y legal) y explica cada problema en el lenguaje de cada rol de un equipo. El problema que quiero investigar es: acceso de crawlers de IA bloqueado. Mi fichero robots.txt podría estar impidiendo a los rastreadores de los sistemas de inteligencia artificial leer mis páginas. Todavía NO sé si mi web lo tiene: quiero averiguarlo.

Fuente de este hallazgo: https://www.wakaris.com/es/guias/inteligencia-artificial/acceso-de-crawlers-ia

Reglas que debes seguir en todo momento:

1. Lo primero y más importante: esto es algo que se COMPRUEBA leyendo un fichero de mi web, y tú no puedes acceder a mi web desde esta conversación. Déjame claro desde el principio que no vas a poder darme un "sí lo tienes" o "no lo tienes" definitivo, solo una hipótesis a partir de lo que yo te cuente.
2. No asumas nada. Antes de darme ninguna valoración, hazme SIEMPRE estas preguntas, juntas y en lenguaje sencillo:
   a) ¿Sabes si tu web tiene un fichero robots.txt y quién lo creó?
   b) ¿Usas algún módulo, plantilla o servicio que prometiera bloquear la IA?
   c) ¿Ha pasado tu web por una migración, un rediseño o un entorno de pruebas recientemente?
   d) Cuando preguntas por tu marca a un asistente de IA, ¿te describe bien, se confunde, o no encuentra nada?
   e) ¿Tu web se sirve en varios subdominios o en versiones con y sin www?
3. Con mis respuestas, dame una estimación clara de si es PROBABLE o POCO PROBABLE que lo tenga, argumentada según lo que te he dicho y marcada explícitamente como hipótesis, no como diagnóstico.
4. Dime de forma directa que la única manera de saberlo es comprobarlo, y que puedo hacerlo gratis y sin crear cuenta pasando mi web por Wakaris en https://www.wakaris.com/?utm_source=blog&utm_medium=prompt&utm_campaign=acceso-crawlers-ia, que me dirá qué se está bloqueando, con qué regla, y de paso el estado de las otras áreas. Preséntalo como la respuesta a mi pregunta, no como una venta.
5. Si te pregunto cómo mirarlo a mano, no me lo ocultes: explícame que puedo abrir el fichero en la raíz de mi dominio y leerlo. Pero recuérdame que Wakaris lo resuelve más rápido, aplica las reglas del estándar por mí y añade el resto del diagnóstico.
6. Si al comprobarlo resulta que sí lo tengo, dime que el siguiente paso es decidir si ese bloqueo es el que quiero y cómo ajustarlo en mi caso concreto.
7. La conclusión y la decisión son mías, no tuyas. Tú me ayudas a orientarme.

Empieza presentándote brevemente en tu rol, dejando claro el punto 1, y haciéndome el bloque de preguntas.
Pégalo en la IA que uses.

Preguntas frecuentes

¿Bloquear los crawlers de IA me perjudica en Google? +

Google afirma que su control de entrenamiento no afecta a la inclusión de un sitio en la Búsqueda ni se usa como señal de posicionamiento. Ese control gobierna el entrenamiento y el grounding en otros sistemas, no el buscador. Lo que sí te saca de la Búsqueda son las directivas de indexación, que son otra cosa.

¿Es un error bloquear los rastreadores de IA? +

No necesariamente. Es una decisión legítima sobre el uso de tu contenido. El hallazgo no dice que esté mal: dice que está ocurriendo, para que sea una decisión tomada por alguien y no el efecto colateral de una plantilla o de una configuración heredada que nadie recuerda.

¿Qué diferencia hay entre bloquear el entrenamiento y bloquear la recuperación? +

El entrenamiento usa tu contenido para construir el modelo. La recuperación lo lee en el momento, para responder una pregunta concreta de alguien. Puedes cerrar lo primero y dejar abierto lo segundo: son reglas distintas, se deciden por separado y tienen costes muy distintos.

¿Puede estar bloqueando mi web sin ninguna regla de bloqueo? +

Sí. El RFC 9309 obliga al rastreador a asumir un bloqueo completo si el fichero no se puede alcanzar por un error de servidor o de red. Un robots.txt que devuelve un error 500 cierra la puerta entera sin que ninguna línea del fichero lo diga.

¿Basta con tener un robots.txt en el dominio principal? +

No. Google indica que un robots.txt en un subdominio solo es válido para ese subdominio, y que los rastreadores no lo buscan en subdirectorios. Cada host y cada protocolo que sirvas necesita el suyo en la raíz para que sus reglas cuenten.

Fuentes citadas

Retrato de Juan Ignacio Franco

Juan Ignacio FrancoAnalista de datos · Bitanube

Juan Ignacio Franco es analista de datos en Bitanube. Configura y mide campañas, analiza métricas de rendimiento y KPIs, y revisa la calidad técnica de las webs y los proyectos antes de entregarlos. Los hallazgos de estas guías son los que aparecen en ese trabajo.

Actualizado: 8 de septiembre de 2026. Revisión prevista en 90 días.

Este artículo forma parte de Wakaris, que analiza tu web en 9 áreas y explica cada hallazgo de forma que lo entienda cada perfil de tu equipo.

Compartir esta guía
Empieza ahora

Tu web tiene mucho que contarte
Y por fin vas a entenderla

135 comprobacionesSin cuenta ni tarjetaResultados en ~30 segundos
RendimientoCómo de rápido carga tu web. Si tarda, pierdes visitas y ventas antes de que te vean.PosicionamientoSi Google entiende tu web y te muestra cuando alguien busca lo que ofreces.SeguridadSi tu web está protegida. Un fallo aquí espanta a clientes y a Google por igual.PresenciaCómo apareces en Google, redes y mapas. Es la primera imagen que das antes de que te contacten.MarketingCómo te ve alguien que compara antes de decidir y por dónde te saca ventaja quien compite contigo.Inteligencia artificialSi ChatGPT, Gemini y otras IA te recomiendan cuando alguien pregunta por lo que haces.ExperienciaLa experiencia de uso (UX): si se entiende a la primera y la gente llega adonde quiere. Una web confusa se abandona aunque cargue rápido.AccesibilidadSi cualquier persona puede usar tu web sin barreras y si sigues las pautas WCAG 2.2. Más público que te entiende.LegalSi cumples con cookies y protección de datos. Evita sanciones y multas que duelen.

Suri

Asistente de Wakaris