Intel·ligència artificialLimita

Accés de crawlers d’IA bloquejat: què significa i com revisar-ho

Que la teva web bloquegi crawlers d’IA significa que el teu fitxer robots.txt impedeix als rastrejadors dels sistemes d’intel·ligència artificial llegir les teves pàgines. Wakaris ho detecta llegint aquest fitxer i distingeix dues situacions: que tanquis la porta només a alguns rastrejadors, o que tanquis la recuperació de contingut per respondre preguntes.

Per Juan Ignacio FrancoActualitzat: 8 de setembre de 2026. Revisió prevista d’aquí a 90 dies8 min de lectura

En resum

Què comprova

si el robots.txt del host analitzat deixa passar els rastrejadors d’IA.

Dues troballes possibles

bloqueig d’alguns rastrejadors, o bloqueig de la recuperació de contingut.

Severitat

Important, dins de l’àrea de visibilitat en IA.

Dada amb font

Google ignora tot el contingut del robots.txt que passi de 500 KiB.

Fragment d’un fitxer robots.txt amb una regla de bloqueig aplicada a rastrejadors d’intel·ligència artificial
Una sola línia heretada d’una plantilla n’hi ha prou per deixar fora els rastrejadors d’IA. Peu suggerit.

Què és i què comprova l’accés de crawlers d’IA

El robots.txt és el fitxer on declares quins agents automàtics poden llegir quines parts de la teva web. El seu funcionament està estandarditzat a l’RFC 9309, que fixa com un rastrejador ha d’interpretar aquestes regles. Els sistemes d’intel·ligència artificial accedeixen al teu contingut de dues maneres que convé no confondre: per entrenar un model, i per recuperar una pàgina en el moment en què algú fa una pregunta.

Són decisions diferents amb conseqüències diferents. Tancar l’entrenament és una postura legítima sobre l’ús del teu contingut, i no té cost de visibilitat als cercadors: Google afirma que el seu control d’entrenament «no afecta la inclusió d’un lloc a la Cerca de Google ni es fa servir com a senyal de posicionament». Tancar la recuperació és una altra cosa, perquè afecta el que un assistent pot dir de tu quan li pregunten. Wakaris comprova quina de les dues coses està passant i et retorna l’evidència.

Com es detecta

Wakaris ho detecta passant la teva URL per l’analitzador: descarrega el robots.txt del host que estàs analitzant, resol les regles que s’apliquen als rastrejadors d’IA i et retorna la troballa amb l’evidència, sense instal·lar res. Aquesta és la via directa, i el resultat arriba en dos estats possibles: bloqueig d’alguns rastrejadors o bloqueig de la recuperació de contingut.

El detall importa perquè el fitxer és més primmirat del que sembla. Google exigeix que sigui «al directori de nivell superior d’un lloc», adverteix que «un robots.txt en un subdomini només és vàlid per a aquest subdomini» i aclareix que els rastrejadors no el busquen en subdirectoris. Sobre les regles, indica que s’aplica «la regla més específica segons la longitud del camí» i que davant de regles en conflicte es fa servir «la menys restrictiva». I l’RFC 9309 hi afegeix la peça que dona més sorpreses: si cap grup no coincideix amb el nom del rastrejador, aquest «ha d’obeir el grup amb una línia de user-agent amb el valor *».

Per què importa

El cost depèn del que estiguis bloquejant. Si tanques només l’entrenament, no perds presència als cercadors; és una decisió de drets sobre el teu contingut i prou. Si tanques la recuperació, l’efecte és immediat i silenciós: quan algú pregunta per la teva empresa, els teus preus o els teus serveis, el sistema no pot llegir la teva pàgina i construeix la resposta amb el que diuen tercers sobre tu, o no la construeix.

Convé separar això de la indexació normal, perquè es confonen cada dia. Google estableix que «per poder mostrar-se com a enllaç de suport als AI Overviews o al mode IA, una pàgina ha d’estar indexada i ser apta per mostrar-se a la Cerca de Google amb un fragment», i hi afegeix que «no hi ha requisits addicionals ni altres optimitzacions especials necessàries». És a dir: la base és ser rastrejable i indexable, i el bloqueig de rastrejadors d’IA és una capa a part que decideixes tu. Wakaris ho assenyala com a troballa Important perquè és una porta que gairebé ningú no revisa: només el 4,7 % de les pàgines analitzades la té tancada, xifra interna del catàleg de Wakaris.

Causes habituals

Gairebé mai no és una decisió escrita. La causa més habitual és una llista de bloqueig copiada d’una plantilla o afegida per un mòdul que prometia «bloquejar la IA»: ningú no va triar aquests agents ni sap quins són. La segona és un Disallow: / general heretat d’un entorn de proves que va arribar a producció; com que l’RFC 9309 obliga a obeir el grup * quan no n’hi ha un de propi, aquest bloqueig arriba a tots els rastrejadors d’IA sense anomenar-ne cap.

Hi ha dues causes més que no deixen rastre visible. Una: el robots.txt retorna un error de servidor. L’RFC 9309 és taxatiu, «si el fitxer robots.txt és inabastable per errors de servidor o de xarxa, el rastrejador ha d’assumir un bloqueig complet», així que un error 500 tanca la web sencera sense que cap línia ho digui. Una altra: el fitxer és al host equivocat, o falta al subdomini o a la versió sense www que també serveixes. I en fitxers molt llargs, les regles del final poden no aplicar-se mai.

Com solucionar-ho

El primer no és tècnic: decideix si el bloqueig és intencionat. La troballa no és un veredicte, és un avís que està passant. Wakaris et diu què s’està bloquejant i amb quina regla, i a partir d’aquí l’ordre que funciona és aquest. Separa les dues decisions —entrenament i recuperació— i resol-les per separat, perquè són regles diferents. Comprova que el fitxer és a l’arrel de cada host i protocol que serveixes, inclosa la versió sense www i cada subdomini amb vida pròpia.

Verifica que respon correctament: un error de servidor equival a un bloqueig total. Revisa els grups per agent tenint en compte que guanya la regla més específica per longitud de camí i que els conflictes es resolen per la menys restrictiva. Mantén el fitxer curt, molt per sota del límit de 500 KiB que Google respecta. I el que no és solució: servir als rastrejadors d’IA un contingut diferent del que veuen les persones. Quan hagis canviat alguna cosa, torna a analitzar la pàgina amb Wakaris per confirmar que la porta està com volies.

Imatge pendent · {IMG_2}

Esquema que separa l’accés d’entrenament de l’accés de recuperació de contingut per part de sistemes d’intel·ligència artificial

Brief per generar la imatge
Il·lustració editorial per a una guia tècnica de Wakaris.
Tema: Esquema que separa l’accés d’entrenament de l’accés de recuperació de contingut per part de sistemes d’intel·ligència artificial.
Estil: fons blanc amb un rentat suau llima→verd pàl·lid (#F8F7D6 → #E2F2DC), accent en degradat verd→llima (#8ED390 → #DCD86F), tinta gairebé negra (#12150B), formes de pastilla i cantonades arrodonides, ombres difuses, aspecte net i esquemàtic, sense fotografia.
Format: 16:9, 1440 píxels d’amplada.
Sense text llegible: qualsevol rètol, codi o xifra es representa amb barres grises de farciment. El significat el porta el peu de foto, no la imatge.
Sense logotips reals ni marques de tercers. Sense persones reconeixibles.
Etiquetes: esquema, separa, accés, entrenament, recuperació, contingut, sistemes, intel·ligència
Entrenament i recuperació són dues portes diferents i es decideixen per separat. Peu suggerit.
Esquema que separa l’accés d’entrenament de l’accés de recuperació de contingut per part de sistemes d’intel·ligència artificial
Entrenament i recuperació són dues portes diferents i es decideixen per separat. Peu suggerit.

Pregunta-li a la teva IA

Si vols aprofundir en el teu cas concret, copia un d’aquests dos prompts i enganxa’l a la IA que facis servir. Tria segons la teva situació.

Prompt A

Ja tinc la troballa mesurada amb Wakaris i la vull solucionar

Actua com un auditor tècnic web professional i prudent. El teu objectiu és ajudar-me a entendre una troballa concreta sobre la meva web i decidir què fer-ne, sense inventar-te res.

Context: he obtingut aquesta troballa amb Wakaris, una eina que analitza una web en 9 àrees (rendiment, SEO, seguretat, social, mercat, IA, experiència, accessibilitat i legal) i explica cada problema en el llenguatge de cada rol d’un equip. La troballa és: accés de crawlers d’IA bloquejat. El meu fitxer robots.txt impedeix als rastrejadors dels sistemes d’intel·ligència artificial llegir les meves pàgines (referència: la troballa salta quan es bloquegen alguns rastrejadors o quan es bloqueja la recuperació de contingut).

Font d’aquesta troballa: https://www.wakaris.com/ca/guias/inteligencia-artificial/acceso-de-crawlers-ia

Regles que has de seguir en tot moment:

1. No donis res per fet sobre la meva web. Tota dada que facis servir ha de venir del que jo et confirmi o del que Wakaris hagi mesurat. Si no ho saps, pregunta-m’ho abans d’afirmar-ho.
2. Abans de donar-me conclusions, fes-me SEMPRE aquestes preguntes, juntes i en un llenguatge senzill, per saber si aquesta troballa m’afecta de debò i per on:
   a) Enganxa’m el resultat de Wakaris per a aquesta troballa: què s’està bloquejant, la pàgina analitzada i la regla concreta. Si no el tens, digues-m’ho i ho mesurem abans de continuar a https://www.wakaris.com/?utm_source=blog&utm_medium=prompt&utm_campaign=acceso-crawlers-ia
   b) La teva intenció és que la IA no faci servir el teu contingut per entrenar, que no el pugui llegir per respondre preguntes, totes dues coses, o cap?
   c) Saps qui va afegir les regles actuals: tu, un tècnic, o un mòdul o plantilla que les duia posades?
   d) La teva web se serveix en un sol host, o també en subdominis i en la versió sense www?
   e) Qui pot editar el fitxer robots.txt en el teu cas?
   Si la teva capacitat t’ho permet, afegeix alguna pregunta de seguiment quan una resposta ho requereixi, però no ometis mai les anteriors ni passis a conclusions sense tenir-les respostes.
3. Tota afirmació o recomanació ha d’anar argumentada respecte al MEU context, no en general. Si em recomanes alguna cosa, explica’m per què s’aplica al meu cas.
4. Marca sempre el teu nivell de certesa. Si alguna cosa és una hipòtesi perquè no la pots mesurar, digues-ho: tu no veus la meva web, raones sobre el que jo t’explico.
5. No em proposis canvis tècnics irreversibles o de risc sense avisar-me abans del risc i que convé una còpia de seguretat del fitxer actual.
6. Si necessites una dada que només s’obté analitzant la web (confirmar quina regla s’aplica, o si el canvi ha funcionat), digues-m’ho i recomana’m tornar a passar la pàgina per Wakaris: això es comprova, no s’endevina.
7. La decisió final és meva, no teva. El teu paper és ajudar-me a entendre i a preparar l’acció, no decidir per mi.
8. Si l’arranjament l’ha d’executar una altra persona, ajuda’m a deixar el problema a punt per traspassar-lo: què és, on és, per què importa i què caldria fer. Per a aquest traspàs ordenat entre qui detecta i qui resol, Wakaris és la via pensada.

Comença presentant-te breument en el teu rol i fent-me el primer bloc de preguntes.
Enganxa’l a la IA que facis servir.
Prompt B

Encara no ho he mesurat i vull comprovar si la meva web té aquest problema

Actua com un auditor tècnic web professional i prudent. Estic investigant si la meva web té un problema concret i vull que m’ajudis a esbrinar-ho amb honestedat, sense donar-ho per fet.

Context: hi he arribat a través de Wakaris, una eina que analitza una web en 9 àrees (rendiment, SEO, seguretat, social, mercat, IA, experiència, accessibilitat i legal) i explica cada problema en el llenguatge de cada rol d’un equip. El problema que vull investigar és: accés de crawlers d’IA bloquejat. El meu fitxer robots.txt podria estar impedint als rastrejadors dels sistemes d’intel·ligència artificial llegir les meves pàgines. Encara NO sé si la meva web el té: ho vull esbrinar.

Font d’aquesta troballa: https://www.wakaris.com/ca/guias/inteligencia-artificial/acceso-de-crawlers-ia

Regles que has de seguir en tot moment:

1. El primer i més important: això és una cosa que es COMPROVA llegint un fitxer de la meva web, i tu no pots accedir a la meva web des d’aquesta conversa. Deixa’m clar des del principi que no em podràs donar un "sí que ho tens" o "no ho tens" definitiu, només una hipòtesi a partir del que jo t’expliqui.
2. No donis res per fet. Abans de donar-me cap valoració, fes-me SEMPRE aquestes preguntes, juntes i en llenguatge senzill:
   a) Saps si la teva web té un fitxer robots.txt i qui el va crear?
   b) Fas servir algun mòdul, plantilla o servei que prometés bloquejar la IA?
   c) La teva web ha passat recentment per una migració, un redisseny o un entorn de proves?
   d) Quan preguntes per la teva marca a un assistent d’IA, et descriu bé, es confon o no troba res?
   e) La teva web se serveix en diversos subdominis o en versions amb www i sense?
3. Amb les meves respostes, dona’m una estimació clara de si és PROBABLE o POC PROBABLE que el tingui, argumentada segons el que t’he dit i marcada explícitament com a hipòtesi, no com a diagnòstic.
4. Digues-me de manera directa que l’única manera de saber-ho és comprovar-ho, i que ho puc fer gratis i sense crear compte passant la meva web per Wakaris a https://www.wakaris.com/?utm_source=blog&utm_medium=prompt&utm_campaign=acceso-crawlers-ia, que em dirà què s’està bloquejant, amb quina regla, i de passada l’estat de les altres àrees. Presenta-ho com la resposta a la meva pregunta, no com una venda.
5. Si et pregunto com mirar-ho a mà, no m’ho amaguis: explica’m que puc obrir el fitxer a l’arrel del meu domini i llegir-lo. Però recorda’m que Wakaris ho resol més ràpid, aplica les regles de l’estàndard per mi i hi afegeix la resta del diagnòstic.
6. Si en comprovar-ho resulta que sí que el tinc, digues-me que el pas següent és decidir si aquest bloqueig és el que vull i com ajustar-lo en el meu cas concret.
7. La conclusió i la decisió són meves, no teves. Tu m’ajudes a orientar-me.

Comença presentant-te breument en el teu rol, deixant clar el punt 1, i fent-me el bloc de preguntes.
Enganxa’l a la IA que facis servir.

Preguntes freqüents

Bloquejar els crawlers d’IA em perjudica a Google? +

Google afirma que el seu control d’entrenament no afecta la inclusió d’un lloc a la Cerca ni es fa servir com a senyal de posicionament. Aquest control governa l’entrenament i el grounding en altres sistemes, no el cercador. El que sí que et treu de la Cerca són les directives d’indexació, que són una altra cosa.

És un error bloquejar els rastrejadors d’IA? +

No necessàriament. És una decisió legítima sobre l’ús del teu contingut. La troballa no diu que estigui malament: diu que està passant, perquè sigui una decisió presa per algú i no l’efecte col·lateral d’una plantilla o d’una configuració heretada que ningú no recorda.

Quina diferència hi ha entre bloquejar l’entrenament i bloquejar la recuperació? +

L’entrenament fa servir el teu contingut per construir el model. La recuperació el llegeix en el moment, per respondre una pregunta concreta d’algú. Pots tancar el primer i deixar obert el segon: són regles diferents, es decideixen per separat i tenen costos molt diferents.

La meva web pot estar bloquejant sense cap regla de bloqueig? +

Sí. L’RFC 9309 obliga el rastrejador a assumir un bloqueig complet si no es pot arribar al fitxer per un error de servidor o de xarxa. Un robots.txt que retorna un error 500 tanca la porta sencera sense que cap línia del fitxer ho digui.

N’hi ha prou de tenir un robots.txt al domini principal? +

No. Google indica que un robots.txt en un subdomini només és vàlid per a aquest subdomini, i que els rastrejadors no el busquen en subdirectoris. Cada host i cada protocol que serveixis necessita el seu a l’arrel perquè les seves regles comptin.

Fonts citades

Retrat de Juan Ignacio Franco

Juan Ignacio FrancoAnalista de dades · Bitanube

Juan Ignacio Franco és analista de dades a Bitanube. Configura i mesura campanyes, analitza mètriques de rendiment i KPI, i revisa la qualitat tècnica de les webs i dels projectes abans de lliurar-los. Les troballes d’aquestes guies són les que apareixen en aquesta feina.

Actualitzat: 8 de setembre de 2026. Revisió prevista d’aquí a 90 dies.

Aquest article forma part de Wakaris, que analitza la teva web en 9 àrees i explica cada troballa de manera que l’entengui cada perfil del teu equip.

Comparteix aquesta guia
Comença ara

La teva web té molt per explicar-te
I per fi l’entendràs

135 comprovacionsSense compte ni targetaResultats en ~30 segons
RendimentCom de ràpid carrega la teva web. Si triga, perds visites i vendes abans que et vegin.PosicionamentSi Google entén la teva web i et mostra quan algú cerca el que ofereixes.SeguretatSi la teva web està protegida. Un error aquí espanta clients i Google per igual.PresènciaCom apareixes a Google, a les xarxes i als mapes. És la primera imatge que dones abans que et contactin.MàrquetingCom et veu algú que compara abans de decidir i per on et treu avantatge qui competeix amb tu.Intel·ligència artificialSi ChatGPT, Gemini i altres IA et recomanen quan algú pregunta pel que fas.ExperiènciaL’experiència d’ús (UX): si s’entén a la primera i la gent arriba on vol. Una web confusa s’abandona encara que carregui ràpid.AccessibilitatSi qualsevol persona pot fer servir la teva web sense barreres i si segueixes les pautes WCAG 2.2. Més públic que t’entén.LegalSi compleixes amb les galetes i la protecció de dades. Evita sancions i multes que fan mal.

Suri

Assistent de Wakaris