GEO Rankings
← Blog
Publicado

Cloudflare empieza a bloquear crawlers de IA de uso mixto el 15 de septiembre: la checklist de 14 puntos para mantener tu sitio citable

Cloudflare bloquea por defecto los crawlers de IA Agent y Training desde el 15 de septiembre de 2026. Ejecuta esta checklist de 14 puntos para confirmar que tu sitio sigue siendo accesible.

En resumen

Cloudflare bloquea por defecto los crawlers de IA Agent y Training en páginas monetizadas con publicidad a partir del 15 de septiembre de 2026, y bloquea por completo a los bots de uso mixto como Googlebot en cuanto bloqueas Training. Otterly.AI ya encontró que el 73 % de los sitios tiene una barrera técnica contra los crawlers de IA. Ejecuta la checklist de 14 puntos de abajo para confirmar que el tuyo no es uno de ellos.

Última actualización: septiembre de 2026. Esta checklist refleja la política publicada por Cloudflare a fecha del 15 de septiembre de 2026, el día en que entran en vigor los nuevos valores por defecto de AI Crawl Control.

La mayoría de los propietarios de sitios cree que una línea en robots.txt resuelve la cuestión del acceso de los crawlers de IA. No es así. Tu CDN aplica sus propias reglas de bots por encima de ese archivo, y las reglas de Cloudflare acaban de cambiar de una forma que puede cortar en silencio a crawlers con los que contabas.

El 15 de septiembre de 2026, Cloudflare dividió su antiguo interruptor único para bots de IA en tres categorías con nombre propio: Search, Agent y Training. Los clientes nuevos, los sitios nuevos en cuentas ya existentes y todas las cuentas del nivel gratuito ahora bloquean por defecto los crawlers Agent y Training en cualquier página que lleve una unidad publicitaria. Los bots que combinan más de una categoría, incluidos Googlebot, Applebot y Bingbot, heredan la regla más estricta que hayas configurado, así que bloquear Training puede tumbar a un crawler que creías tener permitido.

Nada de esto es hipotético. El análisis de Otterly.AI sobre más de un millón de citas de IA encontró que el 73 % de los sitios ya tiene una barrera técnica, un bloqueo en robots.txt, una regla de CDN o un hueco de renderizado en JavaScript, que deja fuera a los crawlers de IA antes de que una página pueda siquiera competir por citation share. Las 14 comprobaciones de abajo convierten ese riesgo en algo que puedes verificar en minutos, no algo que tienes que suponer.


Qué cambia el 15 de septiembre de 2026

Cloudflare ahora clasifica a cada crawler de IA por lo que hace en tu sitio, no solo por su nombre:

  • Search: rastrea e indexa contenido para responder preguntas sobre él más adelante.
  • Agent: obtiene una página en tiempo real porque una persona se lo pidió a su asistente de IA.
  • Training: recopila contenido para entrenar o afinar un modelo.

Un crawler que hace más de una de estas cosas, lo que Cloudflare llama un crawler de uso mixto, hereda tu regla más estricta en cada categoría a la que pertenece. Bloquea Training en cualquier parte del sitio, y un bot de uso mixto como Googlebot queda bloqueado en todas partes, incluido el comportamiento de Search que querías conservar.

ConfiguraciónAntes del 15 de septiembre de 2026Después del 15 de septiembre de 2026
Crawlers Search en páginas monetizadasPermitidosSiguen permitidos
Crawlers Agent en páginas monetizadasPermitidos por defectoBloqueados por defecto
Crawlers Training en páginas monetizadasPermitidos salvo bloqueo manualBloqueados por defecto
Crawlers de uso mixto (Googlebot, Applebot, Bingbot)Tratados solo como SearchBloqueados por completo si bloqueas Training
Cuentas afectadas automáticamenteNingunaClientes nuevos, sitios nuevos, cuentas existentes del nivel gratuito
Cuentas de pago existentesN/DConservan su configuración actual salvo que se sumen de forma voluntaria

Si todos los sitios de tu cuenta de Cloudflare son anteriores al 15 de septiembre y estás en un plan de pago, nada cambia sin que actúes. Pero un sitio nuevo añadido a esa misma cuenta, o cualquier cliente que funcione en el nivel gratuito, hereda los nuevos bloqueos en cuanto se publica. Revisa cada propiedad que gestionas, no solo el dominio principal.


La checklist de acceso de 14 puntos

Cada comprobación de abajo empareja una afirmación sobre cómo se rompe realmente el acceso de los crawlers de IA con un comando que puedes ejecutar contra tu propio dominio ahora mismo. Sustituye yoursite.com por tu dominio real y, donde una comprobación nombre bots concretos, sustitúyelos por los que importen en tu combinación de motores.

1. Confirma la configuración de niveles de tu AI Crawl Control

Afirmación: los interruptores de Search, Agent y Training de tu cuenta deciden el resultado antes de que ningún bot llegue a tu servidor. Una configuración que nunca tocaste puede seguir bloqueando tráfico.

Verifica: en el panel de Cloudflare, abre Security > Bots > AI Crawl Control en cada zona y lee el estado junto a Search, Agent y Training. La configuración es por sitio, no por cuenta, así que repite esto para cada propiedad.

2. Obtén tu robots.txt en vivo para ver las reglas de bots de IA

Afirmación: robots.txt solo detiene a los crawlers que eligen obedecerlo, pero una línea Disallow para GPTBot, ClaudeBot o PerplexityBot sigue siendo lo primero que comprueban la mayoría de los motores.

Verifica:

curl -s https://yoursite.com/robots.txt | grep -iE "gptbot|claudebot|perplexitybot|google-extended|ccbot|bytespider"

Cualquier coincidencia te dice exactamente qué bots de Training tienen Disallow en algún lugar del sitio.

3. Prueba con curl cada bot de Training directamente

Afirmación: los crawlers de Training (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider) alimentan el entrenamiento de modelos, no respuestas en vivo. Averigua si el nuevo valor por defecto de Cloudflare los bloqueó en silencio antes de asumir que lo hizo.

Verifica:

for ua in GPTBot ClaudeBot Google-Extended CCBot Bytespider; do
  echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done

Un 403 o un 429 significa que ese bot está bloqueado en el borde, diga lo que diga tu robots.txt.

4. Prueba con curl cada bot Agent directamente

Afirmación: los bots Agent (ChatGPT-User, Perplexity-User, Claude-User) obtienen una página porque una persona le hizo a su asistente una pregunta en vivo ahora mismo. Perder este nivel te cuesta la respuesta, no solo datos de entrenamiento futuros.

Verifica:

for ua in "ChatGPT-User" "Perplexity-User" "Claude-User"; do
  echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done

5. Prueba con curl los bots Search de uso mixto

Afirmación: Googlebot, Applebot y Bingbot combinan comportamiento de Search y de Training bajo las nuevas reglas de Cloudflare. Bloquea Training en cualquier parte, y estos tres heredan ese bloqueo en todas partes.

Verifica:

for ua in Googlebot Applebot Bingbot; do
  echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done

Un 403 aquí es el fallo más costoso de esta checklist: te cuesta búsqueda orgánica, no solo citas de IA.

6. Comprueba si una página lleva la señal publicitaria que activa el nuevo valor por defecto

Afirmación: el bloqueo de Agent y Training solo se activa por defecto en páginas que Cloudflare lee como monetizadas con publicidad. Una página sin script publicitario conserva el comportamiento anterior, más permisivo.

Verifica:

curl -s https://yoursite.com/ | grep -iE "adsbygoogle|doubleclick|googlesyndication|ad-slot"

Una coincidencia significa que debes tratar esta página como cubierta por el nuevo valor por defecto, y confirmar que la configuración de la comprobación 1 se le aplica.

7. Descarta que un Bot Fight Mode heredado anule la nueva configuración

Afirmación: Bot Fight Mode y Super Bot Fight Mode son anteriores a AI Crawl Control y todavía pueden desafiar o bloquear a un crawler aunque tu interruptor específico de IA marque “permitir”.

Verifica: en Security > Bots, confirma que Bot Fight Mode está desactivado, o que los user agents de crawlers de IA están en su lista de permitidos. No hay una prueba con curl fiable aquí: a un bot desafiado se le devuelve un estado 200 con una página de desafío en JavaScript en lugar de un 403 limpio, así que el bloqueo se esconde a plena vista.

8. Audita las reglas WAF personalizadas en busca de bloqueos accidentales de crawlers

Afirmación: una regla de firewall escrita para detener scrapers, “bloquear peticiones sin cabecera Referer” o “bloquear tráfico del ASN X”, suele atrapar también a los crawlers de IA, ya que rara vez envían un Referer y pasan por un puñado de ASN de centros de datos.

Verifica: en Security > WAF > Custom rules, lee las condiciones de coincidencia de cada regla contra los user agents de las comprobaciones 3 a 5. Cualquier regla que coincida por una cabecera ausente, un ASN o un país merece una segunda mirada.

9. Comprueba si el límite de tasa reduce los crawlers casi a cero

Afirmación: un límite de tasa ajustado para tráfico humano puede limitar a un crawler a una petición cada varios minutos. Tu panel sigue mostrando “permitido”, pero el crawler experimenta el sitio como inalcanzable.

Verifica:

for i in 1 2 3 4 5; do
  curl -s -A "GPTBot" -o /dev/null -w "%{http_code} " https://yoursite.com/
done; echo

Si las peticiones posteriores devuelven 429 mientras la primera devuelve 200, el bloqueo real es un límite de tasa, no tu interruptor de AI Crawl Control.

10. Confirma que las páginas clave no esconden contenido tras renderizado en el cliente

Afirmación: la mayoría de los crawlers de IA obtienen el HTML en bruto y no ejecutan JavaScript como lo hace un navegador. Una página que renderiza su respuesta solo después de que se ejecute un script permanece invisible para ellos, sin importar la configuración de bots.

Verifica:

curl -s https://yoursite.com/your-key-page | grep -c "<p"

Compara ese número con lo que ves en la página renderizada de un navegador. Una diferencia grande significa que el contenido carga en el cliente y los crawlers ven un contenedor vacío.

11. Aplica grep a tus logs de servidor para ver qué pasó de verdad

Afirmación: los interruptores del panel describen la intención. Tus logs describen los resultados, incluidos los bots servidos a través de una capa de proxy que no es Cloudflare en absoluto.

Verifica:

grep -E "GPTBot|ClaudeBot|PerplexityBot|Google-Extended|ChatGPT-User|Perplexity-User" access.log | awk '{print $9}' | sort | uniq -c

Esto cuenta los códigos de estado que cada bot recibió de verdad. Un grupo de 403 o 429 confirma un bloqueo que tu revisión de configuración pasó por alto.

12. Comprueba las reglas de Managed Challenge y CAPTCHA para los user agents de IA

Afirmación: un Managed Challenge devuelve HTTP 200 con una página que un humano puede resolver con un clic. Un crawler no puede. Nunca aparece como un bloqueo, así que es el fallo más fácil de pasar por alto de esta lista.

Verifica: en Security > WAF, filtra el registro de eventos de tu firewall por los user agents de las comprobaciones 3 a 5 y lee la columna Action. “Managed Challenge” o “JS Challenge” frente a un crawler de IA es un bloqueo silencioso, aunque el estado HTTP parezca limpio.

13. Compara llms.txt con robots.txt en busca de contradicciones

Afirmación: un archivo llms.txt publicado debería apuntar a las mismas páginas que robots.txt permite. Un llms.txt curado que enumera páginas que robots.txt prohíbe envía a los crawlers de IA hacia una URL que también les dice que se salten.

Verifica:

curl -s https://yoursite.com/llms.txt
curl -s https://yoursite.com/robots.txt

Lee ambos uno junto al otro. Cada URL en llms.txt debería resolverse sin una regla Disallow correspondiente en robots.txt.

14. Pon esta checklist en un calendario recurrente

Afirmación: los valores por defecto, los nombres de bots y las reglas de categorías de Cloudflare seguirán cambiando después del 15 de septiembre. Una comprobación que ejecutaste una vez no te dice nada sobre el mes que viene.

Verifica: guarda las comprobaciones 2 a 11 como un script y ejecútalo cada mes, o después de cualquier cambio de CDN, WAF o hosting. Una herramienta dedicada al acceso de crawlers puede ejecutar esto de forma automática y avisarte en el momento en que cambie un código de estado.


Herramientas que automatizan estas comprobaciones

Ejecutar las 14 comprobaciones a mano una vez es razonable. Ejecutarlas cada mes, en cada propiedad que gestionas, no lo es.

Profound combina el acceso de nivel Agent con el seguimiento de citas, lo que encaja directamente con las comprobaciones 4 y 5: te muestra no solo si ChatGPT-User o Perplexity-User pueden llegar a una página, sino si ese acceso se está convirtiendo en una mención real.

Knowatoa ejecuta las comprobaciones de acceso de crawlers como un flujo empaquetado: análisis de robots.txt, pruebas de accesibilidad por bot y avisos cuando cambia un código de estado, lo que cubre la mayor parte de las comprobaciones 2 a 11 sin necesidad de un script manual.

Otterly.AI, la fuente de la cifra del 73 % de barreras técnicas de arriba, integra una auditoría de rastreabilidad dentro de su monitoreo GEO más amplio, junto al seguimiento de citas en ChatGPT, Perplexity y Google AI Overviews.

Si quieres una sola suscripción que cubra el monitoreo de acceso de crawlers junto al seguimiento de citas y la ejecución de contenido, Temso es la opción todo en uno más sencilla, desde 89 €/mes, con proyectos, usuarios y recomendaciones ilimitados en todos los planes.

La comparativa completa de plataformas GEO está en /rankings/geo-tools. Para saber cómo probamos las señales de acceso de crawlers en cada plataforma que analizamos, consulta /methodology.

FAQ

¿Cómo compruebo si mi sitio bloquea a los crawlers de IA?

Ejecuta cuatro comprobaciones juntas: obtén tu robots.txt en vivo para ver las reglas Disallow de bots de IA, haz curl a tu sitio con el user agent de cada bot (GPTBot, ClaudeBot, PerplexityBot, ChatGPT-User, Googlebot) y lee el código de estado, aplica grep a tus logs de servidor para ver los códigos que esos bots recibieron de verdad, y revisa la configuración de gestión de bots de tu CDN, porque una regla de firewall o un límite de tasa puede bloquear a un crawler que robots.txt permite.

¿Qué cambió en la política de crawlers de IA de Cloudflare el 15 de septiembre de 2026?

Cloudflare sustituyó su antiguo interruptor único para bots de IA por tres categorías: Search, Agent y Training. En esa fecha, los clientes nuevos, los sitios nuevos y las cuentas existentes del nivel gratuito empezaron a bloquear por defecto los crawlers Agent y Training en cualquier página que lleve una unidad publicitaria, mientras que los crawlers Search siguieron permitidos.

¿Qué pasa con Googlebot, Applebot y Bingbot bajo las nuevas reglas?

Cloudflare los trata como crawlers de uso mixto que combinan comportamiento de Search y de Training. Si bloqueas Training en cualquier parte de tu sitio, estos tres bots quedan bloqueados por completo, aunque nunca hayas tocado tu configuración de Search, y aunque bloquearlos pueda costarte la indexación normal de Google.

¿Un robots.txt limpio basta para garantizar el acceso de los crawlers de IA?

No. robots.txt es una petición, no una capa de aplicación forzosa, y solo los bots bien portados lo leen siquiera. Las reglas de gestión de bots de tu CDN, las reglas personalizadas de WAF, los límites de tasa y la configuración de Managed Challenge están todos por encima de robots.txt y pueden bloquear a un crawler que ese archivo permite de forma explícita.

¿Cuántos sitios ya bloquean a los crawlers de IA sin querer?

Según el análisis de Otterly.AI sobre más de un millón de citas de IA, el 73 % de los sitios tiene una barrera técnica (un bloqueo en robots.txt, una regla de CDN o un hueco de renderizado en JavaScript) que impide que los crawlers de IA lleguen a su contenido.

¿Qué herramientas ayudan a verificar el acceso de los crawlers de IA de forma continua?

Knowatoa ejecuta pruebas de accesibilidad por bot y avisa cuando cambian los códigos de estado. Profound combina el acceso de nivel Agent con el seguimiento de citas, para que veas si una página accesible se está convirtiendo en una mención real. La GEO Audit de Otterly.AI comprueba la rastreabilidad junto a su propio monitoreo de citas en ChatGPT, Perplexity y Google AI Overviews.