Última actualización: septiembre de 2026.
Un motor de IA no puede citar una página que nunca vio. Cada táctica de GEO que viene después (una respuesta al inicio, un schema bien construido, una fecha de actualización reciente) depende de una condición previa que la mayoría de los consejos de GEO se saltan: el crawler tiene que entrar por la puerta primero.
El pay-per-crawl es el mecanismo, creado por Cloudflare y que ya se extiende por toda la capa de infraestructura de la web, que decide qué pasa en esa puerta. Sustituye el viejo binario de permitir o bloquear por una tercera opción: cobrar. Y a partir del 15 de septiembre de 2026, la respuesta por defecto para gran parte de los crawlers de IA pasa de permitir a bloquear.
Por qué el acceso del crawler es el paso cero del GEO
Llámalo el paso cero. No el paso uno, porque el paso uno da por hecho que un crawler ya llegó a tu contenido. Cero, porque si esa suposición falla, nada más en tu programa de GEO importa.
GPTBot lleva dos años seguidos siendo el crawler de IA más bloqueado. El análisis de agosto de 2024 de Originality.AI sobre los 1000 sitios web más importantes del mundo encontró que el 35,7% bloqueaba GPTBot en su robots.txt, por delante de CCBot (22,1%), Google-Extended (13,6%) y ChatGPT-User (12,7%).
Las barreras de acceso también se notan en el tráfico de referencia. Datos de Similarweb recogidos por Modern Retail en septiembre de 2025 mostraron que Amazon recibía menos del 3% de su tráfico de referencia desde ChatGPT, una brecha que el informe vinculó directamente al bloqueo deliberado de crawlers de IA por parte de Amazon. Walmart y Etsy, en cambio, obtuvieron cada uno más del 20% de sus clics de referencia desde ChatGPT ese mismo mes.
Bloquea el crawler y tu citation share para ese motor se queda en cero, sin importar lo buena que sea la página.
Cómo funciona realmente el pay-per-crawl
El modelo de Cloudflare se apoya en dos mecánicas: cómo se declara un crawler y qué pasa una vez que solicita una página.
Declaración de propósito del bot y crawlers de uso mixto
Cloudflare clasifica el tráfico automatizado en tres propósitos.
- Search. Indexa contenido para responder preguntas sobre él más adelante, el rastreo tradicional de los motores de búsqueda.
- Agent. Recupera una página concreta en tiempo real, en nombre de una persona que acaba de hacer una pregunta.
- Training. Recolecta contenido a gran escala para entrenar o afinar un modelo.
Un crawler que se identifica con claridad bajo un solo propósito se rige por las reglas de ese propósito. Un crawler de uso mixto (un único user agent que mezcla solicitudes de search, agent y training sin separarlas) no recibe ese beneficio. Los publishers no pueden fijar reglas distintas para un bot que no pueden distinguir, así que el tráfico sin declarar y de uso mixto se trata por defecto como la categoría más restrictiva.
Ser un “Verified Bot” de Cloudflare tampoco implica acceso ya. La verificación ahora confirma identidad, no permiso. Solo la categoría de propósito declarada y permitida da acceso.
El flujo de pago con HTTP 402
Una vez que se conoce el propósito de un crawler, Cloudflare revisa la política del publisher para ese bot y ese propósito: permitirlo gratis, bloquearlo o cobrarle. La opción de cobro funciona sobre HTTP 402 Payment Required, un código de estado que llevaba tres décadas casi sin usarse en la especificación HTTP antes de que Cloudflare le diera un nuevo uso.
PASO 1: El crawler solicita una página
GET /article User-Agent: GPTBot
PASO 2: Cloudflare revisa la política del publisher para ese bot
Bloqueado -> 403 Forbidden (sin contenido, sin cita, nunca)
Gratis -> 200 OK (contenido servido, sin cargo)
Con precio -> 402 Payment Required (header: crawler-price: EUR 0.02)
PASO 3: El crawler responde al 402
Rechaza -> se detiene aquí, sin contenido
Acepta -> reintenta con header: crawler-exact-price: EUR 0.02
PASO 4: Cloudflare liquida como merchant of record
Cobra al crawler, acredita al publisher y devuelve:
200 OK (header: crawler-charged: EUR 0.02, contenido servido)
Cloudflare se sitúa en el medio en cada paso: factura al crawler, acredita al publisher y registra la transacción. Ninguna de las dos partes tiene que construir infraestructura de pago a medida.
Qué cambia el 15 de septiembre de 2026
La fecha importa porque marca el momento en que cambian los valores por defecto de Cloudflare, no solo una opción que un publisher puede activar manualmente.
| Propósito del crawler | Antes del 15 de septiembre de 2026 | Después del 15 de septiembre de 2026 (páginas monetizadas con anuncios) |
|---|---|---|
| Search | Permitido por defecto | Sigue permitido por defecto |
| Agent | Permitido por defecto en dominios nuevos | Bloqueado por defecto salvo que el publisher lo autorice |
| Training | Permitido por defecto en dominios nuevos | Bloqueado por defecto salvo que el publisher lo autorice |
| Uso mixto, propósito sin declarar | Tratado como permitido | Bloqueado por defecto |
| Insignia “Verified Bot” | A menudo se interpretaba como acceso implícito | Ya no implica acceso por sí sola |
El valor por defecto se aplica a dominios nuevos, sitios nuevos en cuentas existentes y clientes del plan gratuito. Los clientes de pago con una configuración ya existente la mantienen. El disparador de la página con anuncios es deliberado: Cloudflare interpreta un anuncio en una página como una señal de que esa página se construyó para un visitante humano, lo que justifica restringir por defecto los crawlers de Agent y Training, mientras deja intactos los de Search, los que todavía envían tráfico de vuelta.
La magnitud del problema, en cifras
Esto no es un ajuste secundario escondido en una pestaña avanzada. Cloudflare afirma que su red gestiona más de 1000 millones de respuestas HTTP 402 a crawlers de IA en un día promedio (Cloudflare, 2026), y que más de 1 millón de clientes de Cloudflare ya activaron controles de bloqueo de crawlers de IA (Cloudflare, 2025).
Y la brecha no siempre es intencionada. El informe de 2026 de Otterly.AI, “The AI Citation Economy: What 1+ Million Data Points Reveal,” descubrió que el 73% de los sitios tiene una barrera técnica (una regla heredada en el robots.txt, un valor de seguridad por defecto del CDN, un muro de renderizado en JavaScript) que bloquea el acceso de los crawlers de IA sin que el propietario del sitio lo decidiera a propósito.
Súmalo todo y el panorama queda claro: el acceso del crawler se ha convertido, en silencio, en una política a nivel de infraestructura, no en una casilla que marcas una vez y olvidas.
Lista de autoauditoría antes de la fecha límite
Repasa esta lista antes del 15 de septiembre de 2026, uses o no Cloudflare.
- Confirma tu plan de Cloudflare y el estado de tu dominio: nuevo o existente, de pago o gratuito. El bloqueo por defecto se aplica de forma distinta a cada caso.
- Abre AI Crawl Control en tu dashboard de Cloudflare y revisa la configuración actual de Search, Agent y Training para tu dominio.
- Revisa tu robots.txt en busca de reglas disallow contra GPTBot, PerplexityBot, ClaudeBot, Google-Extended y Amazonbot.
- Prueba tus páginas reales de producto y de artículos, no solo tu home, contra cada user agent de IA importante.
- Decide, bot por bot, si quieres permitirlo gratis, bloquearlo o fijarle un precio.
- Marca cuáles de tus páginas llevan anuncios. Esas son las páginas que el valor por defecto del 15 de septiembre afecta primero.
- Vuelve a probar después de la fecha límite para confirmar que la configuración que querías realmente se aplicó.
Herramientas que comprueban si los crawlers de IA llegan a tu sitio
Leer los logs del servidor en bruto en busca de cadenas de user agent funciona, pero no escala más allá de un puñado de páginas. Algunas herramientas automatizan esta comprobación.
Agent Analytics de Profound mapea qué bots visitan qué URLs, y con qué frecuencia, contra tus propios datos de tráfico, útil cuando necesitas demostrarle a un equipo que reporta a dirección que tienes acceso, o que no lo tienes. Knowatoa ejecuta una comprobación de acceso de crawlers específica contra los principales user agents de IA y señala las reglas de robots.txt y del CDN que los bloquean en silencio, una forma rápida de encontrar el hueco antes de solucionarlo.
Si prefieres integrar esa comprobación de acceso en una suscripción de GEO más amplia en lugar de usar una herramienta aparte, Temso incluye analítica de bots de IA como parte de su plataforma todo en uno, desde 89 €/mes, junto con seguimiento de citas y ejecución de contenido.
La comparación completa de plataformas de GEO, incluyendo cómo gestiona cada una las comprobaciones de acceso de crawlers, está en /rankings/geo-tools, con los criterios de puntuación detrás en /methodology. Las definiciones de términos como citation share están en /glossary.
Preguntas frecuentes
¿Qué es el pay-per-crawl?
El pay-per-crawl es un mecanismo, creado por Cloudflare, que permite que un sitio web cobre a un crawler de IA por el acceso, en lugar de solo bloquearlo o dejarlo pasar gratis. El publisher fija un precio por bot, y cada solicitud de un crawler recibe contenido gratis, un bloqueo o una respuesta 402 Payment Required con ese precio.
¿Qué función cumple aquí el código de estado HTTP 402?
HTTP 402 Payment Required llevaba décadas casi sin usarse en la especificación HTTP. Cloudflare le dio un nuevo uso: una página con precio devuelve un 402 con un precio adjunto en lugar de contenido, y el crawler puede reintentar con una confirmación de pago para recibir un 200 OK y la página real.
¿Qué cambia el 15 de septiembre de 2026?
Ese día, Cloudflare establece nuevas reglas de acceso por defecto para los crawlers de IA. En las páginas con anuncios, los crawlers de Training y Agent quedan bloqueados por defecto mientras que los de Search siguen permitidos, y los crawlers de uso mixto que no declaran un propósito también se tratan como bloqueados. El valor por defecto se aplica a dominios nuevos, sitios nuevos en cuentas existentes y clientes del plan gratuito; los clientes de pago mantienen su configuración existente.
¿El bloqueo por defecto del 15 de septiembre afecta a mi sitio actual?
Solo si eres un cliente nuevo de Cloudflare, añades un dominio nuevo o gestionas un sitio del plan gratuito con anuncios. Los clientes de pago existentes de Cloudflare mantienen la configuración de crawlers que ya tenían. Revisa tu configuración de AI Crawl Control antes de la fecha límite si no tienes claro en qué grupo estás.
¿Cómo compruebo si los crawlers de IA realmente llegan a mi sitio?
Prueba tu robots.txt contra los principales user agents de IA, revisa las reglas de CDN y WAF en busca de preajustes de bots de IA, y comprueba en los logs del servidor las respuestas bloqueadas frente a las servidas en páginas reales de producto y de artículos, no solo en la home. Agent Analytics de Profound y las comprobaciones de acceso de crawlers de Knowatoa automatizan esa comparación.
¿Bloquear los crawlers de IA ayuda o perjudica tus posibilidades de que te citen?
Bloquear un crawler elimina cualquier posibilidad de que ese motor te cite alguna vez. El informe de 2026 de Otterly.AI encontró que el 73% de los sitios tiene una barrera técnica, a menudo involuntaria, que bloquea el acceso de los crawlers de IA. El acceso del crawler es una condición previa, no una estrategia: permitir el crawler no garantiza una cita, pero bloquearlo garantiza que nunca la consigas.
Haz la autoauditoría de arriba antes del 15 de septiembre de 2026. El acceso del crawler es binario: o el bot llega a tu página, o no llega. Ningún schema, ninguna respuesta al inicio y ningún pulido de contenido arregla una página que un motor nunca vio. Descubre cómo gestionan las plataformas de GEO el monitoreo de acceso de crawlers en /rankings/geo-tools.