Atualizado pela última vez em setembro de 2026.
Um mecanismo de IA não consegue citar uma página que nunca viu. Toda tática de GEO que vem depois, uma resposta direta logo no início, um schema bem-feito, uma data de atualização recente, depende de uma pré-condição que a maioria dos conselhos de GEO ignora: o crawler precisa entrar pela porta primeiro.
O pay-per-crawl é o mecanismo, criado pela Cloudflare e que agora se espalha pela camada de infraestrutura da web, que decide o que acontece nessa porta. Ele substitui o antigo binário de permitir ou bloquear por uma terceira opção: cobrar. E a partir de 15 de setembro de 2026, a resposta padrão para boa parte dos crawlers de IA muda de permitir para bloquear.
Por que o acesso de crawlers é o passo zero do GEO
Chame de passo zero. Não é o passo um, porque o passo um já assume que um crawler chegou até o seu conteúdo. É zero porque, se essa premissa falhar, nada mais no seu programa de GEO importa.
O GPTBot é o crawler de IA mais bloqueado há dois anos seguidos. A análise da Originality.AI de agosto de 2024, feita com os 1.000 maiores sites do mundo, encontrou 35,7% bloqueando o GPTBot via robots.txt, à frente do CCBot (22,1%), do Google-Extended (13,6%) e do ChatGPT-User (12,7%).
As barreiras de acesso também aparecem no tráfego de referência. Dados da Similarweb citados pela Modern Retail em setembro de 2025 mostraram que a Amazon recebeu menos de 3% do seu tráfego de referência vindo do ChatGPT, uma diferença que o relatório associou diretamente ao bloqueio deliberado de crawlers de IA pela Amazon. Walmart e Etsy, em contraste, tiveram mais de 20% dos seus cliques de referência vindos do ChatGPT no mesmo mês.
Bloqueie o crawler, e o seu share de citações para aquele mecanismo fica em zero, não importa o quão boa seja a página.
Como o pay-per-crawl funciona na prática
O modelo da Cloudflare se apoia em dois mecanismos: como um crawler se declara, e o que acontece quando ele solicita uma página.
Declaração de propósito do bot e crawlers de uso misto
A Cloudflare classifica o tráfego automatizado em três propósitos.
- Search. Indexa o conteúdo para responder perguntas sobre ele depois, o crawl tradicional de mecanismo de busca.
- Agent. Busca uma página específica em tempo real, em nome de uma pessoa que acabou de fazer uma pergunta.
- Training. Coleta conteúdo em massa para treinar ou fazer fine-tuning de um modelo.
Um crawler que se identifica claramente sob um único propósito é tratado pelas regras daquele propósito. Um crawler de uso misto, um único user agent que mistura buscas de search, agent e training sem separá-las, não recebe esse benefício. Publishers não conseguem definir regras diferentes para um bot que não conseguem diferenciar, então o tráfego misto e não declarado é tratado, por padrão, como a categoria mais restritiva.
Ser um “Verified Bot” da Cloudflare também não implica mais acesso. A verificação agora confirma identidade, não permissão. Só a categoria de propósito declarada e permitida garante entrada.
O fluxo de pagamento via HTTP 402
Assim que o propósito de um crawler é conhecido, a Cloudflare verifica a política do publisher para aquele bot e aquele propósito: liberar de graça, bloquear ou cobrar. A opção de cobrança roda sobre o HTTP 402 Payment Required, um código de status que ficou praticamente sem uso na especificação do HTTP por três décadas antes de a Cloudflare reaproveitá-lo.
STEP 1: Crawler requests a page
GET /article User-Agent: GPTBot
STEP 2: Cloudflare checks the publisher's per-bot policy
Blocked -> 403 Forbidden (no content, no citation, ever)
Free -> 200 OK (content served, no charge)
Priced -> 402 Payment Required (header: crawler-price: USD 0.02)
STEP 3: Crawler responds to the 402
Declines -> stops here, no content
Accepts -> retries with header: crawler-exact-price: USD 0.02
STEP 4: Cloudflare settles as merchant of record
Charges the crawler, credits the publisher, returns:
200 OK (header: crawler-charged: USD 0.02, content served)
A Cloudflare fica no meio em cada etapa: cobrando o crawler, creditando o publisher e registrando a transação. Nenhum dos lados precisa construir uma infraestrutura de pagamento personalizada.
O que muda em 15 de setembro de 2026
A data importa porque marca o momento em que os padrões da Cloudflare mudam, não apenas mais uma opção que um publisher pode ativar manualmente.
| Propósito do crawler | Antes de 15 de setembro de 2026 | Depois de 15 de setembro de 2026 (páginas monetizadas com anúncios) |
|---|---|---|
| Search | Permitido por padrão | Continua permitido por padrão |
| Agent | Permitido por padrão em domínios novos | Bloqueado por padrão, a menos que o publisher opte por liberá-lo |
| Training | Permitido por padrão em domínios novos | Bloqueado por padrão, a menos que o publisher opte por liberá-lo |
| Uso misto, propósito não declarado | Tratado como permitido | Bloqueado por padrão |
| Selo “Verified Bot” | Muitas vezes interpretado como acesso implícito | Não implica mais acesso por si só |
O padrão vale para domínios novos, sites novos em contas já existentes e clientes do plano gratuito. Clientes pagantes com uma configuração já definida mantêm o que já configuraram. O gatilho da página com anúncios é proposital: a Cloudflare trata um anúncio em uma página como um sinal de que aquela página foi feita para um visitante humano, o que justifica bloquear por padrão os crawlers de Agent e Training, enquanto deixa intactos os crawlers de Search, os que ainda mandam tráfego de volta.
A escala do problema, em números
Essa não é uma configuração de nicho escondida em uma aba avançada. A Cloudflare afirma que sua rede processa mais de 1 bilhão de respostas HTTP 402 para crawlers de IA em um dia médio (Cloudflare, 2026), e mais de 1 milhão de clientes da Cloudflare já ativaram controles de bloqueio de crawlers de IA (Cloudflare, 2025).
E a lacuna nem sempre é intencional. O relatório de 2026 da Otterly.AI, “The AI Citation Economy: What 1+ Million Data Points Reveal,” constatou que 73% dos sites carregam uma barreira técnica, uma regra herdada no robots.txt, um padrão de segurança do CDN, uma barreira de renderização em JavaScript, que bloqueia o acesso de crawlers de IA sem que o dono do site tenha escolhido isso de propósito.
Junte essas informações e o quadro fica claro: o acesso de crawlers virou, silenciosamente, uma política em nível de infraestrutura, não uma caixinha que você marca uma vez e esquece.
Checklist de autoauditoria antes do prazo
Percorra esta lista antes de 15 de setembro de 2026, esteja você na Cloudflare ou não.
- Confirme o seu plano da Cloudflare e o status do domínio: novo ou existente, pago ou gratuito. O bloqueio padrão vale de forma diferente para cada caso.
- Abra o AI Crawl Control no seu painel da Cloudflare e revise as configurações atuais de Search, Agent e Training para o seu domínio.
- Verifique o robots.txt em busca de regras de disallow contra GPTBot, PerplexityBot, ClaudeBot, Google-Extended e Amazonbot.
- Teste as suas páginas reais de produto e de artigo, não só a home, contra cada user agent de IA relevante.
- Decida, bot por bot, se você quer liberar de graça, bloquear ou definir um preço.
- Marque quais das suas páginas têm anúncios. Essas são as páginas que o padrão de 15 de setembro atinge primeiro.
- Teste de novo depois do prazo para confirmar que as configurações que você definiu realmente entraram em vigor.
Ferramentas que verificam se os crawlers de IA chegam até você
Ler logs brutos do servidor atrás de strings de user-agent funciona, mas não escala além de um punhado de páginas. Algumas ferramentas automatizam essa verificação.
O Agent Analytics da Profound mapeia quais bots acessam quais URLs, e com que frequência, cruzando com os seus próprios dados de tráfego, útil quando você precisa provar o acesso, ou a falta dele, para um time que reporta para a liderança. O Knowatoa roda uma verificação dedicada de acesso de crawlers contra os principais user agents de IA e sinaliza as regras de robots.txt e CDN que estão bloqueando silenciosamente, uma forma rápida de achar a lacuna antes de corrigi-la.
Se você prefere incluir essa verificação de acesso dentro de uma assinatura de GEO mais ampla, em vez de rodar uma ferramenta separada, o Temso inclui analytics de bots de IA como parte da sua plataforma tudo em um, a partir de $89/mês, junto com rastreamento de citações e execução de conteúdo.
A comparação completa das plataformas de GEO, incluindo como cada uma lida com verificações de acesso de crawlers, está em /rankings/geo-tools, com os critérios de pontuação por trás dela em /methodology. Definições de termos como share de citações estão em /glossary.
Perguntas frequentes
O que é pay-per-crawl?
Pay-per-crawl é um mecanismo, criado pela Cloudflare, que permite que um site cobre de um crawler de IA pelo acesso, em vez de apenas bloqueá-lo ou liberá-lo de graça. O publisher define um preço por bot, e cada requisição de crawler é atendida de graça, bloqueada ou respondida com um 402 Payment Required que carrega esse preço.
O que o código de status HTTP 402 faz aqui?
HTTP 402 Payment Required ficou praticamente sem uso na especificação do HTTP por décadas. A Cloudflare o reaproveitou: uma página com preço retorna 402 com um preço anexado, em vez de conteúdo, e o crawler pode repetir a requisição com uma confirmação de pagamento para receber um 200 OK e a página de verdade.
O que muda em 15 de setembro de 2026?
A Cloudflare define novas regras de acesso padrão para crawlers de IA nesse dia. Em páginas com anúncios, os crawlers de Training e Agent ficam bloqueados por padrão enquanto os crawlers de Search continuam permitidos, e crawlers de uso misto que não declaram um propósito também são tratados como bloqueados. O padrão vale para domínios novos, sites novos em contas já existentes e clientes do plano gratuito; clientes pagantes mantêm a configuração que já tinham.
O bloqueio padrão de 15 de setembro afeta o meu site já existente?
Só se você for um cliente novo da Cloudflare, adicionar um domínio novo ou rodar um site do plano gratuito com anúncios. Clientes pagantes já existentes da Cloudflare mantêm as configurações de crawler que já definiram. Verifique as suas configurações de AI Crawl Control antes do prazo, se você não tiver certeza de em qual grupo se encaixa.
Como eu verifico se os crawlers de IA conseguem realmente chegar ao meu site?
Teste o robots.txt contra os principais user agents de IA, revise as regras de CDN e WAF em busca de presets de bots de IA e verifique os logs do servidor para ver respostas bloqueadas versus atendidas em páginas reais de produto e artigo, não só na home. O Agent Analytics da Profound e as verificações de acesso de crawler da Knowatoa automatizam essa comparação.
Bloquear crawlers de IA ajuda ou atrapalha as minhas chances de ser citado?
Bloquear um crawler elimina qualquer chance de aquele mecanismo citar você. O relatório de 2026 da Otterly.AI constatou que 73% dos sites carregam uma barreira técnica, muitas vezes não intencional, que bloqueia o acesso de crawlers de IA. Acesso de crawl é uma pré-condição, não uma estratégia: liberar o crawler não garante uma citação, mas bloqueá-lo garante que você nunca vai ter uma.
Rode a autoauditoria acima antes de 15 de setembro de 2026. O acesso de crawl é binário: ou o bot chega até a sua página, ou não chega. Nenhuma quantidade de schema, nenhuma resposta direta logo no início e nenhum polimento de conteúdo conserta uma página que um mecanismo nunca viu. Veja como as plataformas de GEO lidam com o monitoramento de acesso de crawlers em /rankings/geo-tools.