GEO Rankings
← Blog
Publicado

O Cloudflare começa a bloquear crawlers de IA de uso misto em 15 de setembro: o checklist de 14 pontos para manter seu site citável

O Cloudflare bloqueia por padrão os crawlers de IA das categorias Agent e Training a partir de 15 de setembro de 2026. Rode este checklist de 14 pontos para confirmar que seu site continua acessível.

Resumo

A partir de 15 de setembro de 2026, o Cloudflare bloqueia por padrão os crawlers de IA das categorias Agent e Training em páginas monetizadas por anúncios, e bloqueia totalmente bots de uso misto como o Googlebot assim que você bloqueia a categoria Training. A Otterly.AI já constatou que 73% dos sites carregam alguma barreira técnica contra crawlers de IA. Rode o checklist de 14 pontos abaixo para confirmar que o seu não é um deles.

Atualizado em setembro de 2026. Este checklist reflete a política publicada pelo Cloudflare em 15 de setembro de 2026, data em que os novos padrões do AI Crawl Control entram em vigor.

A maioria dos donos de site acha que uma linha no robots.txt resolve a questão do acesso de crawlers de IA. Não resolve. O seu CDN aplica as próprias regras de bots acima desse arquivo, e as regras do Cloudflare acabaram de mudar de um jeito que pode cortar, sem aviso, crawlers com os quais você contava.

Em 15 de setembro de 2026, o Cloudflare dividiu o antigo interruptor único para bots de IA em três categorias nomeadas: Search, Agent e Training. Novos clientes, novos sites em contas existentes e todas as contas do plano gratuito agora bloqueiam por padrão os crawlers Agent e Training em qualquer página que carregue uma unidade de anúncio. Bots que combinam mais de uma categoria, incluindo Googlebot, Applebot e Bingbot, herdam a regra mais restritiva que você configurar, então bloquear a categoria Training pode derrubar um crawler que você achava ter permitido.

Nada disso é hipotético. A análise da Otterly.AI de mais de um milhão de citações de IA constatou que 73% dos sites já carregam uma barreira técnica, seja um bloqueio no robots.txt, uma regra de CDN ou uma lacuna de renderização em JavaScript, que impede os crawlers de IA de entrar antes mesmo de a página competir por share de citações. As 14 verificações abaixo transformam esse risco em algo que você pode confirmar em minutos, não em algo para adivinhar.


O que muda em 15 de setembro de 2026

Agora, o Cloudflare classifica cada crawler de IA pelo que ele faz no seu site, não só pelo nome:

  • Search: rastreia e indexa o conteúdo para responder perguntas sobre ele depois.
  • Agent: busca uma página em tempo real porque uma pessoa pediu isso ao seu assistente de IA.
  • Training: coleta conteúdo para treinar ou ajustar um modelo.

Um crawler que faz mais de uma dessas coisas, o Cloudflare chama de crawler de uso misto, herda a sua regra mais restritiva em todas as categorias às quais pertence. Bloqueie a categoria Training em qualquer lugar do site, e um bot de uso misto como o Googlebot fica bloqueado em tudo, inclusive no comportamento Search que você queria manter.

ConfiguraçãoAntes de 15 de setembro de 2026Depois de 15 de setembro de 2026
Crawlers Search em páginas monetizadas por anúnciosPermitidoContinua permitido
Crawlers Agent em páginas monetizadas por anúnciosPermitido por padrãoBloqueado por padrão
Crawlers Training em páginas monetizadas por anúnciosPermitido, a menos que bloqueado manualmenteBloqueado por padrão
Crawlers de uso misto (Googlebot, Applebot, Bingbot)Tratado só como SearchTotalmente bloqueado se você bloquear a categoria Training
Contas afetadas automaticamenteNenhumaNovos clientes, novos sites, contas existentes do plano gratuito
Contas pagas existentesN/AMantêm as configurações atuais, a menos que você opte por ativar

Se todos os sites da sua conta do Cloudflare são anteriores a 15 de setembro e você está em um plano pago, nada muda sem uma ação sua. Mas um novo site adicionado a essa mesma conta, ou qualquer cliente rodando no plano gratuito, herda os novos bloqueios assim que entra no ar. Verifique todas as propriedades que você gerencia, não só o domínio principal.


O checklist de 14 pontos de acesso

Cada verificação abaixo combina uma afirmação sobre como o acesso de crawlers de IA realmente quebra com um comando que você pode rodar no seu próprio domínio agora mesmo. Troque yoursite.com pelo seu domínio real e, onde uma verificação citar bots específicos, troque pelos que importam para o seu mix de motores.

1. Confirme as configurações de nível do AI Crawl Control

Afirmação: os interruptores de Search, Agent e Training da sua conta decidem o resultado antes de qualquer bot chegar ao seu servidor. Uma configuração que você nunca tocou ainda pode estar bloqueando tráfego.

Verifique: no painel do Cloudflare, abra Security > Bots > AI Crawl Control em cada zona e leia o status ao lado de Search, Agent e Training. A configuração é por site, não por conta, então repita isso para cada propriedade.

2. Busque o seu robots.txt ao vivo em busca de regras para bots de IA

Afirmação: o robots.txt só impede crawlers que escolhem obedecê-lo, mas uma linha Disallow para GPTBot, ClaudeBot ou PerplexityBot ainda é a primeira coisa que a maioria dos motores verifica.

Verifique:

curl -s https://yoursite.com/robots.txt | grep -iE "gptbot|claudebot|perplexitybot|google-extended|ccbot|bytespider"

Qualquer correspondência mostra exatamente quais bots Training estão bloqueados em algum lugar do site.

3. Teste cada bot Training diretamente com curl

Afirmação: os crawlers Training (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider) alimentam o treinamento de modelos, não respostas em tempo real. Saiba se o novo padrão do Cloudflare os bloqueou silenciosamente antes de presumir que sim.

Verifique:

for ua in GPTBot ClaudeBot Google-Extended CCBot Bytespider; do
  echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done

Um 403 ou 429 significa que esse bot está bloqueado na borda, seja lá o que o seu robots.txt diga.

4. Teste cada bot Agent diretamente com curl

Afirmação: os bots Agent (ChatGPT-User, Perplexity-User, Claude-User) buscam uma página porque uma pessoa fez uma pergunta em tempo real ao seu assistente agora mesmo. Perder esse nível custa a resposta em si, não só dados de treinamento futuros.

Verifique:

for ua in "ChatGPT-User" "Perplexity-User" "Claude-User"; do
  echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done

5. Teste os bots Search de uso misto com curl

Afirmação: sob as novas regras do Cloudflare, o Googlebot, o Applebot e o Bingbot carregam tanto o comportamento Search quanto o Training. Bloqueie a categoria Training em qualquer lugar, e esses três herdam esse bloqueio em tudo.

Verifique:

for ua in Googlebot Applebot Bingbot; do
  echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done

Um 403 aqui é a falha mais cara deste checklist: ela custa a sua busca orgânica, não só as citações de IA.

6. Verifique se uma página carrega o sinal de anúncio que ativa o novo padrão

Afirmação: o bloqueio de Agent e Training só é ativado por padrão em páginas que o Cloudflare lê como monetizadas por anúncios. Uma página sem script de anúncio mantém o comportamento antigo, mais permissivo.

Verifique:

curl -s https://yoursite.com/ | grep -iE "adsbygoogle|doubleclick|googlesyndication|ad-slot"

Uma correspondência significa que você deve tratar essa página como coberta pelo novo padrão, e confirmar que as configurações da verificação 1 se aplicam a ela.

7. Descarte o Bot Fight Mode legado sobrepondo as novas configurações

Afirmação: o Bot Fight Mode e o Super Bot Fight Mode são anteriores ao AI Crawl Control e ainda podem desafiar ou bloquear um crawler mesmo quando o seu interruptor específico de IA está em “permitir”.

Verifique: em Security > Bots, confirme que o Bot Fight Mode está desativado, ou que os user agents dos crawlers de IA estão na lista de permissões dele. Não existe um teste confiável com curl aqui: um bot desafiado recebe um status 200 com uma página de desafio em JavaScript em vez de um 403 limpo, então o bloqueio fica escondido à vista de todos.

8. Audite regras personalizadas do WAF em busca de bloqueios acidentais de crawlers

Afirmação: uma regra de firewall escrita para barrar scrapers, “bloquear requisições sem cabeçalho Referer” ou “bloquear tráfego do ASN X”, muitas vezes pega crawlers de IA também, já que eles raramente enviam um Referer e passam por um punhado de ASNs de data center.

Verifique: em Security > WAF > Custom rules, leia as condições de correspondência de cada regra contra os user agents das verificações 3 a 5. Qualquer regra que corresponda a um cabeçalho ausente, um ASN ou um país merece uma segunda olhada.

9. Verifique se o rate limiting reduz os crawlers a quase zero

Afirmação: um limite de taxa ajustado para tráfego humano pode limitar um crawler a uma requisição a cada poucos minutos. O seu painel ainda mostra “permitido”, mas o crawler enxerga o site como inacessível.

Verifique:

for i in 1 2 3 4 5; do
  curl -s -A "GPTBot" -o /dev/null -w "%{http_code} " https://yoursite.com/
done; echo

Se as requisições seguintes retornarem 429 enquanto a primeira retorna 200, o verdadeiro bloqueio é o limite de taxa, não o seu interruptor do AI Crawl Control.

10. Confirme que páginas-chave não escondem conteúdo atrás de renderização no lado do cliente

Afirmação: a maioria dos crawlers de IA busca o HTML bruto e não executa JavaScript como um navegador faz. Uma página que só renderiza a resposta depois que um script roda continua invisível para eles, não importa a configuração de bot.

Verifique:

curl -s https://yoursite.com/your-key-page | grep -c "<p"

Compare essa contagem com o que você vê na página renderizada em um navegador. Uma diferença grande significa que o conteúdo carrega no lado do cliente, e os crawlers veem apenas uma casca vazia.

11. Filtre os logs do seu servidor pelo que realmente aconteceu

Afirmação: os interruptores do painel descrevem intenção. Os seus logs descrevem resultados, incluindo bots servidos por uma camada de proxy que não é o Cloudflare.

Verifique:

grep -E "GPTBot|ClaudeBot|PerplexityBot|Google-Extended|ChatGPT-User|Perplexity-User" access.log | awk '{print $9}' | sort | uniq -c

Isso conta os códigos de status que cada bot realmente recebeu. Um agrupamento de 403s ou 429s confirma um bloqueio que a sua revisão de configurações deixou passar.

12. Verifique as regras de Managed Challenge e CAPTCHA para user agents de IA

Afirmação: um Managed Challenge retorna HTTP 200 com uma página que um humano consegue clicar para passar. Um crawler não consegue. Isso nunca aparece como um bloqueio, então é a falha mais fácil de passar despercebida nesta lista.

Verifique: em Security > WAF, filtre o registro de eventos do firewall pelos user agents das verificações 3 a 5 e leia a coluna Action. “Managed Challenge” ou “JS Challenge” contra um crawler de IA é um bloqueio silencioso, mesmo que o status HTTP pareça limpo.

13. Compare o llms.txt com o robots.txt em busca de contradições

Afirmação: um arquivo llms.txt publicado deve apontar para as mesmas páginas que o robots.txt permite. Um llms.txt selecionado que lista páginas bloqueadas pelo robots.txt manda os crawlers de IA para uma URL que eles também foram instruídos a pular.

Verifique:

curl -s https://yoursite.com/llms.txt
curl -s https://yoursite.com/robots.txt

Leia os dois lado a lado. Toda URL do llms.txt deve resolver sem uma regra Disallow correspondente no robots.txt.

14. Coloque este checklist em uma agenda recorrente

Afirmação: os padrões, os nomes de bots e as regras de categoria do Cloudflare vão continuar mudando depois de 15 de setembro. Uma verificação feita uma vez só não diz nada sobre o mês que vem.

Verifique: salve as verificações 2 a 11 como um script e rode mensalmente, ou depois de qualquer mudança de CDN, WAF ou hospedagem. Uma ferramenta dedicada de acesso de crawlers pode rodar isso automaticamente e alertar você no momento em que um código de status mudar.


Ferramentas que automatizam essas verificações

Rodar as 14 verificações manualmente uma vez é razoável. Rodá-las todo mês, em todas as propriedades que você gerencia, não é.

A Profound combina acesso de nível Agent com rastreamento de citações, o que encaixa direto nas verificações 4 e 5: ela mostra não só se o ChatGPT-User ou o Perplexity-User conseguem alcançar uma página, mas se esse acesso está virando uma menção de verdade.

A Knowatoa roda verificações de acesso de crawlers como um fluxo de trabalho pronto: leitura do robots.txt, testes de acessibilidade por bot e alertas quando um código de status muda, o que cobre a maior parte das verificações 2 a 11 sem um script manual.

A Otterly.AI, fonte do número de 73% de barreira técnica citado acima, inclui uma auditoria de rastreabilidade dentro do seu monitoramento de GEO mais amplo, junto com o rastreamento de citações no ChatGPT, no Perplexity e no Google AI Overviews.

Se você quer uma única assinatura que cubra o monitoramento de acesso de crawlers junto com o rastreamento de citações e a execução de conteúdo, o Temso é a opção all-in-one mais simples, a partir de $89/mês, com projetos, usuários e recomendações ilimitados em todos os planos.

A comparação completa lado a lado das plataformas de GEO está em /rankings/geo-tools. Para saber como testamos os sinais de acesso de crawlers em cada plataforma que avaliamos, veja /methodology.

Perguntas frequentes

Como eu verifico se o meu site bloqueia crawlers de IA?

Faça quatro verificações juntas: busque o seu robots.txt ao vivo em busca de regras Disallow para bots de IA, rode curl no seu site com o user agent de cada bot (GPTBot, ClaudeBot, PerplexityBot, ChatGPT-User, Googlebot) e leia o código de status, filtre os logs do seu servidor pelos códigos que esses bots realmente receberam, e revise as configurações de gestão de bots do seu CDN, já que uma regra de firewall ou um limite de taxa pode bloquear um crawler que o robots.txt permite.

O que mudou na política de crawlers de IA do Cloudflare em 15 de setembro de 2026?

O Cloudflare substituiu o antigo interruptor único para bots de IA por três categorias: Search, Agent e Training. Nessa data, novos clientes, novos sites e contas existentes do plano gratuito passaram a bloquear por padrão os crawlers Agent e Training em qualquer página que carregue uma unidade de anúncio, enquanto os crawlers Search continuaram permitidos.

O que acontece com o Googlebot, o Applebot e o Bingbot sob as novas regras?

O Cloudflare os trata como crawlers de uso misto, que combinam comportamento Search e Training. Se você bloquear a categoria Training em qualquer lugar do seu site, esses três bots ficam totalmente bloqueados, mesmo que você nunca tenha mexido na sua configuração de Search, e mesmo que bloqueá-los custe a sua indexação comum no Google.

Um robots.txt limpo é suficiente para garantir o acesso de crawlers de IA?

Não. O robots.txt é um pedido, não uma camada de aplicação, e só bots bem-comportados chegam a lê-lo. As regras de gestão de bots do seu CDN, as regras personalizadas do WAF, os limites de taxa e as configurações de Managed Challenge ficam todos acima do robots.txt e podem bloquear um crawler que esse arquivo permite explicitamente.

Quantos sites já bloqueiam crawlers de IA sem querer?

Segundo a análise da Otterly.AI de mais de um milhão de citações de IA, 73% dos sites carregam uma barreira técnica (um bloqueio no robots.txt, uma regra de CDN ou uma lacuna de renderização em JavaScript) que impede os crawlers de IA de alcançar o seu conteúdo.

Quais ferramentas ajudam a verificar o acesso de crawlers de IA de forma contínua?

A Knowatoa roda testes de acessibilidade por bot e alerta sobre mudanças de código de status. A Profound combina acesso de nível Agent com rastreamento de citações, para você ver se uma página acessível está virando uma menção de verdade. A Auditoria GEO da Otterly.AI verifica a rastreabilidade junto com o próprio monitoramento de citações no ChatGPT, no Perplexity e no Google AI Overviews.