Atualizado em setembro de 2026. Este checklist reflete a política publicada pelo Cloudflare em 15 de setembro de 2026, data em que os novos padrões do AI Crawl Control entram em vigor.
A maioria dos donos de site acha que uma linha no robots.txt resolve a questão do acesso de crawlers de IA. Não resolve. O seu CDN aplica as próprias regras de bots acima desse arquivo, e as regras do Cloudflare acabaram de mudar de um jeito que pode cortar, sem aviso, crawlers com os quais você contava.
Em 15 de setembro de 2026, o Cloudflare dividiu o antigo interruptor único para bots de IA em três categorias nomeadas: Search, Agent e Training. Novos clientes, novos sites em contas existentes e todas as contas do plano gratuito agora bloqueiam por padrão os crawlers Agent e Training em qualquer página que carregue uma unidade de anúncio. Bots que combinam mais de uma categoria, incluindo Googlebot, Applebot e Bingbot, herdam a regra mais restritiva que você configurar, então bloquear a categoria Training pode derrubar um crawler que você achava ter permitido.
Nada disso é hipotético. A análise da Otterly.AI de mais de um milhão de citações de IA constatou que 73% dos sites já carregam uma barreira técnica, seja um bloqueio no robots.txt, uma regra de CDN ou uma lacuna de renderização em JavaScript, que impede os crawlers de IA de entrar antes mesmo de a página competir por share de citações. As 14 verificações abaixo transformam esse risco em algo que você pode confirmar em minutos, não em algo para adivinhar.
O que muda em 15 de setembro de 2026
Agora, o Cloudflare classifica cada crawler de IA pelo que ele faz no seu site, não só pelo nome:
- Search: rastreia e indexa o conteúdo para responder perguntas sobre ele depois.
- Agent: busca uma página em tempo real porque uma pessoa pediu isso ao seu assistente de IA.
- Training: coleta conteúdo para treinar ou ajustar um modelo.
Um crawler que faz mais de uma dessas coisas, o Cloudflare chama de crawler de uso misto, herda a sua regra mais restritiva em todas as categorias às quais pertence. Bloqueie a categoria Training em qualquer lugar do site, e um bot de uso misto como o Googlebot fica bloqueado em tudo, inclusive no comportamento Search que você queria manter.
| Configuração | Antes de 15 de setembro de 2026 | Depois de 15 de setembro de 2026 |
|---|---|---|
| Crawlers Search em páginas monetizadas por anúncios | Permitido | Continua permitido |
| Crawlers Agent em páginas monetizadas por anúncios | Permitido por padrão | Bloqueado por padrão |
| Crawlers Training em páginas monetizadas por anúncios | Permitido, a menos que bloqueado manualmente | Bloqueado por padrão |
| Crawlers de uso misto (Googlebot, Applebot, Bingbot) | Tratado só como Search | Totalmente bloqueado se você bloquear a categoria Training |
| Contas afetadas automaticamente | Nenhuma | Novos clientes, novos sites, contas existentes do plano gratuito |
| Contas pagas existentes | N/A | Mantêm as configurações atuais, a menos que você opte por ativar |
Se todos os sites da sua conta do Cloudflare são anteriores a 15 de setembro e você está em um plano pago, nada muda sem uma ação sua. Mas um novo site adicionado a essa mesma conta, ou qualquer cliente rodando no plano gratuito, herda os novos bloqueios assim que entra no ar. Verifique todas as propriedades que você gerencia, não só o domínio principal.
O checklist de 14 pontos de acesso
Cada verificação abaixo combina uma afirmação sobre como o acesso de crawlers de IA realmente quebra com um comando que você pode rodar no seu próprio domínio agora mesmo. Troque yoursite.com pelo seu domínio real e, onde uma verificação citar bots específicos, troque pelos que importam para o seu mix de motores.
1. Confirme as configurações de nível do AI Crawl Control
Afirmação: os interruptores de Search, Agent e Training da sua conta decidem o resultado antes de qualquer bot chegar ao seu servidor. Uma configuração que você nunca tocou ainda pode estar bloqueando tráfego.
Verifique: no painel do Cloudflare, abra Security > Bots > AI Crawl Control em cada zona e leia o status ao lado de Search, Agent e Training. A configuração é por site, não por conta, então repita isso para cada propriedade.
2. Busque o seu robots.txt ao vivo em busca de regras para bots de IA
Afirmação: o robots.txt só impede crawlers que escolhem obedecê-lo, mas uma linha Disallow para GPTBot, ClaudeBot ou PerplexityBot ainda é a primeira coisa que a maioria dos motores verifica.
Verifique:
curl -s https://yoursite.com/robots.txt | grep -iE "gptbot|claudebot|perplexitybot|google-extended|ccbot|bytespider"
Qualquer correspondência mostra exatamente quais bots Training estão bloqueados em algum lugar do site.
3. Teste cada bot Training diretamente com curl
Afirmação: os crawlers Training (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider) alimentam o treinamento de modelos, não respostas em tempo real. Saiba se o novo padrão do Cloudflare os bloqueou silenciosamente antes de presumir que sim.
Verifique:
for ua in GPTBot ClaudeBot Google-Extended CCBot Bytespider; do
echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done
Um 403 ou 429 significa que esse bot está bloqueado na borda, seja lá o que o seu robots.txt diga.
4. Teste cada bot Agent diretamente com curl
Afirmação: os bots Agent (ChatGPT-User, Perplexity-User, Claude-User) buscam uma página porque uma pessoa fez uma pergunta em tempo real ao seu assistente agora mesmo. Perder esse nível custa a resposta em si, não só dados de treinamento futuros.
Verifique:
for ua in "ChatGPT-User" "Perplexity-User" "Claude-User"; do
echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done
5. Teste os bots Search de uso misto com curl
Afirmação: sob as novas regras do Cloudflare, o Googlebot, o Applebot e o Bingbot carregam tanto o comportamento Search quanto o Training. Bloqueie a categoria Training em qualquer lugar, e esses três herdam esse bloqueio em tudo.
Verifique:
for ua in Googlebot Applebot Bingbot; do
echo "$ua:"; curl -s -A "$ua" -o /dev/null -w "%{http_code}\n" https://yoursite.com/
done
Um 403 aqui é a falha mais cara deste checklist: ela custa a sua busca orgânica, não só as citações de IA.
6. Verifique se uma página carrega o sinal de anúncio que ativa o novo padrão
Afirmação: o bloqueio de Agent e Training só é ativado por padrão em páginas que o Cloudflare lê como monetizadas por anúncios. Uma página sem script de anúncio mantém o comportamento antigo, mais permissivo.
Verifique:
curl -s https://yoursite.com/ | grep -iE "adsbygoogle|doubleclick|googlesyndication|ad-slot"
Uma correspondência significa que você deve tratar essa página como coberta pelo novo padrão, e confirmar que as configurações da verificação 1 se aplicam a ela.
7. Descarte o Bot Fight Mode legado sobrepondo as novas configurações
Afirmação: o Bot Fight Mode e o Super Bot Fight Mode são anteriores ao AI Crawl Control e ainda podem desafiar ou bloquear um crawler mesmo quando o seu interruptor específico de IA está em “permitir”.
Verifique: em Security > Bots, confirme que o Bot Fight Mode está desativado, ou que os user agents dos crawlers de IA estão na lista de permissões dele. Não existe um teste confiável com curl aqui: um bot desafiado recebe um status 200 com uma página de desafio em JavaScript em vez de um 403 limpo, então o bloqueio fica escondido à vista de todos.
8. Audite regras personalizadas do WAF em busca de bloqueios acidentais de crawlers
Afirmação: uma regra de firewall escrita para barrar scrapers, “bloquear requisições sem cabeçalho Referer” ou “bloquear tráfego do ASN X”, muitas vezes pega crawlers de IA também, já que eles raramente enviam um Referer e passam por um punhado de ASNs de data center.
Verifique: em Security > WAF > Custom rules, leia as condições de correspondência de cada regra contra os user agents das verificações 3 a 5. Qualquer regra que corresponda a um cabeçalho ausente, um ASN ou um país merece uma segunda olhada.
9. Verifique se o rate limiting reduz os crawlers a quase zero
Afirmação: um limite de taxa ajustado para tráfego humano pode limitar um crawler a uma requisição a cada poucos minutos. O seu painel ainda mostra “permitido”, mas o crawler enxerga o site como inacessível.
Verifique:
for i in 1 2 3 4 5; do
curl -s -A "GPTBot" -o /dev/null -w "%{http_code} " https://yoursite.com/
done; echo
Se as requisições seguintes retornarem 429 enquanto a primeira retorna 200, o verdadeiro bloqueio é o limite de taxa, não o seu interruptor do AI Crawl Control.
10. Confirme que páginas-chave não escondem conteúdo atrás de renderização no lado do cliente
Afirmação: a maioria dos crawlers de IA busca o HTML bruto e não executa JavaScript como um navegador faz. Uma página que só renderiza a resposta depois que um script roda continua invisível para eles, não importa a configuração de bot.
Verifique:
curl -s https://yoursite.com/your-key-page | grep -c "<p"
Compare essa contagem com o que você vê na página renderizada em um navegador. Uma diferença grande significa que o conteúdo carrega no lado do cliente, e os crawlers veem apenas uma casca vazia.
11. Filtre os logs do seu servidor pelo que realmente aconteceu
Afirmação: os interruptores do painel descrevem intenção. Os seus logs descrevem resultados, incluindo bots servidos por uma camada de proxy que não é o Cloudflare.
Verifique:
grep -E "GPTBot|ClaudeBot|PerplexityBot|Google-Extended|ChatGPT-User|Perplexity-User" access.log | awk '{print $9}' | sort | uniq -c
Isso conta os códigos de status que cada bot realmente recebeu. Um agrupamento de 403s ou 429s confirma um bloqueio que a sua revisão de configurações deixou passar.
12. Verifique as regras de Managed Challenge e CAPTCHA para user agents de IA
Afirmação: um Managed Challenge retorna HTTP 200 com uma página que um humano consegue clicar para passar. Um crawler não consegue. Isso nunca aparece como um bloqueio, então é a falha mais fácil de passar despercebida nesta lista.
Verifique: em Security > WAF, filtre o registro de eventos do firewall pelos user agents das verificações 3 a 5 e leia a coluna Action. “Managed Challenge” ou “JS Challenge” contra um crawler de IA é um bloqueio silencioso, mesmo que o status HTTP pareça limpo.
13. Compare o llms.txt com o robots.txt em busca de contradições
Afirmação: um arquivo llms.txt publicado deve apontar para as mesmas páginas que o robots.txt permite. Um llms.txt selecionado que lista páginas bloqueadas pelo robots.txt manda os crawlers de IA para uma URL que eles também foram instruídos a pular.
Verifique:
curl -s https://yoursite.com/llms.txt
curl -s https://yoursite.com/robots.txt
Leia os dois lado a lado. Toda URL do llms.txt deve resolver sem uma regra Disallow correspondente no robots.txt.
14. Coloque este checklist em uma agenda recorrente
Afirmação: os padrões, os nomes de bots e as regras de categoria do Cloudflare vão continuar mudando depois de 15 de setembro. Uma verificação feita uma vez só não diz nada sobre o mês que vem.
Verifique: salve as verificações 2 a 11 como um script e rode mensalmente, ou depois de qualquer mudança de CDN, WAF ou hospedagem. Uma ferramenta dedicada de acesso de crawlers pode rodar isso automaticamente e alertar você no momento em que um código de status mudar.
Ferramentas que automatizam essas verificações
Rodar as 14 verificações manualmente uma vez é razoável. Rodá-las todo mês, em todas as propriedades que você gerencia, não é.
A Profound combina acesso de nível Agent com rastreamento de citações, o que encaixa direto nas verificações 4 e 5: ela mostra não só se o ChatGPT-User ou o Perplexity-User conseguem alcançar uma página, mas se esse acesso está virando uma menção de verdade.
A Knowatoa roda verificações de acesso de crawlers como um fluxo de trabalho pronto: leitura do robots.txt, testes de acessibilidade por bot e alertas quando um código de status muda, o que cobre a maior parte das verificações 2 a 11 sem um script manual.
A Otterly.AI, fonte do número de 73% de barreira técnica citado acima, inclui uma auditoria de rastreabilidade dentro do seu monitoramento de GEO mais amplo, junto com o rastreamento de citações no ChatGPT, no Perplexity e no Google AI Overviews.
Se você quer uma única assinatura que cubra o monitoramento de acesso de crawlers junto com o rastreamento de citações e a execução de conteúdo, o Temso é a opção all-in-one mais simples, a partir de $89/mês, com projetos, usuários e recomendações ilimitados em todos os planos.
A comparação completa lado a lado das plataformas de GEO está em /rankings/geo-tools. Para saber como testamos os sinais de acesso de crawlers em cada plataforma que avaliamos, veja /methodology.