Atualizado pela última vez em agosto de 2026.
A maioria dos arquivos robots.txt ainda trata “OpenAI” como um único item. Essa única decisão bloqueia um crawler que você precisava para citações, ou deixa a porta aberta para um crawler que você queria mesmo bloquear.
Os três crawlers da OpenAI fazem três trabalhos diferentes e respondem a três tokens diferentes no robots.txt. Erre esse mapeamento e você perde a elegibilidade para citações por acidente, ou concede um consentimento de treinamento que nunca quis dar.
Isso não é um problema hipotético. A Cloudflare está prestes a mudar o tratamento padrão dos três crawlers em uma grande parte da web, e o prazo chega em questão de semanas. Donos de sites que nunca abriram o próprio arquivo robots.txt estão prestes a ter um padrão escolhido por eles.
Três bots, três trabalhos completamente diferentes
Todo laboratório de IA hoje opera mais de um crawler, e a OpenAI opera três sob o próprio nome. Tratá-los como uma única fonte de tráfego é o jeito mais rápido de configurar mal o seu site.
O risco é real. Segundo os próprios dados de rede da Cloudflare, a participação do GPTBot no tráfego de crawlers de IA saltou de 5% em maio de 2024 para 30% um ano depois, o que o tornou o terceiro maior crawler de qualquer tipo na rede da Cloudflare até maio de 2025 (Cloudflare, 2025). O mesmo relatório constatou que o GPTBot também era o crawler de IA mais bloqueado da rede, com mais regras de bloqueio no robots.txt citando o seu nome do que qualquer outro bot até junho de 2025.
Essa combinação, tráfego alto e taxa de bloqueio alta, diz algo importante. Muitos donos de sites bloqueiam o GPTBot de propósito. Bem poucos fazem isso com um entendimento claro do que cada um dos três tokens realmente controla.
A confusão é compreensível. Os três crawlers compartilham o nome OpenAI, e a maioria dos painéis de CDN os agrupa em um único botão “OpenAI”. Mas uma regra que bloqueia o GPTBot por motivos de treinamento e uma regra que bloqueia o OAI-SearchBot por motivos de citação resolvem dois problemas completamente diferentes. Vire o botão errado e você pode perder a sua elegibilidade para citações achando que só tinha optado por sair do treinamento.
A taxonomia GPTBot vs OAI-SearchBot vs ChatGPT-User
Esta é a tabela que vale a pena salvar. Cada linha vem direto da documentação de crawlers da própria OpenAI: a string exata de user-agent, o propósito declarado, o que aquele rastreamento realmente alimenta e o token do robots.txt que o controla.
A OpenAI não lançou os três de uma vez. O GPTBot veio primeiro, em agosto de 2023, criado puramente para treinamento. O OAI-SearchBot e o ChatGPT-User chegaram depois, quando o ChatGPT ganhou busca na web e navegação ao vivo. Os três tokens existem porque o produto ganhou novas capacidades, não porque a OpenAI se propôs a desenhar uma taxonomia. Essa história explica exatamente por que tantos arquivos robots.txt ainda mencionam só o mais antigo dos três.
| Crawler | String de user-agent | Propósito | O que alimenta | Token no robots.txt |
|---|---|---|---|---|
| GPTBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot | Treinamento de modelo | Dados de treinamento para as futuras gerações do modelo GPT | User-agent: GPTBot |
| OAI-SearchBot | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot | Indexação de busca | O índice de busca de onde o ChatGPT tira as suas citações | User-agent: OAI-SearchBot |
| ChatGPT-User | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot | Busca ao vivo do usuário | Uma página, buscada no momento em que uma pessoa ou um Custom GPT pede ao ChatGPT para abri-la | User-agent: ChatGPT-User |
Cada token funciona de forma independente. Você pode bloquear o GPTBot e ao mesmo tempo permitir o OAI-SearchBot, e a OpenAI vai respeitar as duas regras nos seus próprios termos. É exatamente esse o objetivo de dividir o tráfego de uma empresa em três agentes nomeados: isso permite que você consinta com um uso do seu conteúdo enquanto recusa outro, em vez de aceitar ou bloquear a OpenAI como um único ator indiferenciado.
O que bloquear ou permitir cada um realmente muda
GPTBot: o crawler de treinamento
O GPTBot existe para coletar conteúdo para o pipeline de treinamento de modelos da OpenAI. Uma regra de bloqueio aqui significa que as suas páginas não serão usadas para treinar as futuras gerações do GPT. Isso não tem nenhum efeito sobre a capacidade do ChatGPT de encontrar, buscar ou citar o seu conteúdo hoje. Publishers que se opõem ao treinamento de IA por princípio, sem se opor à visibilidade em IA, bloqueiam esse token e deixam os outros dois intocados.
OAI-SearchBot: o crawler de citações
O OAI-SearchBot constrói o índice de onde o recurso de busca do ChatGPT tira respostas e citações. Bloqueie esse token e as suas páginas param de aparecer nas respostas do ChatGPT baseadas em busca, embora ainda possam surgir como links de navegação comuns em alguns contextos. Se o objetivo é share de citações, esse é o token que precisa ficar aberto. Bloqueá-lo é o jeito mais rápido de sumir das fontes citadas pelo ChatGPT sem entender por quê.
ChatGPT-User: o crawler de busca ao vivo
O ChatGPT-User não é exatamente um crawler. Ele dispara uma vez, sob demanda, quando uma pessoa de verdade (ou um Custom GPT agindo em nome dela) pede ao ChatGPT para abrir uma URL específica. A própria documentação da OpenAI é direta sobre os limites aqui: esse agente “não é usado para rastrear a web de forma automática”, e as regras do robots.txt podem não se aplicar totalmente, já que a solicitação é iniciada pelo usuário, e não automática. Trate uma regra de bloqueio nesse token como um sinal forte, não como uma garantia. Se precisar de uma parada rígida, combine-a com um bloqueio em nível de servidor ou de CDN em vez de confiar só no robots.txt.
O prazo de 15 de setembro de 2026 da Cloudflare e o que ele significa para as suas regras
A Cloudflare organiza o comportamento dos bots de IA em três propósitos declarados, e as definições se encaixam perfeitamente na taxonomia acima. Search é “qualquer comportamento que coleta ou indexa o seu conteúdo, para poder responder perguntas sobre ele depois.” Agent é “comportamento automatizado que age, geralmente em tempo real, em nome de uma pessoa, para resolver algo agora.” Training é um crawler “que leva o seu conteúdo para treinar ou ajustar um modelo”, onde os dados são permanentemente absorvidos pelo próprio modelo (Cloudflare, 2026).
Cruze essas definições com os propósitos declarados pela própria OpenAI e o mapeamento se faz sozinho. O OAI-SearchBot é um crawler de propósito Search. O ChatGPT-User é um crawler de propósito Agent, e a Cloudflare cita o ChatGPT-User diretamente como exemplo dessa categoria. O GPTBot é um crawler de propósito Training.
No novo padrão da Cloudflare, em qualquer página que carregue anúncios, Search continua permitido, enquanto Agent e Training ficam bloqueados. Isso significa que o GPTBot e o ChatGPT-User ficam bloqueados por padrão nas suas páginas monetizadas a partir de 15 de setembro de 2026, enquanto o OAI-SearchBot continua funcionando. Se você quiser uma divisão diferente, configure isso você mesmo no painel da Cloudflare, em Security, Bots, AI Scrapers and Crawlers, antes do prazo chegar.
Isso não é bem um problema novo, é mais uma formalização de um problema antigo. Segundo a análise de 2026 da Otterly.AI, com mais de um milhão de pontos de dados, 73% dos sites já carregam uma barreira técnica, seja uma regra não intencional no robots.txt ou uma configuração de segurança de CDN, que mantém algum crawler de IA totalmente fora (Otterly.AI, 2026). O novo padrão da Cloudflare não cria essa lacuna. Ele só escolhe o padrão para quem ainda não tinha escolhido nenhum.
Como checar a sua situação agora mesmo
- Abra
seusite.com/robots.txte procure porGPTBot,OAI-SearchBoteChatGPT-Userpelo nome. Uma regra geralUser-agent: *comDisallow: /pega os três, você tendo intenção ou não, e o mesmo vale para uma única linhaUser-agent: OpenAIcopiada de um guia desatualizado. - Se você usa Cloudflare, confira Security > Bots > AI Scrapers and Crawlers. A configuração do painel da Cloudflare pode sobrepor ou duplicar as suas regras do robots.txt, e os dois podem entrar em conflito silenciosamente: um robots.txt que permite um crawler não significa nada se o CDN o bloquear antes, na borda da rede.
- Puxe os logs brutos do servidor ou do CDN e filtre pelas três strings de user-agent da tabela acima. Ferramentas de analytics que dependem de uma tag JavaScript não vão mostrar esse tráfego: crawlers não executam JavaScript nem disparam pixels de rastreamento, então um painel de analytics padrão reporta zero visitas para requisições que realmente aconteceram.
- Decida cada token de propósito, não por padrão. Permita o
OAI-SearchBotse share de citações importa para você. Decida sobre oGPTBotseparadamente, com base na sua posição sobre treinamento de IA. Trate oChatGPT-Usercomo um sinal leve, e não como um bloqueio rígido, e reforce com uma regra em nível de servidor se precisar de certeza. - Marque um lembrete antes de 15 de setembro de 2026. Se você não mexeu nessas configurações, o novo padrão da Cloudflare toma a decisão de Training e Agent por você, em toda página monetizada por anúncios.
Ferramentas que mostram o crawler, não só a citação
Ferramentas de rastreamento de citações mostram quando você foi citado. Elas raramente mostram qual crawler chegou ao seu servidor, quando, ou com que frequência foi recusado. Esse é um problema de medição separado, e exige uma capacidade separada.
Profound criou o recurso Agent Analytics justamente para essa lacuna. Ele lê o tráfego de bots em nível de log de servidor e separa as requisições do GPTBot, do OAI-SearchBot e do ChatGPT-User em linhas distintas, junto com dados de volume de prompts, em vez de jogar todo o tráfego da OpenAI em um único balde. Para equipes que precisam provar exatamente qual crawler está ou não chegando a uma página, essa visão de log de servidor é a ferramenta especializada para o trabalho. Ela foi criada exatamente para esse tipo de diagnóstico técnico, motor por motor, o que também explica por que aparece em relatórios de GEO em nível executivo.
Otterly.AI aborda essa mesma questão de acesso pelo lado dos dados. A sua análise de barreiras de acesso de crawlers em mais de um milhão de pontos de dados é a fonte por trás do número de 73% citado acima, e é uma referência útil se você quiser saber o quão comuns são esses bloqueios em toda a web aberta, não só no seu próprio domínio.
Para equipes que querem visibilidade de crawlers e rastreamento de citações na mesma assinatura, em vez de dois logins separados, veja a comparação completa lado a lado das plataformas de GEO em /rankings/geo-tools, avaliada segundo a metodologia publicada.
Audite o seu robots.txt em relação à tabela acima antes de 15 de setembro. O Temso, a plataforma de SEO para IA completa a partir de US$ 89/mês, inclui analytics de bots junto com o rastreamento de citações no mesmo painel, para que você veja qual crawler da OpenAI chegou ao seu site e se isso virou uma citação, sem precisar juntar logs de servidor e uma ferramenta de monitoramento separada por conta própria.