GEO Rankings
← Blog
Publicado

GPTBot vs OAI-SearchBot vs ChatGPT-User: qual crawler realmente alimenta suas citações de IA (e o que o bloqueio de 15 de setembro da Cloudflare significa para o seu site)

O GPTBot treina modelos, o OAI-SearchBot constrói a busca do ChatGPT e o ChatGPT-User busca páginas ao vivo. Veja a taxonomia exata e o padrão de 15 de setembro da Cloudflare.

Resumo

A OpenAI opera três crawlers separados, não um único bot. O GPTBot treina os modelos da OpenAI com o seu conteúdo. O OAI-SearchBot constrói o índice por trás do recurso de busca do ChatGPT e das suas citações. O ChatGPT-User busca uma única página ao vivo quando uma pessoa pede ao ChatGPT para abrir um link. Bloqueie o GPTBot e você interrompe o treinamento, não as citações.

Atualizado pela última vez em agosto de 2026.

A maioria dos arquivos robots.txt ainda trata “OpenAI” como um único item. Essa única decisão bloqueia um crawler que você precisava para citações, ou deixa a porta aberta para um crawler que você queria mesmo bloquear.

Os três crawlers da OpenAI fazem três trabalhos diferentes e respondem a três tokens diferentes no robots.txt. Erre esse mapeamento e você perde a elegibilidade para citações por acidente, ou concede um consentimento de treinamento que nunca quis dar.

Isso não é um problema hipotético. A Cloudflare está prestes a mudar o tratamento padrão dos três crawlers em uma grande parte da web, e o prazo chega em questão de semanas. Donos de sites que nunca abriram o próprio arquivo robots.txt estão prestes a ter um padrão escolhido por eles.


Três bots, três trabalhos completamente diferentes

Todo laboratório de IA hoje opera mais de um crawler, e a OpenAI opera três sob o próprio nome. Tratá-los como uma única fonte de tráfego é o jeito mais rápido de configurar mal o seu site.

O risco é real. Segundo os próprios dados de rede da Cloudflare, a participação do GPTBot no tráfego de crawlers de IA saltou de 5% em maio de 2024 para 30% um ano depois, o que o tornou o terceiro maior crawler de qualquer tipo na rede da Cloudflare até maio de 2025 (Cloudflare, 2025). O mesmo relatório constatou que o GPTBot também era o crawler de IA mais bloqueado da rede, com mais regras de bloqueio no robots.txt citando o seu nome do que qualquer outro bot até junho de 2025.

Essa combinação, tráfego alto e taxa de bloqueio alta, diz algo importante. Muitos donos de sites bloqueiam o GPTBot de propósito. Bem poucos fazem isso com um entendimento claro do que cada um dos três tokens realmente controla.

A confusão é compreensível. Os três crawlers compartilham o nome OpenAI, e a maioria dos painéis de CDN os agrupa em um único botão “OpenAI”. Mas uma regra que bloqueia o GPTBot por motivos de treinamento e uma regra que bloqueia o OAI-SearchBot por motivos de citação resolvem dois problemas completamente diferentes. Vire o botão errado e você pode perder a sua elegibilidade para citações achando que só tinha optado por sair do treinamento.


A taxonomia GPTBot vs OAI-SearchBot vs ChatGPT-User

Esta é a tabela que vale a pena salvar. Cada linha vem direto da documentação de crawlers da própria OpenAI: a string exata de user-agent, o propósito declarado, o que aquele rastreamento realmente alimenta e o token do robots.txt que o controla.

A OpenAI não lançou os três de uma vez. O GPTBot veio primeiro, em agosto de 2023, criado puramente para treinamento. O OAI-SearchBot e o ChatGPT-User chegaram depois, quando o ChatGPT ganhou busca na web e navegação ao vivo. Os três tokens existem porque o produto ganhou novas capacidades, não porque a OpenAI se propôs a desenhar uma taxonomia. Essa história explica exatamente por que tantos arquivos robots.txt ainda mencionam só o mais antigo dos três.

CrawlerString de user-agentPropósitoO que alimentaToken no robots.txt
GPTBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotTreinamento de modeloDados de treinamento para as futuras gerações do modelo GPTUser-agent: GPTBot
OAI-SearchBotMozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbotIndexação de buscaO índice de busca de onde o ChatGPT tira as suas citaçõesUser-agent: OAI-SearchBot
ChatGPT-UserMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/botBusca ao vivo do usuárioUma página, buscada no momento em que uma pessoa ou um Custom GPT pede ao ChatGPT para abri-laUser-agent: ChatGPT-User

Cada token funciona de forma independente. Você pode bloquear o GPTBot e ao mesmo tempo permitir o OAI-SearchBot, e a OpenAI vai respeitar as duas regras nos seus próprios termos. É exatamente esse o objetivo de dividir o tráfego de uma empresa em três agentes nomeados: isso permite que você consinta com um uso do seu conteúdo enquanto recusa outro, em vez de aceitar ou bloquear a OpenAI como um único ator indiferenciado.


O que bloquear ou permitir cada um realmente muda

GPTBot: o crawler de treinamento

O GPTBot existe para coletar conteúdo para o pipeline de treinamento de modelos da OpenAI. Uma regra de bloqueio aqui significa que as suas páginas não serão usadas para treinar as futuras gerações do GPT. Isso não tem nenhum efeito sobre a capacidade do ChatGPT de encontrar, buscar ou citar o seu conteúdo hoje. Publishers que se opõem ao treinamento de IA por princípio, sem se opor à visibilidade em IA, bloqueiam esse token e deixam os outros dois intocados.

OAI-SearchBot: o crawler de citações

O OAI-SearchBot constrói o índice de onde o recurso de busca do ChatGPT tira respostas e citações. Bloqueie esse token e as suas páginas param de aparecer nas respostas do ChatGPT baseadas em busca, embora ainda possam surgir como links de navegação comuns em alguns contextos. Se o objetivo é share de citações, esse é o token que precisa ficar aberto. Bloqueá-lo é o jeito mais rápido de sumir das fontes citadas pelo ChatGPT sem entender por quê.

ChatGPT-User: o crawler de busca ao vivo

O ChatGPT-User não é exatamente um crawler. Ele dispara uma vez, sob demanda, quando uma pessoa de verdade (ou um Custom GPT agindo em nome dela) pede ao ChatGPT para abrir uma URL específica. A própria documentação da OpenAI é direta sobre os limites aqui: esse agente “não é usado para rastrear a web de forma automática”, e as regras do robots.txt podem não se aplicar totalmente, já que a solicitação é iniciada pelo usuário, e não automática. Trate uma regra de bloqueio nesse token como um sinal forte, não como uma garantia. Se precisar de uma parada rígida, combine-a com um bloqueio em nível de servidor ou de CDN em vez de confiar só no robots.txt.


O prazo de 15 de setembro de 2026 da Cloudflare e o que ele significa para as suas regras

A Cloudflare organiza o comportamento dos bots de IA em três propósitos declarados, e as definições se encaixam perfeitamente na taxonomia acima. Search é “qualquer comportamento que coleta ou indexa o seu conteúdo, para poder responder perguntas sobre ele depois.” Agent é “comportamento automatizado que age, geralmente em tempo real, em nome de uma pessoa, para resolver algo agora.” Training é um crawler “que leva o seu conteúdo para treinar ou ajustar um modelo”, onde os dados são permanentemente absorvidos pelo próprio modelo (Cloudflare, 2026).

Cruze essas definições com os propósitos declarados pela própria OpenAI e o mapeamento se faz sozinho. O OAI-SearchBot é um crawler de propósito Search. O ChatGPT-User é um crawler de propósito Agent, e a Cloudflare cita o ChatGPT-User diretamente como exemplo dessa categoria. O GPTBot é um crawler de propósito Training.

No novo padrão da Cloudflare, em qualquer página que carregue anúncios, Search continua permitido, enquanto Agent e Training ficam bloqueados. Isso significa que o GPTBot e o ChatGPT-User ficam bloqueados por padrão nas suas páginas monetizadas a partir de 15 de setembro de 2026, enquanto o OAI-SearchBot continua funcionando. Se você quiser uma divisão diferente, configure isso você mesmo no painel da Cloudflare, em Security, Bots, AI Scrapers and Crawlers, antes do prazo chegar.

Isso não é bem um problema novo, é mais uma formalização de um problema antigo. Segundo a análise de 2026 da Otterly.AI, com mais de um milhão de pontos de dados, 73% dos sites já carregam uma barreira técnica, seja uma regra não intencional no robots.txt ou uma configuração de segurança de CDN, que mantém algum crawler de IA totalmente fora (Otterly.AI, 2026). O novo padrão da Cloudflare não cria essa lacuna. Ele só escolhe o padrão para quem ainda não tinha escolhido nenhum.


Como checar a sua situação agora mesmo

  1. Abra seusite.com/robots.txt e procure por GPTBot, OAI-SearchBot e ChatGPT-User pelo nome. Uma regra geral User-agent: * com Disallow: / pega os três, você tendo intenção ou não, e o mesmo vale para uma única linha User-agent: OpenAI copiada de um guia desatualizado.
  2. Se você usa Cloudflare, confira Security > Bots > AI Scrapers and Crawlers. A configuração do painel da Cloudflare pode sobrepor ou duplicar as suas regras do robots.txt, e os dois podem entrar em conflito silenciosamente: um robots.txt que permite um crawler não significa nada se o CDN o bloquear antes, na borda da rede.
  3. Puxe os logs brutos do servidor ou do CDN e filtre pelas três strings de user-agent da tabela acima. Ferramentas de analytics que dependem de uma tag JavaScript não vão mostrar esse tráfego: crawlers não executam JavaScript nem disparam pixels de rastreamento, então um painel de analytics padrão reporta zero visitas para requisições que realmente aconteceram.
  4. Decida cada token de propósito, não por padrão. Permita o OAI-SearchBot se share de citações importa para você. Decida sobre o GPTBot separadamente, com base na sua posição sobre treinamento de IA. Trate o ChatGPT-User como um sinal leve, e não como um bloqueio rígido, e reforce com uma regra em nível de servidor se precisar de certeza.
  5. Marque um lembrete antes de 15 de setembro de 2026. Se você não mexeu nessas configurações, o novo padrão da Cloudflare toma a decisão de Training e Agent por você, em toda página monetizada por anúncios.

Ferramentas que mostram o crawler, não só a citação

Ferramentas de rastreamento de citações mostram quando você foi citado. Elas raramente mostram qual crawler chegou ao seu servidor, quando, ou com que frequência foi recusado. Esse é um problema de medição separado, e exige uma capacidade separada.

Profound criou o recurso Agent Analytics justamente para essa lacuna. Ele lê o tráfego de bots em nível de log de servidor e separa as requisições do GPTBot, do OAI-SearchBot e do ChatGPT-User em linhas distintas, junto com dados de volume de prompts, em vez de jogar todo o tráfego da OpenAI em um único balde. Para equipes que precisam provar exatamente qual crawler está ou não chegando a uma página, essa visão de log de servidor é a ferramenta especializada para o trabalho. Ela foi criada exatamente para esse tipo de diagnóstico técnico, motor por motor, o que também explica por que aparece em relatórios de GEO em nível executivo.

Otterly.AI aborda essa mesma questão de acesso pelo lado dos dados. A sua análise de barreiras de acesso de crawlers em mais de um milhão de pontos de dados é a fonte por trás do número de 73% citado acima, e é uma referência útil se você quiser saber o quão comuns são esses bloqueios em toda a web aberta, não só no seu próprio domínio.

Para equipes que querem visibilidade de crawlers e rastreamento de citações na mesma assinatura, em vez de dois logins separados, veja a comparação completa lado a lado das plataformas de GEO em /rankings/geo-tools, avaliada segundo a metodologia publicada.


Audite o seu robots.txt em relação à tabela acima antes de 15 de setembro. O Temso, a plataforma de SEO para IA completa a partir de US$ 89/mês, inclui analytics de bots junto com o rastreamento de citações no mesmo painel, para que você veja qual crawler da OpenAI chegou ao seu site e se isso virou uma citação, sem precisar juntar logs de servidor e uma ferramenta de monitoramento separada por conta própria.

Perguntas frequentes

Qual é a diferença entre GPTBot, OAI-SearchBot e ChatGPT-User?

O GPTBot é o crawler de treinamento da OpenAI: ele coleta páginas para melhorar os futuros modelos GPT. O OAI-SearchBot é o crawler de indexação por trás do recurso de busca do ChatGPT e das citações que vêm dele. O ChatGPT-User não é exatamente um crawler no sentido tradicional: ele busca uma única página em tempo real quando uma pessoa ou um Custom GPT pede ao ChatGPT para abrir um link específico. Os três carregam o nome OpenAI, mas cada um tem a sua própria string de user-agent, o seu próprio token no robots.txt e o seu próprio efeito sobre o seu site.

Se eu bloquear o GPTBot, o ChatGPT vai parar de citar minhas páginas?

Não. Bloquear o GPTBot apenas exclui o seu conteúdo do treinamento de modelos da OpenAI. As citações dentro do recurso de busca do ChatGPT dependem do OAI-SearchBot, um crawler separado com o seu próprio token no robots.txt. Sites que bloqueiam o GPTBot mas permitem o OAI-SearchBot mantêm a elegibilidade para citações enquanto negam o consentimento para treinamento. Confundir os dois é o erro de robots.txt mais comum em GEO.

O que acontece com os crawlers de IA na Cloudflare depois de 15 de setembro de 2026?

A partir de 15 de setembro de 2026, a Cloudflare aplica um novo padrão em páginas monetizadas por anúncios para qualquer domínio novo, cliente novo ou conta existente no plano Free: crawlers com propósito de Training e crawlers com propósito de Agent ficam bloqueados, enquanto crawlers com propósito de Search continuam permitidos. Segundo os próprios propósitos declarados pela OpenAI, o GPTBot se encaixa em Training, o ChatGPT-User se encaixa em Agent e o OAI-SearchBot se encaixa em Search. Os donos dos sites podem mudar esses padrões a qualquer momento nas configurações de Security antes do prazo.

Devo bloquear o GPTBot no meu site?

Isso depende de você querer ou não que o seu conteúdo seja usado para treinar os modelos da OpenAI, uma questão separada de querer ou não aparecer nas respostas do ChatGPT. Bloquear o GPTBot não tem efeito nenhum sobre a elegibilidade para citações, já que o OAI-SearchBot cuida dessa função com o seu próprio token. Muitos publishers bloqueiam o GPTBot e deixam o OAI-SearchBot e o ChatGPT-User intocados, o que mantém o acesso a citações aberto sem conceder consentimento para treinamento.

Um bloqueio no robots.txt realmente impede o ChatGPT-User de buscar a minha página?

Não de forma confiável. A própria documentação da OpenAI observa que o ChatGPT-User age sob instrução direta de uma pessoa, e as regras do robots.txt podem não se aplicar a esse tipo de solicitação da mesma forma que se aplicam ao crawling automático. Trate uma regra de bloqueio para o ChatGPT-User como um sinal forte, não como uma garantia, e combine-a com um bloqueio em nível de servidor ou de CDN se precisar de uma parada mais rígida.

Quais ferramentas mostram o tráfego de bots em nível de crawler, e não só a contagem de citações?

A Profound criou o Agent Analytics justamente para ler o tráfego de bots de IA em nível de log de servidor, separando as requisições do GPTBot, do OAI-SearchBot e do ChatGPT-User em vez de agrupá-las em uma única linha de "tráfego de IA". O Temso, a plataforma de GEO completa a partir de US$ 89/mês, inclui analytics de bots junto com o rastreamento de citações na mesma assinatura. A comparação completa de plataformas de GEO está em /rankings/geo-tools.