Robôs de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended): como liberar ou bloquear no robots.txt

O time de marketing passa três meses produzindo conteúdo para aparecer no ChatGPT e não aparece. Alguém abre o robots.txt e está tudo liberado. O problema estava um andar abaixo: o Cloudflare barrava os robôs de IA desde o dia em que o domínio foi configurado, e ninguém lembrava de ter marcado a opção. Este guia mostra quem é quem entre os robôs de IA, a sintaxe por robô, os bloqueios que acontecem fora do robots.txt e como provar que o acesso está liberado.

Também chamados:
crawlers de IA, bots de IA, user agents de IA
Natureza:
configuração (robots.txt, CDN, WAF), não métrica
Cadência:
conferência trimestral e a cada troca de CDN, WAF, tema ou plugin de SEO
Resposta rápida
Robôs de IA são os programas que as empresas de IA usam para ler o seu site, e eles têm três funções: treino (GPTBot, ClaudeBot, Google-Extended), busca para responder com link (OAI-SearchBot, Claude-SearchBot, PerplexityBot) e ação a pedido do usuário (ChatGPT-User, Claude-User, Perplexity-User). Cada um se controla no robots.txt pelo nome, e as regras são independentes: dá para bloquear treino e liberar busca. Duas coisas bloqueiam sem aparecer no robots.txt: a política de bots de IA do Cloudflare ou do WAF, e conteúdo que só existe depois do JavaScript.

O que são robôs de IA

Robôs de IA são crawlers como o Googlebot, só que de empresas de IA. O robots.txt continua sendo a forma padrão de dizer a eles o que podem ler: um arquivo de texto na raiz do site, com regras por nome de robô, padronizado em 2022 na RFC 9309.[1] Se você precisa do básico (Disallow errado, CSS bloqueado, sitemap), comece por Como corrigir bloqueios no robots.txt. Aqui o assunto é outro: quem é quem entre os robôs de IA e como decidir robô por robô.

As três funções, que decidem tudo

  1. Treino. Coleta páginas para treinar os próximos modelos. Bloquear significa “não use meu conteúdo para treinar”. Não tira você das respostas com link.
  2. Busca. Indexa páginas para o assistente citar com link quando alguém pergunta. Bloquear significa sumir das respostas daquele assistente.
  3. Usuário. Abre uma página específica porque alguém pediu numa conversa (“resuma este link”, “compare estes dois sites”). Como é pedido de uma pessoa, esses agentes em geral não seguem o robots.txt.

Misturar as três é a origem de quase todo erro. Quem bloqueia “o ChatGPT” inteiro para não alimentar treino também some das respostas de busca do ChatGPT.

Quem é quem

EmpresaRobô (nome no robots.txt)FunçãoSegue o robots.txt?Fonte
OpenAIGPTBottreino de modelossim[2]
OpenAIOAI-SearchBotbusca do ChatGPT (citações com link)sim; mudança leva ~24 h para valer[2]
OpenAIChatGPT-Useração pedida pelo usuário no ChatGPT e em GPTsas regras podem não se aplicar[2]
OpenAIOAI-AdsBotcheca páginas enviadas como anúncio no ChatGPTnão; só visita páginas de anúncio[2]
AnthropicClaudeBotcoleta para treino e segurança dos modelossim; aceita Crawl-delay[3]
AnthropicClaude-SearchBotqualidade dos resultados de busca do Claudesim[3]
AnthropicClaude-Useracesso à web pedido pelo usuário numa conversaa Anthropic orienta bloquear pelo robots.txt[3]
PerplexityPerplexityBotbusca e links no Perplexity; não treina modelosim[4]
PerplexityPerplexity-Userabre página para responder ao usuárioem geral ignora[4]
GoogleGooglebotBusca, incluindo AI Overviews e AI Modesim[5]
GoogleGoogle-Extendednão é robô: token que controla treino do Gemini e grounding em apps do Gemini e na Vertex AIsim; não afeta a Busca[6]
GoogleGoogle-Agent e outros fetchers a pedido do usuárioagentes e ferramentas acionados por alguémem geral ignoram[7]
AppleApplebot / Applebot-Extendedbusca (Siri, Spotlight, Safari) / token de treino, não rastreiasim[8]
Metameta-externalagent / meta-externalfetchertreino e indexação / busca a pedido do usuáriosim / pode ignorar[9]
Common CrawlCCBotacervo aberto da web, muito usado em pesquisa e treinosim[10]
MicrosoftBingbotíndice do Bing, que alimenta o Copilotsim; uso no Copilot se controla por meta tag[11]
Nomes e funções conforme a documentação de cada empresa. Confira a fonte antes de mudar a política: as listas mudam.

Duas linhas dessa tabela valem uma página inteira:

  • Google-Extended não tira ninguém do AI Overview. O Google diz que ele não afeta a inclusão na Busca nem é sinal de ranking,[6] e que os recursos de IA da Busca respondem ao próprio Googlebot e aos controles de snippet.[5] Os detalhes estão em AI Overviews.
  • O Bing não tem robô de IA separado. O Copilot usa o índice do Bing. Para limitar o uso no Copilot, a Microsoft usa meta tags: NOCACHE deixa usar só URL, título e snippet; NOARCHIVE tira a página das respostas e do treino.[11]

E é aqui que o bloqueio errado vira dinheiro perdido: ele é invisível. Nenhum alerta, nenhum erro no Search Console, nenhuma queda que alguém associe. A empresa só deixa de ser citada quando o comprador pergunta à IA quem resolve o problema dele.

Como funciona o robots.txt para robôs de IA

Seis regras da RFC 9309 decidem o comportamento de qualquer robô educado:[1]

  1. O nome do robô é comparado sem diferenciar maiúscula de minúscula.
  2. Se existe um grupo com o nome do robô, ele usa só esse grupo e ignora o User-agent: *. O grupo * vale só para quem não tem grupo próprio.
  3. Entre Allow e Disallow, vale a regra mais específica (a de caminho mais longo). No empate, vence o Allow.
  4. O robô não deve usar a cópia em cache do arquivo por mais de 24 horas.
  5. Se o robots.txt responde erro 4xx, o robô pode acessar tudo. Se responde 5xx, deve assumir bloqueio total.
  6. O robots.txt não é controle de acesso. É um pedido que o robô educado respeita.

A configuração mais comum para empresa B2B que quer ser citada é liberar busca e bloquear treino:

robots.txt · liberar busca, bloquear treino
# Busca e respostas com link: liberado
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
Disallow: /wp-admin/

# Treino de modelo: bloqueado
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /

# Todos os outros (inclui Googlebot e Bingbot)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://seusite.com.br/sitemap_index.xml
Repare no Disallow: /wp-admin/ repetido no grupo de busca. Sem ele, o OAI-SearchBot, que agora tem grupo próprio, ignoraria o * e poderia rastrear o painel (regra 2). Quem cria grupo por robô precisa repetir nele as restrições do *. Várias linhas User-agent seguidas com as mesmas regras são permitidas pela RFC. Para liberar tudo, inclusive treino, basta não citar nenhum robô de IA e manter só o grupo *.

Uma nota sobre ritmo: o Google não suporta Crawl-delay,[12] e a Anthropic suporta para o ClaudeBot.[3] Só use se o servidor sofrer com o volume.

Quando o bloqueio não está no robots.txt

O arquivo pode estar perfeito e o robô ser barrado antes de chegar nele, ou entrar e não encontrar nada para ler. São os dois bloqueios que mais escapam de auditoria.

Cloudflare e WAF

O Cloudflare atende cerca de um quinto do tráfego da web,[13] e a política dele para robôs de IA mudou várias vezes:

  1. Até julho de 2025, mais de 1 milhão de clientes já tinham ligado a opção de um clique para bloquear robôs de IA.[13]
  2. Em 01/07/2025, todo domínio novo passou a ser perguntado, no cadastro, se quer permitir robôs de IA, e o padrão virou bloqueio a menos que o dono libere.[13]
  3. Em 01/07/2026, o controle passou a ser por categoria, Search, Agent e Training, inclusive no plano gratuito.[14]
  4. Em 15/09/2026, domínios novos passaram a nascer com Training e Agent bloqueados nas páginas que exibem anúncio e Search liberado. A opção antiga “Block AI bots” foi descontinuada nessa data.[14][15]

Existe ainda o robots.txt gerenciado do Cloudflare. Quando ligado, ele acrescenta, antes do seu arquivo, regras de Disallow para Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot e meta-externalagent, além de uma linha de sinais de conteúdo (search=yes, ai-train=no).[16] Resultado: o robots.txt do repositório não é o que o robô recebe. Confira sempre o arquivo servido em seusite.com.br/robots.txt.

Onde procurar no painel: Security Settings › Configure AI bot policies,[15] regras de WAF personalizadas, Bot Fight Mode e o robots.txt gerenciado. Outros WAFs e hospedagens gerenciadas têm opções equivalentes com outros nomes. O próprio Google lembra que o rastreamento precisa estar liberado no robots.txt e em qualquer CDN ou infraestrutura de hospedagem.[5]

Conteúdo que só existe depois do JavaScript

O robô foi liberado, entrou e leu uma página vazia. Acontece quando o texto é montado no navegador: site em React ou Vue sem renderização no servidor, construtor visual que injeta o conteúdo, preço e FAQ carregados por API. O Googlebot renderiza JavaScript. No levantamento da Vercel de 2024, nenhum dos grandes robôs de IA (OpenAI, Anthropic, Meta, ByteDance, Perplexity) executava JavaScript: alguns até baixavam os arquivos .js, mas não rodavam.[17] É um retrato daquele ano e o comportamento pode mudar. O caminho seguro continua sendo o texto no HTML inicial.

O teste é simples: rode curl https://seusite.com.br/pagina/ ou abra a página com JavaScript desligado e procure o texto principal. Se não estiver no HTML, para a maioria dos robôs de IA ele não existe. A correção é renderizar no servidor ou gerar estático o que importa (veja CSR, SSR e ISR).

Números de referência

FatoNúmeroFonte
Tempo para o OAI-SearchBot reconhecer mudança no robots.txt~24 horasOpenAI[2]
Cache máximo recomendado do robots.txt24 horasRFC 9309[1]
Tamanho mínimo do arquivo que o robô deve ler500 KiBRFC 9309[1]
Clientes Cloudflare com bloqueio de robôs de IA ligado até jul/2025mais de 1 milhãoCloudflare, 2025[13]
Parcela do tráfego web que passa pelo Cloudflarecerca de 1/5Cloudflare, 2025[13]
Grandes robôs de IA que executavam JavaScript (2024)nenhumVercel, 2024[17]
O dado da Vercel é da rede dela em 2024: trate como direcional e confira nos seus logs.

Como implementar na prática

Política de robô é decisão de negócio escrita em arquivo técnico. O erro quase nunca é de sintaxe: é alguém ter decidido “bloquear a IA” sem separar treino de busca, ou a CDN ter decidido sozinha. O trabalho é decidir por função, conferir o que o robô realmente recebe e provar no log.

Onde a configuração costuma estar

robots.txt servido seusite.com.br/robots.txt, lido do domínio público, não do repositório. É ali que aparece o que o Cloudflare acrescenta.
CDN / WAF Painel do Cloudflare ou equivalente: políticas de bots de IA por categoria, regras de WAF, Bot Fight Mode, robots.txt gerenciado e log de eventos de segurança.
Logs do servidor ou da CDN Quais robôs passaram, em que páginas e com que status HTTP (200, 403, 404).
Listas oficiais de IP OpenAI (openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json), Anthropic (claude.com/crawling/bots.json), Perplexity (perplexity.com/perplexitybot.json), Common Crawl (index.commoncrawl.org/ccbot.json). Separam o robô verdadeiro do impostor que só copia o nome.
Search Console e Bing Webmaster Tools Relatório de robots.txt e Inspeção de URL (o HTML que o Googlebot recebeu); testador de robots.txt e relatório AI Performance do Bing, com as citações no Copilot.[18]

Quem precisa entrar

Liderança / marketing Decide a política: treino sim ou não; busca sim, quase sempre. É decisão de negócio, não de TI.
Dev / infraestrutura Escreve o robots.txt, configura CDN e WAF e garante HTML renderizado no servidor.
SEO Confere o arquivo servido, os logs e os relatórios do Google e do Bing.
Jurídico Quando há conteúdo licenciado ou pago, define o que não pode ir para treino.
  1. 1 Decida a política por função, não por empresa. Treino: liberar ou bloquear? Busca: liberar, se você quer ser citado. Usuário: normalmente não se controla por robots.txt. Registre a decisão e o motivo.
  2. 2 Leia o robots.txt servido. Abra o arquivo no navegador, procure grupos com nome de robô de IA e confira se o Cloudflare está acrescentando regras.
  3. 3 Confira a CDN e o WAF. Políticas por categoria (Search, Agent, Training), regras personalizadas que barram user agent e Bot Fight Mode. Ajuste para bater com a política do passo 1.
  4. 4 Escreva os grupos por robô, repetindo em cada grupo próprio as restrições do * (regra 2 da RFC).
  5. 5 Garanta que o conteúdo está no HTML. Teste com curl ou com JavaScript desligado nas páginas que vendem.
  6. 6 Teste o acesso. curl -A "OAI-SearchBot" -I https://seusite.com.br/ mostra se uma regra por user agent devolve 403. Como o Cloudflare verifica robôs pelo IP, um curl com nome falso pode ser tratado diferente do robô real: a prova final é o robô verdadeiro, com IP da lista oficial, recebendo 200 no log.
  7. 7 Acompanhe. Depois de cerca de 24 horas, confira nos logs a volta dos robôs de busca e, nas semanas seguintes, as citações no Bing AI Performance e o tráfego do canal AI Assistant do GA4, criado em maio de 2026.[19]

Armadilhas comuns

Quando auditamos sites B2B, o robots.txt raramente é o culpado sozinho. Estes são os padrões que mais aparecem.

Bloquear “o ChatGPT” e sumir da busca do ChatGPT

Alguém lê que dá para impedir a IA de usar o conteúdo e coloca Disallow: / para GPTBot, OAI-SearchBot e ChatGPT-User juntos. O treino foi bloqueado, como queria. Só que a OpenAI avisa: site fora do OAI-SearchBot não aparece nas respostas de busca do ChatGPT, no máximo como link de navegação.[2] As configurações são independentes, e bloquear treino liberando busca é perfeitamente possível.

robots.txt liberado, Cloudflare bloqueando

A armadilha da abertura. O arquivo está impecável e o robô leva 403 antes de lê-lo, porque alguém ligou o bloqueio de um clique, respondeu “bloquear” no cadastro do domínio ou herdou uma regra de WAF de outro projeto. Nenhum relatório do Google mostra isso, porque o Googlebot passa. Só o log e o painel da CDN mostram. Com o controle por categoria de 2026, confira as três: com Search liberado e Agent bloqueado, o assistente não consegue abrir a sua página quando um usuário pede, numa conversa, para ler ou comparar o seu site.

Grupo próprio que apaga as regras do asterisco

O dev adiciona User-agent: GPTBot e Allow: / para liberar a IA e acha que as restrições de /wp-admin/, /carrinho/ e /busca? continuam valendo. Não continuam: pela RFC, o robô com grupo próprio ignora o *.[1] Ele passa a rastrear área de admin, busca interna e URL com parâmetro, gastando visita em lixo.

Bloquear Google-Extended para sair do AI Overview

Não funciona. O Google-Extended não afeta a Busca,[6] e o AI Overview é Busca. Quem quer limitar o resumo precisa usar os controles de snippet ou o controle de IA generativa do Search Console, liberado para todos os sites em 31/08/2026,[20] sabendo que perde visibilidade nesses recursos.

Robô liberado lendo página vazia

Tudo certo no robots.txt e no Cloudflare, mas o site é uma aplicação JavaScript que entrega HTML sem texto. O robô de IA entra, não executa o script e registra uma página vazia.[17] No navegador de quem olha, o site está perfeito. É o bloqueio mais silencioso de todos.

Tratar robots.txt como segurança

Área de cliente, proposta em PDF, material de assinante “protegido” por Disallow. A RFC é explícita: robots.txt não é autorização de acesso.[1] E os agentes a pedido do usuário (ChatGPT-User, Perplexity-User, Google-Agent) em geral nem consultam o arquivo.[2][4][7] O que é privado precisa de login. Pior: listar o caminho no robots.txt anuncia para qualquer um onde está o que você quer esconder.

robots.txt fora do ar derrubando tudo

Servidor instável, plugin que quebra o arquivo, redirecionamento em loop. Se o robots.txt responde erro 5xx, a RFC manda o robô assumir bloqueio total.[1] Um arquivo de poucos bytes fora do ar tira o site de todos os robôs educados de uma vez.

Checklist de implementação

FAQ

Perguntas frequentes sobre robôs de IA

As dúvidas que mais aparecem de quem precisa decidir o que liberar.

O GPTBot coleta para treinar os modelos da OpenAI. O OAI-SearchBot indexa para a busca do ChatGPT, a que cita fonte com link. São configurações independentes.

Não das respostas de busca, desde que o OAI-SearchBot continue liberado. Você só pede que o conteúdo não vá para treino.

Não. Ele não afeta a inclusão na Busca nem o ranking. Controla o uso para treino do Gemini e o grounding em outros produtos do Google.

Não separado. O Copilot usa o índice do Bing. Para limitar o uso nas respostas, a Microsoft usa as meta tags NOCACHE e NOARCHIVE.

Os de treino e de busca das grandes empresas dizem que sim. Os agentes a pedido do usuário, em geral, não. E robô mal-intencionado pode ignorar o arquivo e até se passar por outro; por isso existem as listas oficiais de IP.

A RFC recomenda cache de no máximo 24 horas, e a OpenAI fala em cerca de 24 horas para o OAI-SearchBot. Voltar a aparecer nas respostas pode levar mais, porque a página precisa ser rastreada e indexada de novo.

Não. O llms.txt é outra coisa: um índice sugerido de páginas, sem efeito de liberar ou bloquear robô.

Olhe no painel as políticas de bots de IA por categoria e o log de eventos de segurança filtrado pelo nome dos robôs, e abra o robots.txt servido para ver se o robots.txt gerenciado acrescentou regras.

Descubra se o seu site está trancado para a IA

Bloqueio de robô não dá erro nem alerta: a empresa só deixa de ser citada. O Diagnóstico grátis do site verifica se os robôs de IA conseguem ler o seu site e aponta o que trava a descoberta. Se o problema estiver na CDN, no WAF ou em conteúdo que depende de JavaScript, o time de serviços da Incuca corrige. Depois de liberar, o próximo passo é aparecer nas respostas (veja GEO), medir se a liberação virou citação (Visibilidade em IA) e não confundir o robots.txt com o llms.txt.

Fazer o Diagnóstico grátis do site

Referências

  1. [1] Koster, M.; Illyes, G.; Zeller, H.; Sassman, L. RFC 9309: Robots Exclusion Protocol. IETF, set. 2022. https://www.rfc-editor.org/rfc/rfc9309.html
  2. [2] OpenAI. Overview of OpenAI Crawlers. 2026. https://developers.openai.com/api/docs/bots
  3. [3] Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? Claude Help Center. https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
  4. [4] Perplexity. Perplexity Crawlers. https://docs.perplexity.ai/guides/bots
  5. [5] Google Search Central. AI features and your website. https://developers.google.com/search/docs/appearance/ai-features
  6. [6] Google Search Central. Google's common crawlers (Google-Extended). https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
  7. [7] Google Search Central. Google's user-triggered fetchers. https://developers.google.com/search/docs/crawling-indexing/google-user-triggered-fetchers
  8. [8] Apple. About Applebot. https://support.apple.com/en-us/119829
  9. [9] Meta. Meta Web Crawlers. https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/
  10. [10] Common Crawl. CCBot. https://commoncrawl.org/ccbot
  11. [11] Microsoft Bing. Announcing new options for webmasters to control usage of their content in Bing Chat. Bing Webmaster Blog, set. 2023. https://blogs.bing.com/webmaster/september-2023/Announcing-new-options-for-webmasters-to-control-usage-of-their-content-in-Bing-Chat
  12. [12] Google Search Central. How Google interprets the robots.txt specification. https://developers.google.com/search/docs/crawling-indexing/robots/robots_txt
  13. [13] Cloudflare. Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large; Permission-Based Approach Makes Way for A New Business Model. Press release, 01/07/2025. https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/
  14. [14] Cloudflare. Your site, your rules: new AI traffic options for all customers. Cloudflare Blog, 01/07/2026. https://blog.cloudflare.com/content-independence-day-ai-options/
  15. [15] Cloudflare Docs. Block AI bots. https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
  16. [16] Cloudflare Docs. Managed robots.txt. https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/
  17. [17] Vercel. The rise of the AI crawler. 17/12/2024 (tráfego da rede da Vercel em 2024). https://vercel.com/blog/the-rise-of-the-ai-crawler
  18. [18] Microsoft Bing. Introducing AI Performance in Bing Webmaster Tools (Public Preview). Bing Webmaster Blog, fev. 2026. https://blogs.bing.com/webmaster/February-2026/Introducing-AI-Performance-in-Bing-Webmaster-Tools-Public-Preview
  19. [19] Google. [GA4] Default channel group — canal AI Assistant (novidade de 13/05/2026). Analytics Help. https://support.google.com/analytics/answer/9756891
  20. [20] Google. Search generative AI control. Search Console Help, 2026. https://support.google.com/webmasters/answer/16908024
Lucas Adiers Stefanello

Sobre o autor

Lucas Adiers Stefanello

Fundador e CEO da Incuca, onde junta dados de marketing, vendas e receita para mostrar onde a empresa perde venda. Trabalha com tecnologia para negócios desde 2013 e coordena a Comunidade Incuca.