Robôs de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended): como liberar ou bloquear no robots.txt
O time de marketing passa três meses produzindo conteúdo para aparecer no ChatGPT e não aparece. Alguém abre o robots.txt e está tudo liberado. O problema estava um andar abaixo: o Cloudflare barrava os robôs de IA desde o dia em que o domínio foi configurado, e ninguém lembrava de ter marcado a opção. Este guia mostra quem é quem entre os robôs de IA, a sintaxe por robô, os bloqueios que acontecem fora do robots.txt e como provar que o acesso está liberado.
O que são robôs de IA
Robôs de IA são crawlers como o Googlebot, só que de empresas de IA. O robots.txt continua sendo a forma padrão de dizer a eles o que podem ler: um arquivo de texto na raiz do site, com regras por nome de robô, padronizado em 2022 na RFC 9309.[1] Se você precisa do básico (Disallow errado, CSS bloqueado, sitemap), comece por Como corrigir bloqueios no robots.txt. Aqui o assunto é outro: quem é quem entre os robôs de IA e como decidir robô por robô.
As três funções, que decidem tudo
- Treino. Coleta páginas para treinar os próximos modelos. Bloquear significa “não use meu conteúdo para treinar”. Não tira você das respostas com link.
- Busca. Indexa páginas para o assistente citar com link quando alguém pergunta. Bloquear significa sumir das respostas daquele assistente.
- Usuário. Abre uma página específica porque alguém pediu numa conversa (“resuma este link”, “compare estes dois sites”). Como é pedido de uma pessoa, esses agentes em geral não seguem o robots.txt.
Misturar as três é a origem de quase todo erro. Quem bloqueia “o ChatGPT” inteiro para não alimentar treino também some das respostas de busca do ChatGPT.
Quem é quem
| Empresa | Robô (nome no robots.txt) | Função | Segue o robots.txt? | Fonte |
|---|---|---|---|---|
| OpenAI | GPTBot | treino de modelos | sim | [2] |
| OpenAI | OAI-SearchBot | busca do ChatGPT (citações com link) | sim; mudança leva ~24 h para valer | [2] |
| OpenAI | ChatGPT-User | ação pedida pelo usuário no ChatGPT e em GPTs | as regras podem não se aplicar | [2] |
| OpenAI | OAI-AdsBot | checa páginas enviadas como anúncio no ChatGPT | não; só visita páginas de anúncio | [2] |
| Anthropic | ClaudeBot | coleta para treino e segurança dos modelos | sim; aceita Crawl-delay | [3] |
| Anthropic | Claude-SearchBot | qualidade dos resultados de busca do Claude | sim | [3] |
| Anthropic | Claude-User | acesso à web pedido pelo usuário numa conversa | a Anthropic orienta bloquear pelo robots.txt | [3] |
| Perplexity | PerplexityBot | busca e links no Perplexity; não treina modelo | sim | [4] |
| Perplexity | Perplexity-User | abre página para responder ao usuário | em geral ignora | [4] |
Googlebot | Busca, incluindo AI Overviews e AI Mode | sim | [5] | |
Google-Extended | não é robô: token que controla treino do Gemini e grounding em apps do Gemini e na Vertex AI | sim; não afeta a Busca | [6] | |
Google-Agent e outros fetchers a pedido do usuário | agentes e ferramentas acionados por alguém | em geral ignoram | [7] | |
| Apple | Applebot / Applebot-Extended | busca (Siri, Spotlight, Safari) / token de treino, não rastreia | sim | [8] |
| Meta | meta-externalagent / meta-externalfetcher | treino e indexação / busca a pedido do usuário | sim / pode ignorar | [9] |
| Common Crawl | CCBot | acervo aberto da web, muito usado em pesquisa e treino | sim | [10] |
| Microsoft | Bingbot | índice do Bing, que alimenta o Copilot | sim; uso no Copilot se controla por meta tag | [11] |
Duas linhas dessa tabela valem uma página inteira:
- Google-Extended não tira ninguém do AI Overview. O Google diz que ele não afeta a inclusão na Busca nem é sinal de ranking,[6] e que os recursos de IA da Busca respondem ao próprio Googlebot e aos controles de snippet.[5] Os detalhes estão em AI Overviews.
- O Bing não tem robô de IA separado. O Copilot usa o índice do Bing. Para limitar o uso no Copilot, a Microsoft usa meta tags:
NOCACHEdeixa usar só URL, título e snippet;NOARCHIVEtira a página das respostas e do treino.[11]
E é aqui que o bloqueio errado vira dinheiro perdido: ele é invisível. Nenhum alerta, nenhum erro no Search Console, nenhuma queda que alguém associe. A empresa só deixa de ser citada quando o comprador pergunta à IA quem resolve o problema dele.
Como funciona o robots.txt para robôs de IA
Seis regras da RFC 9309 decidem o comportamento de qualquer robô educado:[1]
- O nome do robô é comparado sem diferenciar maiúscula de minúscula.
- Se existe um grupo com o nome do robô, ele usa só esse grupo e ignora o
User-agent: *. O grupo*vale só para quem não tem grupo próprio. - Entre
AlloweDisallow, vale a regra mais específica (a de caminho mais longo). No empate, vence oAllow. - O robô não deve usar a cópia em cache do arquivo por mais de 24 horas.
- Se o robots.txt responde erro 4xx, o robô pode acessar tudo. Se responde 5xx, deve assumir bloqueio total.
- O robots.txt não é controle de acesso. É um pedido que o robô educado respeita.
A configuração mais comum para empresa B2B que quer ser citada é liberar busca e bloquear treino:
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
Disallow: /wp-admin/
# Treino de modelo: bloqueado
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /
# Todos os outros (inclui Googlebot e Bingbot)
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://seusite.com.br/sitemap_index.xml
Uma nota sobre ritmo: o Google não suporta Crawl-delay,[12] e a Anthropic suporta para o ClaudeBot.[3] Só use se o servidor sofrer com o volume.
Quando o bloqueio não está no robots.txt
O arquivo pode estar perfeito e o robô ser barrado antes de chegar nele, ou entrar e não encontrar nada para ler. São os dois bloqueios que mais escapam de auditoria.
Cloudflare e WAF
O Cloudflare atende cerca de um quinto do tráfego da web,[13] e a política dele para robôs de IA mudou várias vezes:
- Até julho de 2025, mais de 1 milhão de clientes já tinham ligado a opção de um clique para bloquear robôs de IA.[13]
- Em 01/07/2025, todo domínio novo passou a ser perguntado, no cadastro, se quer permitir robôs de IA, e o padrão virou bloqueio a menos que o dono libere.[13]
- Em 01/07/2026, o controle passou a ser por categoria, Search, Agent e Training, inclusive no plano gratuito.[14]
- Em 15/09/2026, domínios novos passaram a nascer com Training e Agent bloqueados nas páginas que exibem anúncio e Search liberado. A opção antiga “Block AI bots” foi descontinuada nessa data.[14][15]
Existe ainda o robots.txt gerenciado do Cloudflare. Quando ligado, ele acrescenta, antes do seu arquivo, regras de Disallow para Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot e meta-externalagent, além de uma linha de sinais de conteúdo (search=yes, ai-train=no).[16] Resultado: o robots.txt do repositório não é o que o robô recebe. Confira sempre o arquivo servido em seusite.com.br/robots.txt.
Onde procurar no painel: Security Settings › Configure AI bot policies,[15] regras de WAF personalizadas, Bot Fight Mode e o robots.txt gerenciado. Outros WAFs e hospedagens gerenciadas têm opções equivalentes com outros nomes. O próprio Google lembra que o rastreamento precisa estar liberado no robots.txt e em qualquer CDN ou infraestrutura de hospedagem.[5]
Conteúdo que só existe depois do JavaScript
O robô foi liberado, entrou e leu uma página vazia. Acontece quando o texto é montado no navegador: site em React ou Vue sem renderização no servidor, construtor visual que injeta o conteúdo, preço e FAQ carregados por API. O Googlebot renderiza JavaScript. No levantamento da Vercel de 2024, nenhum dos grandes robôs de IA (OpenAI, Anthropic, Meta, ByteDance, Perplexity) executava JavaScript: alguns até baixavam os arquivos .js, mas não rodavam.[17] É um retrato daquele ano e o comportamento pode mudar. O caminho seguro continua sendo o texto no HTML inicial.
O teste é simples: rode curl https://seusite.com.br/pagina/ ou abra a página com JavaScript desligado e procure o texto principal. Se não estiver no HTML, para a maioria dos robôs de IA ele não existe. A correção é renderizar no servidor ou gerar estático o que importa (veja CSR, SSR e ISR).
Números de referência
| Fato | Número | Fonte |
|---|---|---|
| Tempo para o OAI-SearchBot reconhecer mudança no robots.txt | ~24 horas | OpenAI[2] |
| Cache máximo recomendado do robots.txt | 24 horas | RFC 9309[1] |
| Tamanho mínimo do arquivo que o robô deve ler | 500 KiB | RFC 9309[1] |
| Clientes Cloudflare com bloqueio de robôs de IA ligado até jul/2025 | mais de 1 milhão | Cloudflare, 2025[13] |
| Parcela do tráfego web que passa pelo Cloudflare | cerca de 1/5 | Cloudflare, 2025[13] |
| Grandes robôs de IA que executavam JavaScript (2024) | nenhum | Vercel, 2024[17] |
Como implementar na prática
Onde a configuração costuma estar
seusite.com.br/robots.txt, lido do domínio público, não do repositório. É ali que aparece o que o Cloudflare acrescenta.
openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json), Anthropic (claude.com/crawling/bots.json), Perplexity (perplexity.com/perplexitybot.json), Common Crawl (index.commoncrawl.org/ccbot.json). Separam o robô verdadeiro do impostor que só copia o nome.
Quem precisa entrar
- 1 Decida a política por função, não por empresa. Treino: liberar ou bloquear? Busca: liberar, se você quer ser citado. Usuário: normalmente não se controla por robots.txt. Registre a decisão e o motivo.
- 2 Leia o robots.txt servido. Abra o arquivo no navegador, procure grupos com nome de robô de IA e confira se o Cloudflare está acrescentando regras.
- 3 Confira a CDN e o WAF. Políticas por categoria (Search, Agent, Training), regras personalizadas que barram user agent e Bot Fight Mode. Ajuste para bater com a política do passo 1.
-
4
Escreva os grupos por robô, repetindo em cada grupo próprio as restrições do
*(regra 2 da RFC). -
5
Garanta que o conteúdo está no HTML. Teste com
curlou com JavaScript desligado nas páginas que vendem. -
6
Teste o acesso.
curl -A "OAI-SearchBot" -I https://seusite.com.br/mostra se uma regra por user agent devolve 403. Como o Cloudflare verifica robôs pelo IP, um curl com nome falso pode ser tratado diferente do robô real: a prova final é o robô verdadeiro, com IP da lista oficial, recebendo 200 no log. - 7 Acompanhe. Depois de cerca de 24 horas, confira nos logs a volta dos robôs de busca e, nas semanas seguintes, as citações no Bing AI Performance e o tráfego do canal AI Assistant do GA4, criado em maio de 2026.[19]
Armadilhas comuns
Quando auditamos sites B2B, o robots.txt raramente é o culpado sozinho. Estes são os padrões que mais aparecem.
Bloquear “o ChatGPT” e sumir da busca do ChatGPT
Alguém lê que dá para impedir a IA de usar o conteúdo e coloca Disallow: / para GPTBot, OAI-SearchBot e ChatGPT-User juntos. O treino foi bloqueado, como queria. Só que a OpenAI avisa: site fora do OAI-SearchBot não aparece nas respostas de busca do ChatGPT, no máximo como link de navegação.[2] As configurações são independentes, e bloquear treino liberando busca é perfeitamente possível.
robots.txt liberado, Cloudflare bloqueando
A armadilha da abertura. O arquivo está impecável e o robô leva 403 antes de lê-lo, porque alguém ligou o bloqueio de um clique, respondeu “bloquear” no cadastro do domínio ou herdou uma regra de WAF de outro projeto. Nenhum relatório do Google mostra isso, porque o Googlebot passa. Só o log e o painel da CDN mostram. Com o controle por categoria de 2026, confira as três: com Search liberado e Agent bloqueado, o assistente não consegue abrir a sua página quando um usuário pede, numa conversa, para ler ou comparar o seu site.
Grupo próprio que apaga as regras do asterisco
O dev adiciona User-agent: GPTBot e Allow: / para liberar a IA e acha que as restrições de /wp-admin/, /carrinho/ e /busca? continuam valendo. Não continuam: pela RFC, o robô com grupo próprio ignora o *.[1] Ele passa a rastrear área de admin, busca interna e URL com parâmetro, gastando visita em lixo.
Bloquear Google-Extended para sair do AI Overview
Não funciona. O Google-Extended não afeta a Busca,[6] e o AI Overview é Busca. Quem quer limitar o resumo precisa usar os controles de snippet ou o controle de IA generativa do Search Console, liberado para todos os sites em 31/08/2026,[20] sabendo que perde visibilidade nesses recursos.
Robô liberado lendo página vazia
Tudo certo no robots.txt e no Cloudflare, mas o site é uma aplicação JavaScript que entrega HTML sem texto. O robô de IA entra, não executa o script e registra uma página vazia.[17] No navegador de quem olha, o site está perfeito. É o bloqueio mais silencioso de todos.
Tratar robots.txt como segurança
Área de cliente, proposta em PDF, material de assinante “protegido” por Disallow. A RFC é explícita: robots.txt não é autorização de acesso.[1] E os agentes a pedido do usuário (ChatGPT-User, Perplexity-User, Google-Agent) em geral nem consultam o arquivo.[2][4][7] O que é privado precisa de login. Pior: listar o caminho no robots.txt anuncia para qualquer um onde está o que você quer esconder.
robots.txt fora do ar derrubando tudo
Servidor instável, plugin que quebra o arquivo, redirecionamento em loop. Se o robots.txt responde erro 5xx, a RFC manda o robô assumir bloqueio total.[1] Um arquivo de poucos bytes fora do ar tira o site de todos os robôs educados de uma vez.
Checklist de implementação
FAQ
Perguntas frequentes sobre robôs de IA
As dúvidas que mais aparecem de quem precisa decidir o que liberar.
Descubra se o seu site está trancado para a IA
Bloqueio de robô não dá erro nem alerta: a empresa só deixa de ser citada. O Diagnóstico grátis do site verifica se os robôs de IA conseguem ler o seu site e aponta o que trava a descoberta. Se o problema estiver na CDN, no WAF ou em conteúdo que depende de JavaScript, o time de serviços da Incuca corrige. Depois de liberar, o próximo passo é aparecer nas respostas (veja GEO), medir se a liberação virou citação (Visibilidade em IA) e não confundir o robots.txt com o llms.txt.
Referências
- [1] Koster, M.; Illyes, G.; Zeller, H.; Sassman, L. RFC 9309: Robots Exclusion Protocol. IETF, set. 2022. https://www.rfc-editor.org/rfc/rfc9309.html
- [2] OpenAI. Overview of OpenAI Crawlers. 2026. https://developers.openai.com/api/docs/bots
- [3] Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? Claude Help Center. https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- [4] Perplexity. Perplexity Crawlers. https://docs.perplexity.ai/guides/bots
- [5] Google Search Central. AI features and your website. https://developers.google.com/search/docs/appearance/ai-features
- [6] Google Search Central. Google's common crawlers (Google-Extended). https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
- [7] Google Search Central. Google's user-triggered fetchers. https://developers.google.com/search/docs/crawling-indexing/google-user-triggered-fetchers
- [8] Apple. About Applebot. https://support.apple.com/en-us/119829
- [9] Meta. Meta Web Crawlers. https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/
- [10] Common Crawl. CCBot. https://commoncrawl.org/ccbot
- [11] Microsoft Bing. Announcing new options for webmasters to control usage of their content in Bing Chat. Bing Webmaster Blog, set. 2023. https://blogs.bing.com/webmaster/september-2023/Announcing-new-options-for-webmasters-to-control-usage-of-their-content-in-Bing-Chat
- [12] Google Search Central. How Google interprets the robots.txt specification. https://developers.google.com/search/docs/crawling-indexing/robots/robots_txt
- [13] Cloudflare. Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large; Permission-Based Approach Makes Way for A New Business Model. Press release, 01/07/2025. https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/
- [14] Cloudflare. Your site, your rules: new AI traffic options for all customers. Cloudflare Blog, 01/07/2026. https://blog.cloudflare.com/content-independence-day-ai-options/
- [15] Cloudflare Docs. Block AI bots. https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
- [16] Cloudflare Docs. Managed robots.txt. https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/
- [17] Vercel. The rise of the AI crawler. 17/12/2024 (tráfego da rede da Vercel em 2024). https://vercel.com/blog/the-rise-of-the-ai-crawler
- [18] Microsoft Bing. Introducing AI Performance in Bing Webmaster Tools (Public Preview). Bing Webmaster Blog, fev. 2026. https://blogs.bing.com/webmaster/February-2026/Introducing-AI-Performance-in-Bing-Webmaster-Tools-Public-Preview
- [19] Google. [GA4] Default channel group — canal AI Assistant (novidade de 13/05/2026). Analytics Help. https://support.google.com/analytics/answer/9756891
- [20] Google. Search generative AI control. Search Console Help, 2026. https://support.google.com/webmasters/answer/16908024