llms.txt: o que é, para que serve e como montar o do seu site
Você liga o botão llms.txt no plugin de SEO, o arquivo aparece e o site parece pronto para IA. Abra o arquivo. Quase sempre ele lista o post mais recente do blog, duas páginas institucionais e nenhuma página que vende. Este guia cobre o que o arquivo é, o que Google, Chrome e OpenAI dizem de fato sobre ele, a diferença para robots.txt e sitemap, e como montar um que não esquece o que importa.
seusite.com/llms.txt, que resume o que o site é e aponta as páginas que um modelo de IA deveria ler primeiro. Não bloqueia nada (isso é o robots.txt) e não lista tudo (isso é o sitemap): é um índice curado. O Google diz que a Busca não usa o arquivo e que ele não ajuda nem atrapalha o ranqueamento; nenhum grande assistente confirmou que o lê para responder. Montar custa uma hora. Montar errado entrega à IA um retrato falso do seu negócio, assinado por você. O que é o llms.txt
Alguém pergunta se o site “já está pronto para IA”. O time abre o plugin de SEO, liga o gerador de llms.txt e dá o assunto por encerrado. Na maioria das auditorias em que abro esse arquivo, a página que vende não está lá. O arquivo existe, mas descreve outra empresa.
O llms.txt é uma proposta de padrão publicada em llmstxt.org em 3 de setembro de 2024 por Jeremy Howard, cofundador da Answer.AI e da fast.ai.[1] A ideia parte de um problema real: páginas web foram feitas para gente com navegador, cheias de menu, rodapé, script e banner de cookie. Um modelo de linguagem que chega ali para responder uma pergunta gasta contexto com lixo. O llms.txt oferece um atalho: um único arquivo em Markdown, na raiz do site, que diz em poucas linhas o que é aquilo e onde estão as páginas que importam, com links.
A proposta ganhou uma versão 2 em 10 de agosto de 2026.[1] Mudaram três coisas. O arquivo pode morar em subcaminho (/docs/llms.txt) e vale para o que está abaixo dele. As páginas podem ter versão em Markdown, com .md no fim da URL ou no lugar da extensão. E há link relations padrão para um agente achar a versão Markdown (rel="alternate" type="text/markdown") e o próprio llms.txt (rel="describedby").[2]
O que é fato e o que é aposta
É aqui que mora a confusão, então separo em duas listas. Fato, com fonte oficial:
- A Busca do Google não usa. O guia do Google para recursos de IA diz que você não precisa criar arquivos legíveis por máquina, arquivos de texto para IA ou Markdown para aparecer na Busca, inclusive nos recursos generativos, porque a Busca não os usa. Criar não ajuda nem prejudica.[3]
- O Chrome audita o arquivo. O Lighthouse tem uma categoria “Agentic Browsing” com uma auditoria de llms.txt. Ela reprova se o servidor der erro ao entregar o arquivo; se o arquivo não existe (404), marca “não aplicável”, porque ele é opcional.[4]
- Muita documentação técnica publica o seu. A OpenAI mantém
developers.openai.com/llms.txt, e a própria página dos robôs da OpenAI remete a ele como índice da documentação.[5] Plataformas de documentação e plugins de WordPress, como Yoast e AIOSEO, geram o arquivo sozinhos.[1]
Aposta, sem confirmação oficial:
- Que ChatGPT, Gemini, Perplexity ou Copilot leiam o seu llms.txt para decidir o que citar. Nenhum deles publicou isso. A documentação de robôs da OpenAI fala de OAI-SearchBot, GPTBot, ChatGPT-User e robots.txt; não fala de ler llms.txt de terceiros.[5]
- Que ter o arquivo melhore a citação em IA. Não existe estudo de fonte primária mostrando isso.
Onde ele serve hoje: em agentes e ferramentas que alguém aponta para o seu site de propósito. O desenvolvedor que cola a URL do seu llms.txt no editor de código, o agente de navegação que procura um índice antes de sair clicando, a ferramenta interna que lê a sua documentação. É para esse leitor que a proposta foi escrita: ela espera que agentes busquem o llms.txt para achar a informação de que precisam.[1]
llms.txt × robots.txt × sitemap.xml
São três arquivos na raiz do site e cada um responde uma pergunta diferente. Trocar um pelo outro é o erro mais comum.
| Arquivo | Pergunta que responde | Quem lê | Formato | Tem efeito garantido? |
|---|---|---|---|---|
robots.txt | O que você pode rastrear? | Robôs de busca e de IA (Googlebot, OAI-SearchBot, GPTBot, PerplexityBot) | Diretivas User-agent, Allow e Disallow, padronizadas na RFC 9309[6] | Sim, para robô que respeita o protocolo. Robô disparado por pedido de usuário pode não aplicar[5][7] |
sitemap.xml | Quais URLs existem e quando mudaram? | Buscadores | XML do protocolo sitemaps.org[8] | Ajuda a descoberta; não garante indexação |
llms.txt | O que é este site e por onde começar a ler? | Agentes e ferramentas de IA que optarem por ler | Markdown: H1, resumo, listas de links[1] | Não. Nenhum buscador confirmou uso |
Para lembrar: robots.txt é o porteiro, sitemap é a lista telefônica, llms.txt é o bilhete na mesa dizendo “comece por aqui”. O bilhete não abre porta nenhuma. Se o robots.txt bloqueia o OAI-SearchBot, o site não aparece nas respostas de busca do ChatGPT, com ou sem llms.txt.[5] Quem controla esse acesso está em Robôs de IA.
Por que isso vira custo
O arquivo é barato. O custo aparece em dois lugares. Primeiro, no tempo que o time gasta tratando o llms.txt como atalho para aparecer em IA, enquanto o que o Google diz que pesa (página rastreável e conteúdo útil) fica parado.[3] Segundo, no arquivo errado: se algum agente lê e o índice aponta para cinco páginas irrelevantes, o resumo ruim do seu negócio saiu de você. Para saber se a IA cita a marca, em vez de supor que o arquivo ajudou, meça: está em Visibilidade em IA.
Anatomia do arquivo
> Resumo curto com a informação-chave
Contexto em parágrafo ou lista, sem título
## Seção
– [Nome da página](url): nota
## Optional
A especificação define as seções nesta ordem:[1]
- H1 com o nome do site ou projeto. É a única seção obrigatória.
- Blockquote (
>) com um resumo curto, com a informação-chave para entender o resto. - Parágrafos ou listas opcionais com mais contexto. Sem títulos aqui.
- Seções H2 com listas de arquivos: cada item é um link Markdown
[nome](url), opcionalmente seguido de: nota. - Por convenção, uma seção
## Optionalpara o que pode ser pulado quando o contexto é curto. Na v2 ela deixou de ter significado especial para as ferramentas, mas segue útil como convenção.[2]
O Lighthouse acrescenta uma checagem prática: os links têm de estar em sintaxe Markdown.[4] Um exemplo para uma empresa B2B de serviço, não um projeto de software:
# Empresa Exemplo
> Empresa Exemplo instala e mantém sistemas de climatização industrial para fábricas
> no Sul do Brasil. Atende contratos de manutenção preventiva e projetos novos acima
> de 50 TR. Sede em Joinville (SC).
Não vendemos para residências. Atendimento comercial por formulário ou WhatsApp em
horário comercial.
## Serviços
- [Manutenção preventiva industrial](https://exemplo.com.br/manutencao/): contrato mensal, SLA e o que está incluso
- [Projeto de climatização](https://exemplo.com.br/projetos/): etapas, prazos e como orçamos
- [Retrofit de sistemas antigos](https://exemplo.com.br/retrofit/): quando compensa trocar
## Quem somos e prova
- [Sobre a empresa](https://exemplo.com.br/sobre/): história, equipe técnica, certificações
- [Casos](https://exemplo.com.br/casos/): projetos entregues por setor
## Contato
- [Pedir orçamento](https://exemplo.com.br/orcamento/): o que precisamos saber para orçar
## Optional
- [Blog técnico](https://exemplo.com.br/blog/): artigos sobre eficiência energética
- [Perguntas frequentes](https://exemplo.com.br/faq/)
Repare no que o exemplo faz e o plugin não faz. Diz para quem não é (“não vendemos para residências”), põe primeiro as páginas que vendem e deixa o blog em Optional. É um documento editorial, não um despejo de URL.
A pegadinha do formato: o llms.txt não é o lugar para colar o site inteiro. Para isso ferramentas de documentação adotaram a variante llms-full.txt, com o conteúdo completo concatenado. Em site institucional B2B ela raramente compensa: fica velha no dia seguinte à primeira edição de página.
O que dizem as fontes oficiais
Não há benchmark de llms.txt, porque não há efeito medido. O que existe com fonte primária é a posição de cada plataforma, e ela é mais conservadora do que o mercado repete. O Google, em particular, diz que não há marcação especial para aparecer em AI Overview e AI Mode.[3]
| Quem | O que diz | Fonte |
|---|---|---|
| llmstxt.org (Jeremy Howard / Answer.AI) | Proposta publicada em 03/09/2024; v2 em 10/08/2026; arquivo em /llms.txt ou em subcaminho | llmstxt.org[1] |
| Google Search Central | A Busca não usa arquivos de texto para IA nem Markdown; criar não ajuda nem atrapalha | Guia de otimização para IA[3] |
| Google Search Central | Não há marcação especial para aparecer em AI Overviews e AI Mode | Guia de otimização para IA[3] |
| Chrome / Lighthouse | Auditoria de llms.txt: erro de servidor reprova; 404 é “não aplicável” | Chrome for Developers[4] |
| OpenAI | Robôs documentados (OAI-SearchBot, GPTBot, ChatGPT-User) se controlam por robots.txt; nenhuma menção a ler llms.txt de terceiros | Documentação de robôs[5] |
| Perplexity | PerplexityBot e Perplexity-User documentados; controle por robots.txt; nenhuma menção a llms.txt | Documentação de robôs[7] |
| Yoast (gerador) | Inclui as 5 páginas ou posts atualizados mais recentemente (posts só dos últimos 12 meses), prioriza conteúdo cornerstone e junta as 5 categorias ou tags mais usadas; atualiza toda semana | Especificação funcional[9] |
Como implementar na prática
Onde os números costumam estar
Quem precisa entrar
Content-Type text/plain ou text/markdown e resolve conflito entre arquivo físico e plugin.
- 1 Decida se vale. Documentação técnica, API, SaaS com base de ajuda: vale, porque desenvolvedor e agente leem. Site institucional pequeno: vale como higiene de uma hora, não como projeto.
- 2 Escreva o resumo antes da lista. Duas ou três linhas: o que é, para quem, onde. Se o time não consegue escrever, o problema é de posicionamento, não de arquivo.
- 3 Escolha de 8 a 20 links por intenção, agrupados em H2 (serviços, produto, prova, contato). Critério: página que um cliente precisa ler para decidir.
- 4 Defina um dono do arquivo: arquivo físico versionado no repositório ou gerador do CMS com seleção manual. Um só.
-
5
Publique e teste de fora:
curl -I https://seusite.com/llms.txttem de dar 200. Abra numa janela anônima e confira se o conteúdo é o que você escreveu. - 6 Rode o Lighthouse (categoria Agentic Browsing) para pegar erro de servidor e link fora do formato.
- 7 Agende a revisão para toda mudança de serviço, preço-âncora, menu ou página-pilar. Arquivo esquecido é pior que arquivo nenhum.
Armadilhas comuns
Estes são os erros que mais encontro quando audito sites B2B que “já têm llms.txt”.
Tratar llms.txt como robots.txt
O apelido “robots.txt das IAs” faz estrago. Já encontrei time que pôs Disallow dentro do llms.txt achando que bloqueava o treino de modelo. Não bloqueia nada: o arquivo não tem diretiva, e quem controla robô é o robots.txt.[6] O inverso também aparece: llms.txt bonito e robots.txt bloqueando o OAI-SearchBot por causa de uma regra antiga de firewall. O site some das respostas de busca do ChatGPT e o time acha que está coberto.
O plugin que lista cinco páginas e esquece o que importa
É a armadilha mais comum em WordPress. O gerador do Yoast, por exemplo, pega as 5 páginas ou posts atualizados mais recentemente (post só entra se tiver menos de 12 meses), prioriza conteúdo cornerstone e junta as 5 categorias ou tags mais usadas.[9] Como padrão genérico, faz sentido. Num site de serviço, “atualizado mais recentemente” quase sempre é o post de terça e a política de privacidade que alguém corrigiu. A página de serviço que mais traz lead, intocada há dois anos, fica de fora, e o arquivo passa a dizer que a empresa é um blog. Se usar o gerador, ative a seleção manual de páginas. Se não der para controlar, desligue.
O arquivo físico que o servidor entrega antes do CMS
O cenário se repete: o time troca o texto no plugin, confere no painel, e o arquivo público continua o antigo. A causa costuma ser um llms.txt físico que alguém subiu na raiz meses antes. Em Apache e Nginx com a configuração padrão de WordPress, o servidor procura o arquivo no disco primeiro e só chama o PHP se ele não existir. O plugin nunca roda. O Yoast documenta o caso: se já existe arquivo físico, ele não sobrescreve, e você precisa apagar o arquivo para o gerador funcionar.[9] CDN com cache longo em .txt dá o mesmo sintoma. Regra: depois de publicar, confira pela URL pública, nunca pelo painel.
Links que não respondem 200
O llms.txt é escrito uma vez e o site muda todo mês. Em seis meses, parte dos links redireciona ou dá 404 porque a URL do serviço mudou. Um índice que manda para página morta é pior que índice nenhum: o agente que o segue chega num erro. Ponha a checagem de status desses links na mesma rotina que confere o sitemap.
Resumo escrito para SEO, não para leitura
Já li blockquote assim: “Somos referência em soluções inovadoras de excelência para o seu negócio.” Um modelo não tira nada disso, e uma pessoa também não. O resumo precisa de fato verificável: o que vende, para quem, onde e o que não faz. Se a IA vai repetir algo sobre você, que seja isso.
Gastar a semana no llms.txt e ignorar o que pesa
O maior custo é de oportunidade. O Google diz que, para os recursos de IA, valem os fundamentos: página rastreável, conteúdo útil, nenhuma marcação especial.[3] Quando vejo llms.txt caprichado e página de serviço sem texto indexável (tudo em imagem ou em carrossel que o robô não lê), a prioridade está invertida. O llms.txt é a última camada, não a primeira. O que vem antes está em GEO, e a camada para máquina que o Google de fato usa está em Dados estruturados e schema markup.
Colocar no arquivo o que não deveria ser público
O arquivo é público e fácil de achar. Já encontrei link para página de proposta comercial “escondida”, sem noindex, listada no llms.txt porque o gerador pegou toda página publicada. Revise o que entra como você revisaria um sitemap.
Checklist de implementação
FAQ
Perguntas frequentes sobre llms.txt
As dúvidas que mais aparecem de quem cuida de site e de busca.
Antes do llms.txt, o que a IA consegue ler do seu site?
O arquivo é a última camada. Antes dele vêm o robots.txt, a página rastreável e o conteúdo que diz o que você vende. O Diagnóstico grátis do site lê o seu site do jeito que um robô lê e mostra onde ele trava. Se a correção pedir mão de obra, o time da Incuca faz.
Referências
- [1] Howard, Jeremy (Answer.AI). The /llms.txt file. Publicado em 03/09/2024, modificado em 10/08/2026. https://llmstxt.org/
- [2] llmstxt.org. Changes (v2): subcaminho, versão Markdown das páginas e link relations. 2026. https://llmstxt.org/changes.html
- [3] Google Search Central. Guide to optimizing for generative AI features on Google Search. Atualizado em 10/07/2026. https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
- [4] Chrome for Developers. llms.txt, auditoria do Lighthouse (Agentic Browsing). 2026. https://developer.chrome.com/docs/lighthouse/agentic-browsing/llms-txt
- [5] OpenAI. Overview of OpenAI crawlers. 2026. https://developers.openai.com/api/docs/bots
- [6] IETF. RFC 9309, Robots Exclusion Protocol. 2022. https://www.rfc-editor.org/rfc/rfc9309
- [7] Perplexity. Perplexity crawlers. 2026. https://docs.perplexity.ai/guides/bots
- [8] sitemaps.org. Sitemaps XML format. https://www.sitemaps.org/protocol.html
- [9] Yoast. Yoast SEO: llms.txt, functional specification. 2025–2026. https://developer.yoast.com/features/llms-txt/functional-specification/