Como funciona o robots.txt e quando bloquear páginas do Google
Entenda o que o robots.txt realmente controla, quando bloquear URLs faz sentido e quais erros podem prejudicar o rastreamento do seu site.

O arquivo robots.txt parece simples: algumas linhas de texto dizendo o que os robôs podem ou não acessar. Mesmo assim, uma regra mal colocada pode impedir o Google de rastrear partes importantes do site, bloquear recursos necessários para renderização ou criar a falsa sensação de que uma página foi retirada da pesquisa.
A ideia mais importante para entender o robots.txt é esta: ele controla rastreamento, não indexação. O arquivo diz ao Googlebot quais URLs ele pode solicitar. Isso é diferente de decidir se uma URL pode aparecer nos resultados do Google.
Entender essa diferença evita grande parte dos erros de SEO relacionados ao arquivo.
O que é o robots.txt?
robots.txt é um arquivo de texto publicado na raiz de um site. Em um domínio como https://example.com, ele normalmente fica em:
https://example.com/robots.txt
Quando um rastreador compatível chega ao site, ele consulta esse arquivo para descobrir quais caminhos pode acessar.
As regras valem para o protocolo, host e porta onde o arquivo está publicado. O robots.txt de https://example.com, por exemplo, não controla automaticamente https://loja.example.com.
Ele também não é uma barreira de segurança. Conteúdo privado deve usar autenticação, permissões ou outra proteção real no servidor.
Rastreamento e indexação não são a mesma coisa
Essa é a diferença que mais causa confusão.
Rastreamento acontece quando o Googlebot acessa uma URL e lê seu conteúdo.
Indexação acontece quando o Google processa uma página e decide armazená-la para possivelmente exibi-la nos resultados de pesquisa.
O robots.txt atua principalmente na primeira etapa.
Veja este exemplo:
User-agent: * Disallow: /relatorio/
Essa regra diz aos rastreadores compatíveis que não devem acessar URLs dentro de /relatorio/.
Mas isso não significa necessariamente que uma URL como:
https://example.com/relatorio/vendas
nunca poderá aparecer no Google.
Se outras páginas apontarem para esse endereço, o Google ainda pode descobrir a URL e até exibi-la nos resultados sem uma descrição completa. Por isso, robots.txt não é a forma correta de remover uma página do índice.
Quando usar noindex em vez de robots.txt
Se o objetivo é permitir que o Google acesse uma página, mas impedir que ela apareça nos resultados, normalmente o mecanismo adequado é noindex.
Em uma página HTML, um exemplo comum é:
<meta name="robots" content="noindex">
O Google precisa conseguir rastrear a página para encontrar essa instrução. Por isso, esta combinação pode causar um problema:
User-agent: * Disallow: /pagina-interna/
e dentro da página:
<meta name="robots" content="noindex">
Se o Googlebot não pode acessar a URL por causa do robots.txt, ele pode não conseguir ler o noindex.
Se você quer que o Google veja noindex, não bloqueie a mesma página no robots.txt. Para conteúdo privado, nenhum dos dois substitui controle de acesso.
Como as regras básicas funcionam
Um arquivo robots.txt é dividido em grupos. Cada grupo começa com um User-agent e contém regras que se aplicam a determinado rastreador.
Um arquivo simples pode ser:
User-agent: * Disallow: /admin/ Disallow: /busca-interna/ Sitemap: https://example.com/sitemap.xml
User-agent
User-agent define qual rastreador deve seguir aquele grupo.
O asterisco representa os rastreadores de forma geral:
User-agent: *
Você também pode criar regras específicas para um crawler:
User-agent: Googlebot
Disallow
Disallow indica caminhos que não devem ser rastreados.
Por exemplo:
Disallow: /admin/
bloqueia o rastreamento daquele diretório para o grupo correspondente.
Em diretórios, a barra final ajuda a deixar a intenção mais clara. Regras amplas demais podem bloquear mais do que você pretendia.
Allow
Allow pode liberar uma página ou subdiretório dentro de uma área bloqueada.
Por exemplo:
User-agent: * Disallow: /arquivos/ Allow: /arquivos/publicos/
Aqui, /arquivos/ é bloqueado, mas /arquivos/publicos/ recebe uma exceção.
O Google usa a regra mais específica que corresponde ao caminho. Em um empate entre regras conflitantes de mesmo tamanho, ele prefere a menos restritiva.
Sitemap
Também é possível indicar onde está o sitemap:
Sitemap: https://example.com/sitemap.xml
Mais de um sitemap pode ser informado:
Sitemap: https://example.com/sitemap-posts.xml Sitemap: https://example.com/sitemap-produtos.xml
Isso não garante indexação; apenas ajuda os rastreadores a encontrar os sitemaps.
Quando faz sentido bloquear URLs
O melhor uso do robots.txt não é esconder conteúdo. É evitar rastreamento desnecessário.
Áreas que não precisam ser rastreadas
Áreas técnicas, resultados de busca interna ou URLs criadas apenas para operações do sistema podem não ter valor para mecanismos de pesquisa. Se bloquear o rastreamento não interfere em outras páginas, o robots.txt pode ser apropriado.
Muitas combinações de filtros e parâmetros
Lojas e catálogos podem gerar milhares de combinações a partir de filtros:
/produtos?cor=azul&tamanho=m /produtos?cor=azul&tamanho=g /produtos?ordem=preco
Bloquear parâmetros nem sempre é a melhor solução, porque canonicalização e arquitetura de URLs também entram na decisão. Em sites grandes, porém, reduzir espaços de URL sem valor pode fazer parte da estratégia de rastreamento.
Recursos ou endpoints que criam carga desnecessária
Algumas URLs podem disparar consultas pesadas, geração de relatórios ou operações que não precisam ser acessadas por robôs.
Nesses casos, limitar o rastreamento pode ajudar a evitar requisições desnecessárias.
Quando não bloquear no robots.txt
Existem situações em que uma regra parece conveniente, mas produz o efeito errado.
Páginas que você quer remover do Google
Se a intenção é retirar uma página dos resultados, bloquear o rastreamento não resolve diretamente o problema.
Use noindex, remova a página, exija autenticação ou escolha outra estratégia de acordo com o caso.
CSS e JavaScript importantes
Bloquear recursos necessários para montar a página pode impedir que o Google veja o conteúdo da mesma forma que um usuário.
CSS e JavaScript essenciais para renderização geralmente precisam continuar acessíveis. Antes de bloquear uma pasta de assets, verifique o que depende dela.
Conteúdo privado
Um arquivo robots.txt é público. Qualquer pessoa pode abrir /robots.txt e ler os caminhos listados.
Escrever:
Disallow: /documentos-secretos/
não torna aquele diretório secreto. Na prática, você acabou de publicar o nome do caminho.
Se algo não deve ser acessível, proteja o recurso com autenticação e autorização.
Como funcionam regras específicas para bots
É possível ter grupos diferentes:
User-agent: * Disallow: /temporario/ User-agent: Googlebot Disallow: /experimento/
Um detalhe importante é que o Google procura o grupo de User-agent mais específico correspondente ao rastreador.
O grupo específico do Googlebot não é simplesmente somado ao grupo *.
Nesse exemplo, ao avaliar Googlebot, as regras relevantes são as do grupo específico para Googlebot. Outros rastreadores sem grupo próprio usam o grupo geral.
Também é possível repetir o mesmo User-agent em grupos diferentes; o Google pode combinar as regras desses grupos específicos.
Asterisco e cifrão nas regras
O Google reconhece dois recursos úteis para correspondência de caminhos.
O asterisco * representa zero ou mais caracteres.
Por exemplo:
Disallow: /*.pdf
pode corresponder a caminhos que contenham .pdf depois da barra inicial.
O cifrão $ indica o final da URL.
Por exemplo:
Disallow: /*.pdf$
corresponde a uma URL que termina exatamente em .pdf.
Uma URL como:
/documento.pdf?download=1
não termina em .pdf, portanto a regra com $ não corresponde da mesma maneira.
Wildcards são úteis, mas aumentam o risco de atingir URLs inesperadas. Regras complexas precisam ser testadas.
Erros comuns que podem prejudicar o site
O erro mais grave é:
User-agent: * Disallow: /
A barra sozinha representa o site inteiro para aquele grupo.
Essa regra pode ser correta em um ambiente que realmente não deve ser rastreado, mas é perigosa em produção.
Outro erro comum é bloquear um diretório sem perceber que páginas importantes ou recursos necessários também estão dentro dele.
Também aparecem problemas como:
- usar
robots.txtpara tentar remover páginas do índice; - bloquear uma página que contém
noindex; - esquecer que caminhos diferenciam maiúsculas e minúsculas;
- copiar regras de outro site sem entender a estrutura das URLs;
- criar dezenas de exceções difíceis de revisar;
- assumir que todos os rastreadores interpretam extensões não padronizadas da mesma forma.
Um arquivo curto e legível costuma ser mais seguro do que uma coleção de regras difíceis de explicar.
Como testar antes de publicar
Antes de alterar o arquivo em produção, liste algumas URLs reais:
- uma que deve ser permitida;
- uma que deve ser bloqueada;
- uma exceção com
Allow; - uma URL com parâmetro;
- uma URL parecida que não deveria ser atingida pela regra.
Depois compare cada caminho com suas regras.
Se quiser montar e testar regras de forma visual, você pode usar um gerador e testador de robots.txt para experimentar os grupos e conferir caminhos antes de colocar o arquivo no servidor.
O teste precisa confirmar tanto o bloqueio desejado quanto a ausência de bloqueios acidentais. Depois da publicação, abra:
https://seusite.com/robots.txt
e confirme que o conteúdo servido é realmente o arquivo esperado.
Um robots.txt simples costuma ser suficiente
Para muitos sites, algo próximo disto já atende:
User-agent: * Disallow: Sitemap: https://example.com/sitemap.xml
Um Disallow vazio significa que não há caminho bloqueado nesse grupo.
Se houver uma área claramente desnecessária para rastreamento:
User-agent: * Disallow: /busca/ Sitemap: https://example.com/sitemap.xml
A melhor configuração é a que representa com clareza a arquitetura real do site.
Checklist antes de bloquear uma URL
Antes de adicionar uma regra, pergunte:
- Quero impedir rastreamento ou indexação?
- Essa URL pode continuar aparecendo no Google mesmo sem ser rastreada?
- Existe uma tag
noindexque o Google precisa acessar? - Outras páginas dependem de CSS, JavaScript ou imagens dentro desse caminho?
- A regra pode atingir URLs parecidas?
- O conteúdo é privado e deveria usar autenticação em vez de
robots.txt? - Existe uma razão concreta para criar uma regra específica para Googlebot?
- Testei URLs permitidas e bloqueadas antes de publicar?
- O sitemap continua apontando para URLs que deveriam ser rastreadas?
- Outra pessoa conseguiria entender esse arquivo daqui a seis meses?
Se você não consegue responder claramente à primeira pergunta, ainda não é hora de escrever a regra.
Perguntas frequentes
robots.txt impede uma página de aparecer no Google?
Não necessariamente. Ele impede o rastreamento da página pelo crawler correspondente, mas a URL ainda pode ser descoberta por links e aparecer nos resultados.
Qual é a diferença entre Disallow e noindex?
Disallow controla acesso do rastreador. noindex instrui o mecanismo de pesquisa a não manter a página no índice, desde que ele consiga acessar a página e ler a regra.
Posso bloquear a área administrativa no robots.txt?
Você pode impedir rastreamento, mas isso não protege a área. Uma área administrativa deve exigir autenticação e permissões adequadas.
Preciso ter um robots.txt?
Nem todo site precisa de regras especiais. Se todas as páginas públicas podem ser rastreadas, um arquivo muito simples — ou até a ausência de restrições — pode ser suficiente.
Posso colocar comentários no arquivo?
Sim. O caractere # inicia um comentário, que é ignorado pelo rastreador.
Pense no robots.txt como controle de acesso para rastreadores, não como invisibilidade
A maneira mais segura de trabalhar com robots.txt é definir primeiro o objetivo.
Se você quer economizar rastreamento em URLs sem valor, o arquivo pode ser a ferramenta certa. Se quer retirar uma página dos resultados, provavelmente precisa de noindex ou outra estratégia. Se quer proteger conteúdo privado, precisa de controle de acesso real.
Antes de escrever uma nova regra, descubra qual URL está sendo rastreada, por que você quer bloqueá-la e o que precisa continuar acessível. Um robots.txt pequeno, testado e compreensível costuma funcionar melhor do que regras copiadas sem contexto.