Verificador de bloqueio no robots.txt
Cole uma URL e veja se o robots.txt do domínio libera ou bloqueia justamente esse caminho.
A página é buscada pelo servidor do DevTools. Só funciona com URLs públicas.
O que é
O robots.txt é um arquivo na raiz do domínio com regras de Allow e Disallow por caminho. Esta checagem não valida o arquivo inteiro: ela pega o robots.txt do domínio, aplica as regras à URL que você colou e responde uma pergunta só — este endereço específico pode ser rastreado? É a diferença entre revisar o regulamento e conferir se o seu caso passa nele.
Por que importa
Um Disallow amplo demais tira páginas inteiras do rastreamento sem nenhum aviso. E o efeito é diferente do noindex de um jeito que confunde muita gente: bloquear no robots.txt impede o Google de ler a página, mas não impede que a URL apareça nos resultados quando outros sites apontam para ela — só que sem título e sem descrição, porque o buscador nunca conseguiu abri-la. É também o motivo pelo qual bloquear e colocar noindex ao mesmo tempo não funciona: sem rastrear, o noindex nunca é lido.
Como corrigir
- Bloqueie caminhos, não o site. Um 'Disallow: /' esquecido de um ambiente de homologação é o acidente mais caro que esse arquivo permite.
- Não bloqueie CSS e JavaScript. O Google renderiza a página para avaliá-la, e sem os assets ele vê um layout quebrado.
- Para tirar uma página da busca, use noindex e mantenha o rastreamento liberado. Bloquear no robots.txt produz o resultado sem título que ninguém quer.
- Lembre que a regra mais específica vence: um Allow para um subcaminho sobrepõe o Disallow do diretório acima.
- Declare o sitemap no arquivo com uma linha Sitemap: seguida da URL absoluta.
- Trate o robots.txt como pedido, não como cadeado. Rastreadores bem-comportados obedecem; conteúdo que precisa mesmo ficar fora do alcance exige autenticação.
Bloqueio por caminho, com exceção
User-agent: *
Disallow: /admin/
Disallow: /carrinho/
Allow: /admin/ajuda-publica/
Sitemap: https://exemplo.com.br/sitemap.xmlPerguntas frequentes
- Bloquear no robots.txt tira a página do Google?
- Não necessariamente. Impede o rastreamento, mas a URL ainda pode ser listada se outras páginas apontarem para ela — aparecendo sem título e sem descrição. Para remover de fato, use noindex com o rastreamento liberado.
- Posso usar Disallow e noindex juntos?
- Não funciona, e é uma das confusões mais comuns. O noindex está dentro da página; se o robots.txt proíbe o acesso, o Google nunca chega a lê-lo. Escolha um: noindex com rastreio liberado para tirar da busca, Disallow para poupar rastreamento em áreas irrelevantes.
- Devo bloquear CSS e JavaScript?
- Não. O Google precisa renderizar a página como um navegador para avaliá-la. Sem os arquivos de estilo e script, ele vê uma versão quebrada e pode concluir que a página não é responsiva ou que falta conteúdo.
- O robots.txt vale para subdomínios?
- Não. Cada host tem o seu: o arquivo em exemplo.com.br não governa blog.exemplo.com.br. Subdomínio esquecido sem robots.txt próprio é fonte recorrente de conteúdo indexado por engano.
Outras checagens
Ferramentas relacionadas
- Verificador de robots.txt — analise o arquivo inteiro, regra por regra
- Validador de sitemap — confira o sitemap declarado no arquivo
- Todas as checagens de SEO