Você já recebeu uma notificação do Google informando que algumas das suas páginas foram "Indexadas, embora bloqueadas pelo robots.txt"? Isso pode parecer confuso, pois essas duas coisas não devem acontecer ao mesmo tempo.
A robots.txt lima é um conjunto de instruções para mecanismos de busca. Ele informa quais páginas do seu site devem ou não ser rastreadas. Por exemplo, você pode usá-lo para bloquear páginas que não deseja que apareçam nos resultados de busca, como páginas privadas de backend ou conteúdo antigo e superficial.
O erro ocorre quando o Google descobre uma página que não consegue rastrear por causa de sua robots.txt arquivo, mas mesmo assim decide exibi-lo nos resultados de pesquisa. Isso geralmente ocorre porque outros sites criaram links para a página, fazendo com que o Google a considere importante o suficiente para indexá-la.
Como encontrar esse erro no seu site
Antes de corrigir o problema, você precisa saber onde ele está. Você pode encontrar esse erro verificando o relatório de indexação do seu site. Você verá uma lista de URLs que estão sendo indexadas, mesmo estando bloqueadas.
Se você estiver vendo esse erro, a primeira coisa a fazer é certificar-se de que não está tentando indexar acidentalmente uma página que você deseja manter fora dos resultados de pesquisa. Você pode verificar se há páginas ocultas ou conteúdo duplicado que você não deseja que apareça nos resultados de pesquisa.
Como corrigir este problema comum de SEO
Etapa 1: verifique seu robots.txt Envie o
O motivo mais comum para esse erro é que seu robots.txt O arquivo não está configurado corretamente. Revise o arquivo e certifique-se de que não esteja bloqueando acidentalmente páginas que deveriam ser indexadas. Por exemplo, um único erro de digitação pode impedir que uma seção inteira do seu site seja rastreada.
Se você deseja que os mecanismos de busca rastreiem todo o seu site, seu robots.txt o arquivo deve ter estas linhas simples:
Agente de usuário: *
Disallow:
Isso informa aos mecanismos de busca que eles têm permissão para rastrear tudo no seu site.
Etapa 2: Remova os links que causam problemas
O motivo pelo qual o Google indexa uma página bloqueada geralmente é por causa de outros links que apontam para ela. Você não pode controlar o que outros sites fazem, mas pode usar um noindex etiqueta para resolver esse problema.
A noindex A tag é uma linha de código que você coloca na seção de cabeçalho da sua página. Ela se parece com isto:
Esta tag informa aos mecanismos de busca para não indexarem a página, mesmo que outros sites tenham links para ela. Este é um sinal mais forte do que robots.txt e é a melhor maneira de garantir que uma página nunca apareça nos resultados de pesquisa.
Etapa 3: Prepare-se para a indexação
Depois de decidir quais páginas deseja indexar, você precisa garantir que elas estejam prontas. Você pode reescrever o conteúdo de uma página para garantir que seja de alta qualidade e livre de erros. Uma ferramenta como a nossa Ferramenta de reformulação de IA pode ajudar você a melhorar seu conteúdo existente e torná-lo mais legível e envolvente tanto para usuários quanto para mecanismos de busca.
O que é um arquivo robots.txt?
Um arquivo robots.txt é um conjunto de instruções para mecanismos de busca que informa quais páginas de um site eles têm permissão ou não para rastrear.
O que significa "Indexado, embora bloqueado por robots.txt"?
Este erro significa que um mecanismo de busca encontrou uma página e decidiu indexá-la, mesmo que o arquivo robots.txt tenha instruído você a não fazer isso.
Devo usar robots.txt ou uma tag noindex?
Você deve usar uma tag noindex para manter uma página fora dos resultados de pesquisa. Um arquivo robots.txt é ideal para informar aos mecanismos de busca quais páginas rastrear. Uma tag noindex é um sinal mais forte e a melhor maneira de garantir que uma página não seja indexada.
Como posso corrigir um problema com o robots.txt?
Para corrigir um problema com o robots.txt, você deve verificar se há erros no arquivo. Você também deve verificar se há links desnecessários para a página em outros sites.