Robots.txt e Sitemap: 6 Erros que Bloqueiam seu Site B2B
Veja os erros de robots.txt e sitemap que bloqueiam a indexação sem querer em sites B2B e de catálogo, com um modelo seguro de arquivos para copiar e adaptar.
Por Equipe Downway 3 min de leitura
O robots.txt e o sitemap XML são dois arquivos pequenos que podem derrubar o tráfego de um site inteiro com uma única linha errada. A configuração de robots.txt e sitemap costuma ser feita uma vez, na entrega do site, e nunca mais revisada. Estes são os erros que mais aparecem em sites B2B e de catálogo.
Erro 1: deixar o bloqueio do ambiente de testes em produção
Durante o desenvolvimento, é comum bloquear tudo com Disallow: /. Se o arquivo é copiado para o site no ar, o Google para de rastrear as páginas. Consequência: as posições caem em semanas. Como evitar: inclua a revisão do robots.txt no checklist de lançamento e teste a URL do arquivo logo depois.
Erro 2: bloquear CSS, JavaScript ou imagens
Regras que bloqueiam pastas de scripts ou de estilos impedem o Google de renderizar a página como o visitante vê. O resultado é uma avaliação errada do layout e do mobile. Libere os recursos necessários para a renderização e use a Inspeção de URL para conferir.
Erro 3: usar robots.txt para tirar uma página do Google
O robots.txt impede o rastreio, mas não garante a remoção do índice: a URL pode continuar aparecendo, só sem descrição. Para tirar uma página, use a marcação noindex e deixe o robô acessá-la para ler essa instrução. Bloquear e marcar noindex ao mesmo tempo anula o efeito.
Erro 4: sitemap com URLs que não deveriam estar lá
O sitemap é uma lista de páginas que você quer indexar. Evite colocar nele:
- URLs que redirecionam ou retornam erro 404;
- páginas com noindex ou com canonical apontando para outra URL;
- URLs de filtros, buscas internas e parâmetros de sessão;
- versões http quando o site usa https.
Sitemap sujo gera avisos no Search Console e dilui a confiança do Google na lista. Se o seu site de catálogo gera o sitemap automaticamente, confira se as regras de exclusão existem.
Erro 5: sitemap desatualizado ou não enviado
Produto novo que não entra no sitemap demora mais para ser descoberto. Gere o arquivo de forma automática, com a data de última modificação real, e envie o endereço no Search Console. Em catálogos grandes, divida em vários sitemaps (produtos, categorias, artigos) para facilitar o diagnóstico.
Erro 6: esquecer de apontar o sitemap no robots.txt
Não é obrigatório, mas é uma linha que ajuda qualquer robô a achar a lista. Também é um erro comum escrever o caminho do sitemap sem o endereço completo.
Modelo seguro para um site de catálogo
Adapte à sua realidade, pois cada plataforma tem pastas diferentes. Um ponto de partida conservador:
- User-agent: * (vale para todos os robôs);
- Disallow: /busca/ e Disallow: /carrinho/ (páginas sem valor para busca);
- Disallow: /*?ordem= (parâmetros de ordenação, se existirem);
- Sitemap: https://www.seudominio.com.br/sitemap.xml (endereço completo).
Não bloqueie a pasta de imagens, nem os arquivos de script e estilo, e nunca use Disallow: / em produção.
Rotina de verificação
Depois de qualquer mudança no site, abra o arquivo no navegador, veja o relatório de páginas no Search Console e procure aumentos em “bloqueada por robots.txt”. Uma checagem trimestral evita o susto. Se quiser uma revisão técnica completa, veja nossa página de sites industriais.
Perguntas frequentes
Todo site precisa de robots.txt?
Não é obrigatório. Sem o arquivo, o Google rastreia tudo. Mas ele é útil para impedir o rastreio de áreas sem valor e para indicar o sitemap.
Quantas URLs cabem em um sitemap?
Cada arquivo aceita até 50.000 URLs ou 50 MB sem compactação. Acima disso, use um índice de sitemaps com vários arquivos.
Robots.txt protege informações confidenciais?
Não. O arquivo é público e só orienta robôs educados. Conteúdo confidencial deve ficar protegido por senha ou fora do site.