Digite o domínio. Lemos o seu robots.txt e mostramos, robô por robô, a linha que libera ou bloqueia cada um.
Esta verificação lê só o robots.txt. Bloqueios feitos no firewall ou na CDN não aparecem aqui.
O robots.txt é um arquivo na raiz do site que diz a cada robô o que ele pode ler. Cada robô procura o grupo com o nome dele. Se não houver, segue o grupo de todos os robôs, o User-agent: *.
Dentro do grupo, vale a regra mais longa que combina com a página. Se uma regra Allow e uma Disallow empatam, vale a Allow. Sem regra que combine, a página fica liberada.
Não pelo robots.txt. A OpenAI usa o GPTBot para treino e o OAI-SearchBot para a busca do ChatGPT, e cada um segue o próprio grupo.
Pela norma do robots.txt (RFC 9309), sem o arquivo os robôs podem ler tudo. Se o servidor responder com erro, eles tratam o site como bloqueado.
As empresas listadas aqui dizem que os robôs de busca e de treino obedecem. As visitas pedidas por um usuário podem não obedecer, segundo a OpenAI e a Perplexity.
Não. O Google diz que o Google-Extended não afeta a inclusão nem o ranking na Busca. Ele controla se o conteúdo pode treinar o Gemini.