Che cos'è robots.txt?

Robots.txt è un file di testo che i siti web inseriscono nella directory radice per comunicare con i crawler web e i bot dei motori di ricerca. Indica a questi visitatori automatizzati quali pagine o sezioni di un sito possono o non possono essere consultate, in conformità con il Protocollo di esclusione dei robot.

Descrizione dello strumento

Il verificatore di robots.txt recupera il file robots.txt direttamente dal nostro server: non è necessario copiare e incollare il file manualmente. Inserisci un URL e il server richiederà robots.txt a quel sito, lo analizzerà e restituirà il contenuto grezzo insieme alle sitemap dichiarate, al ritardo di scansione e all'host preferito.

Funzionalità

  • Recupero lato server: il server richiede robots.txt per tuo conto, quindi non è necessario avere il file localmente
  • Estrazione delle sitemap: elenca ogni voce Sitemap: dichiarata nel file
  • Ritardo di scansione e host preferito: mostra le direttive Crawl-delay e Host quando presenti