cos'è robots.txt? il file che dice ai crawler dove possono andare, in parole povere

seo · Mar 19, 2026 · 5 min read

robots.txt è un file di testo semplice che si trova alla radice del tuo dominio — `mybusiness.com/robots.txt` — e indica ai crawler dei motori di ricerca quali parti del sito possono scansionare. è la lista degli invitati del buttafuori: arriva googlebot, legge prima il file e segue le regole che trova.

cosa dice effettivamente il file

la sintassi è di due righe ripetute e niente di più:

``` User-agent: Googlebot Disallow: /admin/ ```

"User-agent" nomina il crawler ("\*" significa tutti), "Disallow" elenca i prefissi di percorso che dovrebbe saltare. questo è l'intero vocabolario. la maggior parte dei siti ha un set di regole vuoto (scansione di tutto) o una singola riga che blocca un percorso di amministrazione o una pagina dei risultati di ricerca.

il file esiste per un compito: salvare i crawler dallo spreco di visite su pagine che non hanno valore nella ricerca. un sito di grandi dimensioni lo utilizza per tenere i bot lontani dai filtri sfaccettati e dai log interni; un sito piccolo non ha quasi mai bisogno di complessità.

cosa non può fare robots.txt

è qui che vivono le idee sbagliate, quindi i limiti rigidi, chiaramente:

  • non nasconde una pagina a Google. una pagina non consentita può comunque apparire nei risultati, senza il suo contenuto, se altre pagine si collegano ad essa. l'unico modo per tenere una pagina fuori dall'indice è una direttiva `noindex` sulla pagina stessa, che richiede che il crawler possa visitarla. blocking e noindexing sono opposti e confonderli è il classico errore.

  • non è sicurezza. un percorso non consentito è un annuncio pubblicato che il percorso esiste. tutto ciò che deve rimanere privato necessita di autenticazione, non di una nota che chiede ai bot di distogliere lo sguardo.

  • Non è uno strumento di ranking. Non consentire le pagine non concentra il "potere" da nessuna parte; rimuove solo le visite di scansione.

    cosa dovresti effettivamente fare

  • guarda il tuo una volta. apri `yourdomain/robots.txt`. esiste su quasi tutte le piattaforme per impostazione predefinita. se non dice niente di spaventoso, niente da fare.

  • assicurati che non blocchi css o js. un'antica regola di copia-incolla che blocca `/assets/` fa sì che Google renda le tue pagine semi-cieche, il che incide silenziosamente sul modo in cui le pagine vengono valutate. questo è l'unico modo comune in cui robots.txt danneggia attivamente un sito di piccole dimensioni.

  • puntalo sulla tua mappa del sito con una riga `Sitemap:`: l'handshake descritto in do i need an xml sitemap.

  • guarda i suoi effetti in google search console, che segnala le anomalie di scansione per nome.

    FAQ: le domande che effettivamente ricevo

devo creare un file robots.txt?

probabilmente no. builder e host forniscono un valore predefinito sano. creane uno il giorno in cui hai un motivo specifico: un labirinto di parametri pesanti, un'area di sosta, un percorso di amministrazione che genera rumore nelle statistiche di scansione.

posso bloccare il mio sito di staging con robots.txt?

puoi bloccare la scansione, ma l'URL può comunque fuoriuscire ed essere indicizzato come una shell vuota. i siti di staging appartengono a una password. la password è la soluzione; robots.txt è un avviso di cortesia.

robots.txt influisce sul mio posizionamento?

solo indirettamente e solo in negativo: bloccare le cose di cui Google ha bisogno (css, js, immagini) peggiora il modo in cui le pagine vengono visualizzate e valutate. usato in modo sensato, è invisibile alle classifiche: l'obiettivo di how do i get my website on google è essere scansionato bene, non meno.