¿Qué es robots.txt? el archivo que indica a los rastreadores dónde pueden ir, en palabras sencillas
seo · Mar 19, 2026 · 5 min read
robots.txt es un archivo de texto sin formato que se encuentra en la raíz de su dominio (`mybusiness.com/robots.txt`) y le indica a los rastreadores de motores de búsqueda qué partes del sitio pueden rastrear. es la lista de invitados del portero: llega el robot de Google, lee el archivo primero y sigue las reglas que encuentra.
lo que realmente dice el archivo
la sintaxis es dos líneas repetidas y nada más:
``` User-agent: Googlebot Disallow: /admin/ ```
"User-agent" nombra el rastreador ("\*" significa todos), "Disallow" enumera los prefijos de ruta que debe omitir. ese es todo el vocabulario. la mayoría de los sitios tienen un conjunto de reglas vacío (rastrea todo) o una sola línea que bloquea una ruta de administrador o una página de resultados de búsqueda.
el archivo existe para una función: evitar que los rastreadores desperdicien visitas en páginas que no tienen valor en la búsqueda. un sitio grande lo utiliza para mantener a los robots fuera de los filtros facetados y los registros internos; un sitio pequeño casi nunca necesita tanta complejidad.
qué no puede hacer el archivo robots.txt
Aquí es donde viven los conceptos erróneos, así que los límites estrictos, claramente:
-
no oculta una página de Google. una página no permitida aún puede aparecer en los resultados (sin su contenido) si otras páginas enlazan con ella. la única forma de mantener una página fuera del índice es una directiva `noindex` en la página misma, que requiere que el rastreador pueda visitarla. bloquear y no indexar son opuestos y confundirlos es el error clásico.
-
no es seguridad. una ruta no permitida es un anuncio publicado de que la ruta existe. cualquier cosa que deba permanecer privada necesita autenticación, no una nota pidiendo a los robots que aparten la mirada.
-
No es una herramienta de clasificación. Rechazar páginas no concentra "poder" en ninguna parte; solo elimina las visitas de rastreo.
lo que realmente deberías hacer
-
mira el tuyo una vez. abre `yourdomain/robots.txt`. existe en casi todas las plataformas de forma predeterminada. si no dice nada que dé miedo, no hay nada que hacer.
-
asegúrese de que no bloquee css o js. una antigua regla de copiar y pegar que bloquea `/assets/` hace que Google muestre sus páginas medio ciegas, lo que perjudica silenciosamente la forma en que se evalúan las páginas. esta es la única forma común en que robots.txt daña activamente un sitio pequeño.
-
apunte a su mapa del sitio con una línea `Sitemap:`: el protocolo de enlace descrito en do i need an xml sitemap.
-
observe sus efectos en google search console, que informa las anomalías de rastreo por nombre.
Preguntas frecuentes: las preguntas que realmente recibo
¿Necesito crear un archivo robots.txt?
probablemente no. Los desarrolladores y hosts ofrecen un valor predeterminado sensato. cree uno el día que tenga un motivo específico: un laberinto de parámetros de rastreo pesado, un área de preparación, una ruta de administración que genera ruido en las estadísticas de rastreo.
¿Puedo bloquear mi sitio de prueba con robots.txt?
puede bloquear el rastreo, pero la URL aún puede filtrarse y indexarse como un shell vacío. Los sitios de prueba pertenecen a una contraseña. la contraseña es la solución; robots.txt es un aviso de cortesía.
¿El archivo robots.txt afecta mi clasificación?
sólo de forma indirecta y sólo de forma negativa: bloquear las cosas que Google necesita (css, js, imágenes) degrada la forma en que se procesan y evalúan las páginas. Si se usa con sensatez, es invisible para las clasificaciones: el objetivo de how do i get my website on google es que se rastree bien, nada menos.