Generador de robots.txt
Genera un archivo robots.txt para controlar el acceso de los rastreadores a áreas específicas de tu sitio web.
- Especifica reglas Allow y Disallow
- Añade la URL del sitemap
- Descarga o copia el archivo generado
- Procesamiento local únicamente
Configuración y salida de robots.txt
El user-agent al que se aplican las reglas. Usa * para todos los rastreadores.
Reglas Disallow
Rutas a las que los rastreadores no deben acceder. Usa una ruta por campo.
Reglas Allow
Rutas específicas a las que los rastreadores pueden acceder. Usa una ruta por campo.
URL completa de tu archivo sitemap.xml.
Este generador se ejecuta localmente en tu navegador. Tu entrada nunca se envía a ningún servidor.
¿Qué es robots.txt?
El archivo robots.txt es un archivo de texto ubicado en el directorio raíz de tu sitio web que proporciona instrucciones a los rastreadores web sobre qué áreas de tu sitio pueden o no pueden acceder.
Cómo usar robots.txt
Coloca el archivo robots.txt en la raíz de tu dominio (por ejemplo, https://ejemplo.com/robots.txt). El archivo se aplica a todo el dominio y sus subdirectorios, salvo que se especifique lo contrario.
Entendiendo las directivas
- User-Agent: Especifica a qué rastreador se aplican las reglas (* significa todos los rastreadores)
- Disallow: Bloquea a los rastreadores el acceso a rutas o archivos específicos
- Allow: Permite explícitamente el acceso a rutas específicas (se usa frecuentemente con comodines)
- Sitemap: Proporciona la ubicación de tu archivo sitemap.xml
Limitaciones importantes
Robots.txt no es un mecanismo de seguridad o control de acceso. No impide el acceso no autorizado al contenido y no debería usarse para proteger archivos sensibles. Los robots maliciosos pueden ignorar robots.txt, y los motores de búsqueda pueden indexar páginas bloqueadas si hay enlaces a ellas desde otras fuentes.
Buenas prácticas
- Usa robots.txt para gestionar el presupuesto de rastreo, no para privacidad o seguridad
- Prueba tu archivo robots.txt con herramientas de la consola de búsqueda
- Sé específico con las rutas para evitar bloqueos no deseados
- Recuerda que bloquear el rastreo ≠ impedir la indexación
Preguntas frecuentes
¿Garantiza robots.txt que las páginas no se indexarán?
No. Los motores de búsqueda pueden indexar una página aunque esté bloqueada por robots.txt si otras páginas enlazan a ella. Para impedir la indexación, usa la etiqueta meta noindex o la cabecera X-Robots-Tag.
¿Puede robots.txt ocultar contenido privado?
No. Robots.txt es accesible públicamente y no debería usarse para proteger contenido privado o sensible. Usa autenticación y controles de acceso adecuados.
¿Cómo puedo probar mi archivo robots.txt?
Puedes usar las herramientas de la consola de búsqueda proporcionadas por los motores de búsqueda para probar cómo sus rastreadores interpretan tu archivo robots.txt.