Has lanzado un nuevo sitio, abierto un cliente FTP y encontrado un directorio raíz vacío mirándote. La pregunta es simple pero importante: ¿deberías generar un archivo robots.txt, y podría una regla descuidada mantener a los motores de búsqueda alejados de tus páginas?
Un archivo robots.txt bien construido proporciona a los rastreadores cooperantes una política de acceso clara. Puede reducir la obtención innecesaria, identificar mapas del sitio XML y expresar preferencias para los bots de búsqueda clásicos y los rastreadores de IA más nuevos. No puede proteger información privada, hacer cumplir el acceso contra raspadores hostiles, ni garantizar que una URL bloqueada desaparezca de los resultados de búsqueda.
Tabla de Contenidos
Lo que realmente hace Robots TXT
robots.txt es un archivo de texto plano público que se encuentra en la raíz de un host y le dice a los rastreadores automatizados que cumplen con las normas qué rutas URL pueden solicitar. Google lo describe como un mecanismo para controlar el acceso de los rastreadores, con el importante requisito de que el archivo se coloque en la raíz del host que gobierna. El protocolo formal está documentado en RFC 9309, que estandarizó el Protocolo de Exclusión de Robots que se usó durante mucho tiempo en septiembre de 2022.
El archivo comenzó como una salvaguarda práctica contra la carga innecesaria del servidor. Martijn Koster propuso el protocolo en 1994, y los primeros motores de búsqueda lo adoptaron ampliamente para junio de ese año. Por lo tanto, los generadores modernos están codificando reglas de un protocolo que operó de manera informal durante 28 años antes de la estandarización formal, una historia que explica tanto su utilidad como sus límites.
Un archivo robots.txt controla el rastreo, no la indexación garantizada. Si un rastreador no puede obtener una página, aún puede aprender la URL a partir de enlaces u otras señales. Usa autenticación para material confidencial y utiliza una directiva noindex donde necesites que los motores de búsqueda procesen una página y luego la excluyan de los resultados de búsqueda. Robots.txt en sí no es un mecanismo de seguridad, una capa de privacidad, ni una solicitud de eliminación.
Regla práctica: Trata robots.txt como un letrero en la entrada, no como una puerta cerrada con llave.
El archivo ahora es importante más allá de la búsqueda tradicional. Googlebot y Bingbot lo interpretan, mientras que los rastreadores relacionados con IA pueden usarlo para entender las preferencias de acceso de un editor. Investigaciones independientes han encontrado que los rastreadores de búsqueda de IA rara vez verifican robots.txt y que directivas más estrictas pueden reducir el cumplimiento, por lo que el archivo debe ser una parte de una política de rastreo más amplia. Para una visión útil de cómo encaja el rastreo en el SEO técnico, consulta rastreo en SEO.
Creando y Colocando el Archivo
No necesitas una aplicación especializada para generar robots.txt. Un editor de texto plano como Notepad, TextEdit en modo de texto plano o VS Code es suficiente.
Comienza con un archivo limpio
Crea un nuevo documento y guárdalo con este nombre de archivo exacto:
- Nombre del archivo:
robots.txt
- Mayúsculas: minúsculas
- Codificación: texto plano UTF-8
- Formato: sin estilo de texto enriquecido, formato oculto o extensión extra
No lo guardes como robots.txt.txt, Robots.txt o un documento de procesamiento de texto. Un byte order mark o un carácter de control inesperado pueden crear un comportamiento confuso en el analizador, especialmente cuando una plataforma de alojamiento reescribe el archivo durante la implementación.
Para un sitio abierto sin rutas bloqueadas, este archivo mínimo es válido:
User-agent: *
Disallow:
El asterisco aplica el grupo a los rastreadores que no tienen un grupo más específico. Un valor Disallow vacío no bloquea nada, lo cual es diferente de Disallow: /, donde la barra bloquea cada ruta.
Colócalo en la raíz correcta
Sube el archivo a la raíz del host relevante para que se resuelva en:
`
Google afirma que un sitio puede tener solo un archivo robots.txt para un host y que debe estar en la raíz del host. Las reglas también son específicas para el protocolo, host y puerto, por lo que un archivo en no controla automáticamente o en otro subdominio. Este es uno de los errores más fáciles de cometer durante un lanzamiento de múltiples dominios.

Sube a través de tu cliente FTP, el administrador de archivos del panel de control de tu hosting, o el proceso de implementación que publica tu sitio. Si un CMS genera robots.txt de forma dinámica, edita la configuración SEO de la plataforma en lugar de subir un archivo estático competidor que la aplicación podría sobrescribir.
Verifica la respuesta en vivo
Abre la URL final en un navegador antes de probar reglas individuales. Confirma que ves texto plano, el contenido esperado y el nombre de host de producción. Una copia de staging, una respuesta en caché o una redirección a un host inesperado pueden hacer que un archivo correcto parezca roto.
Mantén el archivo conciso. Google recomienda mantener robots.txt dentro del tamaño soportado por el parser, y conjuntos de reglas muy grandes son difíciles de auditar incluso cuando se cargan con éxito. Para la mayoría de los sitios pequeños y medianos, una política corta con grupos claros es más fácil de mantener que un catálogo de exclusiones especulativas.
Explicación de las Directivas Básicas
La sintaxis de robots.txt parece simple porque lo es. La parte difícil es decidir si una regla expresa una necesidad real de rastreo o simplemente añade ruido.
User-agent selecciona el grupo de rastreadores. User-agent: * apunta a todos los rastreadores sin un grupo más específico, mientras que User-agent: Googlebot apunta al principal rastreador de búsqueda de Google. Un grupo específico debe reflejar una política intencionada. Listar muchos nombres sin revisar los registros del servidor a menudo crea una falsa confianza porque un error tipográfico en un token no coincide con el bot previsto.
Disallow excluye rutas del rastreo, no necesariamente de su descubrimiento o indexación. Disallow: /private/ apunta a ese prefijo de ruta, mientras que Disallow: / cubre todo el host. Un valor vacío no prohíbe nada. Allow puede crear una excepción dentro de una ruta más amplia bloqueada, pero el soporte de rastreadores y la interpretación de patrones merecen pruebas. Donde las reglas se superponen, la regla de coincidencia más específica generalmente determina el resultado, por lo que los bloqueos amplios y las excepciones estrechas necesitan una revisión cuidadosa.
Sitemap identifica un sitemap XML utilizando una URL absoluta completamente calificada. Google permite múltiples directivas Sitemap, lo que ayuda a los sitios con varios índices de sitemap o colecciones de contenido distintas. La directiva no otorga acceso a URLs bloqueadas, pero proporciona a los rastreadores una ubicación de descubrimiento confiable.
Crawl-delay pide a un rastreador que pause entre solicitudes. Algunos rastreadores, incluidos Bing y Yandex, pueden honrarlo, mientras que Google no lo utiliza. También puede estar mal configurado, ralentizando el rastreo útil sin resolver el problema real de carga del servidor. Para un control serio del tráfico, la limitación de tasa del lado del servidor es más confiable.
Host apareció en configuraciones más antiguas orientadas a Yandex, pero no es parte del protocolo estandarizado y generalmente debe considerarse como ruido obsoleto.
Directivas de Robots.txt de un Vistazo
| Directiva |
Propósito |
Honrado Por |
Trampa Común |
User-agent |
Selecciona el grupo de rastreadores |
Rastreadores que implementan robots.txt |
Token de bot mal escrito o desactualizado |
Disallow |
Excluye rutas coincidentes del rastreo |
Rastreadores cumplidores |
Usar / sin querer y bloquear todo el host |
Allow |
Crea una excepción o permite una ruta |
Rastreadores que apoyan el comportamiento de coincidencia relevante |
Suponer que cada rastreador resuelve conflictos de manera idéntica |
Sitemap |
Declara una URL de sitemap XML |
Rastreadores que leen directivas de sitemap |
Usar una URL relativa o apuntar a un sitemap muerto |
Crawl-delay |
Solicita un ritmo de solicitudes más lento |
Algunos rastreadores, incluidos Bing y Yandex |
Esperar que Google o cada bot lo honre |
Host |
Señal de host preferido heredada |
Implementaciones heredadas limitadas |
Tratar una directiva obsoleta como un control estándar |
La prueba práctica es la intención. Si no puedes explicar qué protege, mejora o hace descubrible una directiva, elimínala.
Controlando AI y Rastreadores de Búsqueda
Muchos propietarios de sitios asumen que una regla Disallow es un comando universal. No lo es. Robots.txt funciona como una capa de señalización para los rastreadores que eligen cumplir, no como una pared de aplicación para cada programa que solicita una página.
Los rastreadores de búsqueda clásicos como Googlebot y Bingbot generalmente utilizan robots.txt para decidir si pueden obtener una ruta. Los agentes de usuario relacionados con AI pueden incluir GPTBot, ClaudeBot, PerplexityBot, CCBot, Applebot-Extended y Google-Extended. Sus propósitos no son idénticos. Un rastreador de entrenamiento, un rastreador de recuperación, un agente de vista previa de enlaces y un rastreador de búsqueda pueden representar diferentes elecciones comerciales y de visibilidad.
Revisa los registros del servidor antes de escribir una lista de bloqueo. Busca las cadenas de user-agent reales que llegan a tu sitio, compáralas con la documentación del proveedor y decide si bloquear un rastreador podría eliminar tu contenido de un conjunto de datos de entrenamiento, un motor de respuestas o una función de búsqueda. Una auditoría LLM para estrategas de contenido puede ayudar a los equipos a examinar cómo aparece su contenido en los sistemas de IA antes de tomar decisiones de acceso.
Un bloque deliberadamente estrecho podría verse así:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: *
Allow: /
Esto expresa una preferencia por bloquear esos agentes nombrados mientras deja abierta la política general. No autentica al llamador, valida la identidad reclamada ni detiene a un raspador no cooperativo de ignorar el archivo.
IA y rastreadores de búsqueda, cumplimiento de robots.txt
| Rastreadores |
Token de user-agent |
Respeta robots.txt |
Notas |
| Google Search |
Googlebot |
Generalmente sí |
Mantener separado de los controles de Google relacionados con IA |
| Bing Search |
Bingbot |
Generalmente sí |
Puede soportar directivas de ritmo de rastreo |
| Rastreador de OpenAI |
GPTBot |
El comportamiento varía |
Verifica el token contra los registros actuales y la guía del proveedor |
| Rastreador de Anthropic |
ClaudeBot |
El comportamiento varía |
Un bloque es una preferencia, no una aplicación técnica |
| Rastreador de Perplexity |
PerplexityBot |
El comportamiento varía |
Considera su papel en la visibilidad del motor de respuestas |
| Common Crawl |
CCBot |
El comportamiento varía |
Trátalo por separado del rastreo de búsqueda comercial |
| Agente relacionado con IA de Google |
Google-Extended |
El comportamiento varía |
No lo confundas con el rastreo de búsqueda de Googlebot |
La evidencia empírica es incómoda pero útil. Un gran estudio encontró que los bots son menos propensos a cumplir con directivas más estrictas, mientras que los rastreadores de búsqueda de IA a menudo no verifican robots.txt en absoluto. Usa el archivo para comunicar la política a sistemas bien comportados, luego añade limitaciones de tasa, verificación de bots, controles de acceso y reservas aplicables de minería de texto y datos donde tu configuración legal y técnica lo soporte.
Probando y Validando el Archivo en Vivo
Un archivo robots.txt puede ser sintácticamente correcto y operativamente incorrecto. Prueba la respuesta de producción, las rutas exactas que importan y las identidades de los rastreadores que tu política apunta.
Comienza abriendo /robots.txt en el nombre de host en vivo en una ventana de navegador en modo incógnito. Verifica que el servidor devuelva la versión que editaste, no un archivo de staging o una respuesta en caché antigua. Confirma que la URL del sitemap se resuelva por separado e inspecciona las redirecciones porque una política en un host no rige automáticamente a otro.

Usa varias vistas de validación
- Verifica las rutas previstas. Prueba una página que debería permanecer rastreable, una carpeta que debería ser bloqueada y cualquier excepción creada con
Allow. Presta especial atención a una barra inclinada inicial y a las reglas que podrían coincidir con más URLs de las previstas.
- Usa Google Search Console. La documentación y la guía de pruebas de Google proporcionan una forma de inspeccionar si Googlebot puede acceder a una URL bajo la política en vivo. La guía de Google Webmaster Console es útil cuando necesitas conectar las verificaciones de robots con diagnósticos de indexación más amplios.
- Verifica con otro analizador. Un verificador de technicalSEO.com o la herramienta robots.txt de Screaming Frog pueden exponer patrones mal formados, directivas no soportadas o suposiciones que una herramienta no señala. Trata los resultados de terceros como una segunda opinión, no como prueba de que cada rastreador se comportará de manera idéntica.
- Revisa los registros de acceso. Después de la implementación, inspecciona las solicitudes de los user agents que te importan. Un camino bloqueado debería dejar de recibir solicitudes de rastreadores conformes, mientras que un camino permitido debería seguir siendo accesible. Los registros también revelan bots que afirman tener un nombre familiar pero no se comportan como el servicio genuino.
Vuelve a probar después de una actualización de CMS, cambio de plugin, migración de hosting, cambio de CDN o rediseño. Muchas plataformas generan robots.txt dinámicamente, por lo que un archivo manual puede ser reemplazado sin un error de implementación obvio. Un problema de tráfico o indexación que aparece inmediatamente después de un lanzamiento merece una verificación del archivo en vivo antes de un diagnóstico más profundo.
Una prueba de robots.txt no está completa hasta que el archivo que probaste coincida con el archivo que los rastreadores reciben realmente.
Mantenimiento de Robots TXT a lo Largo del Tiempo
Trata robots.txt como infraestructura de producción, no como una tarea de SEO única. El archivo se encuentra en una intersección sensible entre el acceso de rastreo, el descubrimiento de sitemaps, la política de contenido y la lógica de implementación. Necesita un propietario que sepa por qué existe cada regla.
Usa una lista de verificación de lanzamiento
Antes de que un nuevo sitio o rediseño se active, verifica lo siguiente:
- Alcance: El host de producción devuelve el archivo de texto plano previsto en
/robots.txt.
- Descubrimiento del Sitemap: Cada directiva de
Sitemap utiliza una URL completamente calificada y apunta a un sitemap XML activo.
- Acceso crítico: Las plantillas importantes, las páginas de productos, los artículos, JavaScript y CSS no son capturados por una regla de ruta amplia.
- Aislamiento de desarrollo: Las rutas de staging, vista previa, búsqueda interna, confirmación y administrativas no están expuestas a través de una política abierta accidentalmente.
- Comportamiento de la regla: Se ha probado una URL permitida representativa y cada ruta bloqueada importante.
- Cobertura del host: El protocolo canónico y el nombre del host sirven la política que se espera que utilicen los motores de búsqueda.
La guía de Google confirma que un host tiene un archivo robots.txt y que se admiten múltiples directivas de sitemap. Eso hace que la disciplina del nombre del host sea más importante que agregar una sintaxis elaborada. Un archivo bellamente formateado en el host incorrecto aún no controla nada útil.

Revísalo cuando cambie el negocio
Tres eventos deberían desencadenar una revisión inmediata:
- Cambios en las estructuras de URL: Un rediseño, migración o cambio de CMS puede hacer que las reglas de ruta antiguas sean irrelevantes y causar que nuevas reglas coincidan con contenido valioso.
- Lanzamiento de nuevas áreas del sitio: La búsqueda interna, la navegación facetada, las páginas de agradecimiento, las rutas de staging y las áreas solo para clientes pueden necesitar un tratamiento separado.
- Cambios en la política de rastreo: Los proveedores de IA introducen nuevos agentes y alteran cómo sus sistemas utilizan el contenido obtenido. Revisa los registros y la documentación del proveedor antes de agregar o eliminar tokens.
Una auditoría de rutina sigue siendo importante cuando nada obvio ha cambiado. La configuración de CDN, los complementos, las plantillas del servidor y los scripts de implementación pueden reescribir la respuesta. Agrega la verificación a tu lista de verificación de SEO técnico más amplia y haz que la validación sea parte de la revisión de lanzamiento en lugar de una respuesta de emergencia.
Almacena el archivo en control de versiones cuando tu plataforma lo permita. Requiere revisión de código para cambios, registra la razón comercial para cada anulación y mantén un camino de reversión para un Disallow: / accidental. AutoSEO puede encajar en este flujo de trabajo operativo como una plataforma que audita problemas de SEO técnico, gestiona robots.txt y herramientas de verificación relacionadas, publica cambios a través de integraciones de CMS compatibles y monitorea la visibilidad en búsqueda e IA.
Mantén un rastro de auditoría que responda a cuatro preguntas: quién cambió la política, qué cambió, por qué cambió y cómo se probó el resultado en vivo. Esa disciplina previene los errores más costosos de robots.txt, especialmente las reglas agregadas durante un lanzamiento apresurado y olvidadas después de que desaparece el problema original.
Si estás lanzando o revisando un sitio, utiliza AutoSEO para verificar el acceso a robots.txt junto con el sitemap, la indexación y problemas más amplios de SEO técnico. Revisa la política generada, valídala en el host en vivo y conecta el resultado a un flujo de trabajo de monitoreo continuo antes de tu próxima implementación.