LFW

Blog · Lo que encuentra la auditoría gratuita

Los cuatro archivos que nadie enlaza

Todo sitio web tiene cuatro archivos de texto plano que ningún visitante ve: robots.txt, sitemap.xml, security.txt y llms.txt. Los buscadores, los escáneres de seguridad y los agentes de IA los leen en cada visita.

Qué es cada uno, quién lo lee de verdad, qué poner en él y la única regla que los mantiene a todos seguros. Esta semana repasamos la lista en nuestro propio sitio y encontramos huecos, así que la auditoría gratuita ahora los comprueba.

Archivos para máquinas

Todo sitio web lleva unos cuantos archivos de texto plano en direcciones fijas a los que ninguna página enlaza. Un visitante nunca los ve. Los buscadores, los escáneres de seguridad, los gestores de contraseñas y ahora los agentes de IA los descargan en cada visita y actúan según lo que encuentran.

Hay cuatro que vale la pena tener: robots.txt, sitemap.xml, security.txt y llms.txt. Tres son convenciones establecidas desde hace años. Uno es una propuesta. Los cuatro toman alrededor de una hora, y los cuatro son gratuitos.

Esta semana repasamos esta lista en nuestro propio sitio, mientras escribíamos las recomendaciones que damos a los clientes, y encontramos dos de los cuatro ausentes y otro más delgado de lo que debía. Así que este artículo es también el registro de haber corregido primero nuestros propios huecos. La auditoría gratuita ahora comprueba los cuatro en cualquier sitio que le indique.

robots.txt: qué pueden leer los rastreadores

robots.txt vive en la raíz del sitio, en susitio.org/robots.txt. Le dice a los rastreadores qué partes del sitio pueden leer y cuáles deben dejar en paz, y nombra el sitemap. Google, Bing y todo rastreador que se comporte bien lo descargan antes que cualquier otra cosa.

Es una petición, no una cerradura. Un rastreador que decida ignorarlo puede hacerlo. De ahí sale la única regla que importa para este archivo: nunca liste una ruta que no querría que un desconocido encontrara. Una línea que diga Disallow: /documentos-de-la-junta/ no oculta los documentos de la junta. Publica su dirección a cualquiera que lea el archivo, y la gente lo lee. Todo lo sensible pertenece detrás de un inicio de sesión, y su ruta no pertenece a este archivo.

El segundo error más común es el bloqueo de pruebas. Un sitio en construcción recibe una regla Disallow: / para que los buscadores lo ignoren, y la regla sobrevive al lanzamiento. El sitio está en línea, la organización espera tráfico, y a Google se le ha dicho que no entre. Lo vemos en sitios que llevan un año publicados.

Un buen robots.txt para la mayoría de las organizaciones es corto. Permita todo, mantenga a los rastreadores fuera de la página de resultados de búsqueda, el carrito, el inicio de sesión y cualquier área privada, y nombre el sitemap.

Ver el código Ocultar el código Texto, 7 líneas
User-agent: *
Allow: /
Disallow: /portal/
Disallow: /admin/
Disallow: /search/

Sitemap: https://yoursite.org/sitemap.xml

En WordPress normalmente no hay un archivo físico. WordPress responde a la dirección por sí mismo con un contenido por defecto, y los plugins de SEO permiten editarlo desde el panel. Un archivo de texto plano subido a la raíz del sitio reemplaza a ambos.

sitemap.xml: la lista de páginas

El sitemap es la lista de páginas que quiere que se indexen, con la fecha del último cambio de cada una. Los buscadores pueden encontrar páginas siguiendo enlaces, pero el sitemap es cómo se enteran de una página nueva en horas en lugar de semanas, y es lo primero que piden Google Search Console y Bing Webmaster Tools.

WordPress genera uno automáticamente desde la versión 5.5, en /wp-sitemap.xml. La mayoría de los plugins de SEO lo reemplazan por uno mejor en /sitemap.xml. En cualquier caso, la dirección va en robots.txt, y el sitemap va en las dos herramientas para webmasters. Si nunca lo ha enviado, es una tarea de diez minutos con efecto duradero.

security.txt: a quién avisar

Cuando un investigador de seguridad encuentra un problema en un sitio web, quiere decírselo a alguien que pueda arreglarlo. La mayoría de los sitios de organizaciones no le dan más camino que el formulario de contacto general o adivinar una dirección de correo, y los reportes que entran por el formulario de contacto los responde quien responde el formulario de contacto.

security.txt resuelve esto. Es un estándar de internet, la RFC 9116, y vive en /.well-known/security.txt. Nombra un contacto para reportes de seguridad y lleva una fecha de caducidad para que un contacto obsoleto no quede en la web para siempre. Los revisores de seguridad y los escáneres automáticos que usan los equipos de compras de gobiernos y empresas comprueban su presencia como señal de que alguien cuida la tienda.

El archivo completo son unas pocas líneas.

Ver el código Ocultar el código Texto, 6 líneas
Contact: mailto:hello@yoursite.org
Contact: https://yoursite.org/contact/
Expires: 2027-09-01T00:00:00.000Z
Preferred-Languages: en
Canonical: https://yoursite.org/.well-known/security.txt
Policy: https://yoursite.org/security/

Dos detalles hacen tropezar a la gente. El campo de fecha se llama Expires y no puede estar a más de un año; un archivo con el nombre de campo equivocado o una fecha pasada es tratado como ausente por todo lo que lo lee.

Esta semana encontramos uno así en el sitio, por lo demás bien llevado, de una organización de incidencia, generado por un plugin que nombró mal el campo. Y el archivo es más útil con una página corta al lado, la línea Policy de arriba, que diga cómo maneja los reportes y que un investigador de buena fe no tiene nada que temer de usted. La nuestra está en LFW.com/security/ y son nueve párrafos cortos.

La carpeta .well-known es un lugar reservado para archivos como este, definido para que las herramientas sepan dónde buscar. Los gestores de contraseñas leen de ahí un archivo de cambio de contraseña, y el sistema de certificados la usa para comprobar que usted controla el dominio. Nada en el sitio enlaza ahí. Solo la lee el software, y de eso se trata.

llms.txt: una sugerencia, etiquetada con honestidad

llms.txt es el nuevo, y con el que hay que tener cuidado. Es una propuesta, no un estándar. La idea es una página corta de texto plano en /llms.txt que le diga a un asistente de IA qué es la organización y dónde están las páginas importantes, en una forma que el asistente pueda leer sin procesar el sitio entero.

Esto es lo que es cierto sobre él. Los rastreadores piden la dirección exista o no el archivo; el nuestro fue solicitado más de una docena de veces en las semanas anteriores a que lo publicáramos. No cuesta nada escribirlo ni servirlo. Y nadie ha demostrado que cambie el posicionamiento en buscadores ni lo que un asistente de IA dice de usted. Quien le diga lo contrario está adivinando.

Así que la postura honesta es que es una cortesía hacia las máquinas. No puede hacer daño, con una condición: nunca ponga en él nada que no pondría en la portada. Es público, como todos los archivos de este artículo.

El nuestro lista qué hace LFW, a quién servimos y una docena de páginas de referencia. Tomó veinte minutos, y cada enlace se comprueba en cada despliegue.

Qué comprueba ahora la auditoría gratuita

Desde esta semana, la auditoría gratuita descarga los cuatro archivos de cualquier sitio que le indique e informa lo que encuentra, con la gravedad puesta con honestidad. Un robots.txt o un sitemap ausentes son menores. Un robots.txt que bloquea el sitio entero es grave, porque el sitio es invisible para los buscadores mientras siga así. Un robots.txt que nombra rutas de aspecto privado se marca como hallazgo de seguridad, porque lo es. Un security.txt ausente o caducado es menor. Un llms.txt ausente es una sugerencia, y el hallazgo lo dice en su propio título.

Una precaución más, porque la auditoría también la dirá. Ninguno de estos archivos es un control de seguridad. Son señales de un sitio que alguien está cuidando, que es lo que un revisor de seguridad, un buscador y un responsable de compras intentan establecer. Eso vale una hora.

Siga leyendo

6 de septiembre de 2026 6 minutos

Nuestra imagen principal desaparecía en iPhone. Un bloqueador de anuncios la escondía.

Durante semanas, la imagen principal de tres de nuestras propias páginas desaparecía un segundo y medio en iPhone, solo en la primera carga. Nada lo reproducía en el laboratorio. Un rastreo de campo de cincuenta líneas lo encontró en tres cargas de página: un bloqueador de anuncios escondía cualquier elemento cuya clase empezara por ad-.

2 de septiembre de 2026 7 minutos

Por qué la página salta mientras carga

Qué es el desplazamiento del diseño y por qué se percibe como algo roto, las cuatro causas detrás de casi todos los casos (imágenes sin dimensiones, incrustaciones sin espacio reservado, fuentes que se intercambian, avisos inyectados tarde) y las correcciones exactas, incluido dónde WordPress ya conoce el ancho y el alto de cada imagen.

Todos los artículos →

Prefer to write?

Tell us what needs to work better.

Slow, fragile, hard to edit, missing a workflow. Say it plainly, and you'll get a straight answer, not a ticket number.

You'll get a straight answer, usually the same day.