# Diagnóstico de preparación para IA y buscadores

> Analiza tu sitio en seis categorías: descubrimiento, señales para IA, semántica, protocolos de agentes, rendimiento y seguridad. Gratis, con datos reales de Google.

La herramienta vive en https://c2suite.com/recursos/preparacion-ia y necesita un navegador. Eliges un perfil según tu tipo de sitio y con eso se decide qué categorías cuentan y cuánto pesa cada una.

## Perfiles

- **Sitio de contenido o blog**: Publicas artículos y quieres que te encuentren y te citen. No expones una API, así que los manifiestos de agentes no cuentan.
- **Producto digital o API**: Tienes un servicio que otros programas pueden usar. Aquí sí cuentan los manifiestos que permiten a un agente invocarte.
- **Sitio institucional**: Un sitio de empresa que presenta servicios y capta contactos. Lo que importa es que se encuentre, se entienda y cargue rápido cuando alguien llega desde un anuncio.

## Qué mide cada categoría

### Descubrimiento

Si un rastreador puede encontrar tu contenido y si le has dicho qué puede hacer con él. Es la capa más básica: sin esto, lo demás no llega a leerse.

- **robots.txt.** Que exista y se pueda leer. Es el primer fichero que pide cualquier rastreador.
- **Mapa del sitio.** Que /sitemap.xml responda con una lista de URLs. Sin él, el rastreador solo encuentra lo que esté enlazado.
- **Mapa declarado en robots.** Que robots.txt apunte al mapa. Es donde lo buscan los rastreadores que no lo adivinan.
- **Rastreadores de IA.** Si bloqueas a GPTBot, ClaudeBot, PerplexityBot o Google-Extended. Bloquearlos es una decisión válida, pero entonces no vas a aparecer en sus respuestas.
- **llms.txt.** Un índice en texto plano pensado para modelos de lenguaje. Todavía no es estándar, pero es barato y ya lo leen varios agentes.
- **ai.txt.** Declara por escrito si permites que tu contenido se use para entrenar modelos.

### Señales para buscadores e IA

Lo que le dice a un buscador o a un modelo de qué trata la página y quién la firma. Es lo que decide si te citan a ti o a la fuente que sí lo declaró.

- **Datos estructurados.** Que haya al menos un bloque JSON-LD válido. Es el formato que Google e IA leen sin interpretar.
- **Entidad declarada.** Que el JSON-LD diga quién eres: Organization, LocalBusiness o Person. Sin entidad, un modelo no sabe a quién atribuir lo que lee.
- **URL canónica.** Evita que el mismo contenido compita consigo mismo desde varias direcciones.
- **Título.** Que exista y quepa en un resultado de búsqueda, entre 15 y 65 caracteres.
- **Meta descripción.** Entre 50 y 165 caracteres. Es el resumen que se muestra y el que suele citar un modelo.
- **Open Graph.** Controla cómo se ve tu página cuando alguien la comparte en WhatsApp, LinkedIn o Slack.

### Contenido y semántica

Si el contenido se entiende sin ejecutar JavaScript y si su estructura tiene sentido. La mayoría de los rastreadores de IA no ejecutan JavaScript.

- **Contenido sin JavaScript.** Que el HTML que llega ya traiga el texto. Si la página se arma en el navegador, buena parte de los agentes ven una página en blanco.
- **Un solo H1.** El encabezado principal dice de qué trata la página. Ni cero ni cinco: uno.
- **Jerarquía de encabezados.** Que no se salten niveles (de H2 a H4). El esquema de encabezados es lo que usa un modelo para extraer un pasaje concreto.
- **Texto alternativo.** Que las imágenes tengan alt. Es accesibilidad y también es lo único que un modelo lee de una imagen.
- **Idioma declarado.** El atributo lang del HTML. Sin él, un modelo tiene que adivinar en qué idioma responderte.
- **Región principal.** Un elemento main que separe el contenido de la navegación y el pie.

### Protocolos de agentes

Manifiestos que permiten a un agente autónomo usar tu sitio, no solo leerlo. Solo aplican si expones una API o un servicio: publicarlos sin tenerlo es prometer algo que no existe.

- **Especificación OpenAPI.** Un contrato legible por máquina de lo que tu API sabe hacer.
- **Catálogo de API.** El punto de descubrimiento estándar (RFC 9727) desde el que un agente encuentra tus APIs.
- **Tarjeta MCP.** Declara tu servicio como herramienta invocable por un asistente que hable Model Context Protocol.
- **Catálogo de recursos para IA.** Un índice de documentos y servicios pensado para agentes, más flexible que el catálogo de API.

### Rendimiento

Los Core Web Vitals que Google usa para posicionar, medidos con usuarios reales de los últimos 28 días cuando tu dominio tiene tráfico suficiente. Es la categoría donde falla la mayoría de los sitios.

- **Carga del contenido principal.** Cuánto tarda en aparecer el elemento más grande de la pantalla. Por encima de 2,5 segundos la gente empieza a irse.
- **Respuesta a la interacción.** Cuánto tarda la página en reaccionar a un clic. Sustituyó al FID en marzo de 2024 y es la métrica que más castiga el exceso de JavaScript.
- **Estabilidad visual.** Cuánto se mueve el contenido mientras carga. Es lo que hace que alguien pulse el botón equivocado.

### Seguridad y confianza

Las señales que hacen que un agente, y una persona, se fíen de lo que hay del otro lado. Son cabeceras que se configuran una vez y no se vuelven a tocar.

- **HTTPS.** Que el sitio se sirva cifrado. Sin esto, lo demás de esta categoría no importa.
- **HSTS.** Obliga al navegador a usar HTTPS aunque alguien escriba la dirección sin él.
- **Política de contenido.** Limita de dónde puede cargar scripts tu página. Es la defensa principal contra el código inyectado.
- **X-Content-Type-Options.** Impide que el navegador adivine el tipo de un fichero y lo ejecute por error.
- **Referrer-Policy.** Controla cuánta información de tus URLs viaja a los sitios que enlazas.
- **Aviso de privacidad.** Que haya un enlace localizable. En México además es obligatorio si recoges datos personales.

---

Fuente: https://c2suite.com/recursos/preparacion-ia

Puedes citar y resumir este contenido atribuyéndolo a C2Suite y enlazando a la URL de origen.
