# Calidad de datos para IA

> Cuestionario sobre los datos de tu empresa: duplicados, estructura de campos, silos entre sistemas y gobierno. Devuelve un puntaje por frente y la lista de qué cerrar antes de automatizar con IA.

La herramienta interactiva vive en https://c2suite.com/recursos/calidad-de-datos. Lo contesta una persona: no se conecta a ningún sistema ni pide acceso a ninguna base, así que el resultado vale lo que valga la honestidad de las respuestas.

No se confunde con el diagnóstico de preparación para IA (https://c2suite.com/recursos/preparacion-ia): aquel analiza un **sitio web público** por su cuenta, y este pregunta por los **datos internos de la empresa**, que no se pueden leer desde fuera.

## Cómo se calcula

1. **Puntos de una respuesta** = los puntos de la opción elegida (de 0 a 3) × el peso de su pregunta (de 1 a 3).
2. **Puntaje de un frente** = puntos obtenidos ÷ puntos posibles × 100, donde los posibles son 3 × el peso de cada una de sus preguntas activas.
3. **Puntaje total** = promedio de los frentes activos ponderado por el peso de cada frente. El peso de un frente es fijo y no cambia con el tamaño de la empresa.
4. **Preguntas activas** = las que aplican al tamaño de la operación y a los sistemas declarados. Una pregunta que no aplica no se hace ni resta: desaparece.
5. **Frentes activos** = los que conservan al menos una pregunta activa. Un frente sin preguntas no entra con cero, se queda fuera del promedio.
6. **Brecha de una respuesta** = (puntos máximos − puntos obtenidos) × el peso de la pregunta. Es lo que ordena la lista de acciones.
7. **Prioridad de una acción** = se ordenan las brechas de mayor a menor y se acumulan sobre el total. La banda se decide con el acumulado **anterior** a esa acción: por debajo de 0.5 es prioridad alta, por debajo de 0.8 es media, y el resto es baja.

## Los 3 tamaños de operación

El tamaño decide qué sistemas se ofrecen y apaga las preguntas que no tienen sentido a esa escala. No cambia el peso de ningún frente.

- **Equipo pequeño** (4 sistemas en su catálogo: Hojas de cálculo y archivos, Un CRM, Sitio web o tienda en línea, Facturación, cobranza o ERP). Hasta unas quince personas. Casi todo pasa por dos o tres herramientas y alguien las conoce de memoria.
- **Empresa mediana** (5 sistemas en su catálogo: Hojas de cálculo y archivos, Un CRM, Sitio web o tienda en línea, Facturación, cobranza o ERP, Mesa de ayuda o tickets). Varias áreas con su propia forma de trabajar. Ya hay sistemas que una sola persona no controla.
- **Corporativo** (6 sistemas en su catálogo: Hojas de cálculo y archivos, Un CRM, Sitio web o tienda en línea, Facturación, cobranza o ERP, Mesa de ayuda o tickets, Almacén de datos o BI). Varias unidades o países, con área de sistemas y reglas propias de acceso a la información.

## Los 6 sistemas

«Sistema» es cualquier sitio donde vive un dato de cliente, incluidas las hojas de cálculo: en muchas empresas son la base de datos de verdad.

- **Hojas de cálculo y archivos**: Excel, Google Sheets, listas que alguien mantiene aparte.
- **Un CRM**: HubSpot, Salesforce, Pipedrive, Zoho o el que sea.
- **Sitio web o tienda en línea**: Formularios, chat, carrito, registros de eventos.
- **Facturación, cobranza o ERP**: El sistema donde se emite una factura o se registra un pago.
- **Mesa de ayuda o tickets**: Zendesk, Freshdesk, un buzón compartido con reglas.
- **Almacén de datos o BI**: BigQuery, Snowflake, Power BI, un data warehouse propio.

## Los 4 frentes

El cuestionario tiene 16 preguntas repartidas en estos frentes; cuántas se contestan depende del tamaño y de los sistemas. El enunciado de cada una, sus cuatro opciones y la acción que devuelve se ven al contestarlo.

- **Calidad y duplicados** (peso 3, 4 preguntas, se evalúa siempre). Si lo que hay guardado se puede creer. Un modelo no distingue un registro bueno de uno viejo: los promedia y contesta con seguridad las dos cosas a la vez.

- **Estructura y campos** (peso 2, 4 preguntas, depende de tu caso). Si los datos están donde se pueden encontrar. Lo que vive en texto libre se puede leer pero no agrupar, y lo que no se puede agrupar no se puede analizar.

- **Integraciones y silos** (peso 3, 4 preguntas, depende de tu caso). Cuántos sistemas guardan al mismo cliente y si dicen lo mismo. Es el frente que decide si una respuesta se basa en la operación entera o en el trozo que le tocó ver.

- **Gobierno y permisos** (peso 2, 4 preguntas, se evalúa siempre). Quién responde por los datos, quién puede sacarlos y qué se puede mandar fuera. Es lo que separa un proyecto de IA que arranca de uno que se queda parado en la revisión legal.

## Lectura del puntaje

### 0–39: Una IA aquí inventaría

Los datos están repartidos y no coinciden entre sí, así que cualquier respuesta automática saldría con la mitad de la historia y dicha con total seguridad. Esto no se arregla con un modelo mejor ni con más contexto: el trabajo está en juntar lo que hoy vive en tres sitios y decidir qué versión manda. Es aburrido y es lo único que funciona.

### 40–64: Sirve para leer, no para decidir

Se puede usar la IA para resumir, redactar y buscar dentro de lo que ya existe, y eso ya devuelve horas. Lo que todavía no aguanta es que decida algo sola —calificar, priorizar, contestarle a un cliente—, porque los huecos no están donde uno cree y nadie los va a revisar uno por uno.

### 65–84: Listos para lo acotado

La base sostiene un caso de uso concreto con datos concretos: un agente que contesta sobre una parte del negocio, una clasificación automática, un resumen que alguien firma. Lo que falta son frentes puntuales, y por eso la lista de abajo es corta: no hay que rehacer nada, hay que cerrar dos o tres cosas antes de ampliar el alcance.

### 85–100: La base no es el problema

Los datos no son lo que te está frenando. A este nivel el cuello de botella suele estar en otro lado: en qué proceso se elige, en quién revisa lo que el modelo produce y en cómo se mide si sirvió. Si algo de la lista de abajo te sorprende, empieza por ahí; si no, la siguiente conversación no es sobre datos.

## El tamaño y los sistemas deciden qué se pregunta

Antes de la primera pregunta se eligen dos cosas: de qué tamaño es la operación y dónde viven hoy los datos. No es un trámite de perfilado: es lo único que decide el cuestionario que sigue.

- El tamaño cambia el catálogo de sistemas que se ofrece. A un equipo pequeño no se le pregunta por un almacén de datos, y a un corporativo no se le esconde.
- Los sistemas marcados encienden o apagan preguntas. Con un solo sistema no se pregunta nada de silos: no puede haberlos.
- Nadie saca mala nota por algo que no tiene. Es la misma regla que apaga las preguntas de tickets en el diagnóstico de HubSpot cuando el portal no usa Service Hub.

## Cuatro frentes, no una nota global

Una base de datos casi nunca está mal en todo: suele estar limpia y aislada, o completa y sucia. Un número único esconde exactamente el frente por el que alguien vino.

- Calidad y silos pesan 3; estructura y gobierno pesan 2. Los dos primeros son los que hacen que un modelo conteste mal, no solo incómodo.
- El peso de cada frente es fijo y no cambia con el tamaño de la empresa. Lo que cambia con el tamaño es qué se pregunta.
- Un frente sin preguntas aplicables no entra en el puntaje. No suma cero: desaparece.

## De una respuesta al total

Cada pregunta tiene cuatro respuestas que valen de 0 a 3 puntos y un peso dentro de su frente. El frente saca su porcentaje sobre lo máximo que podía obtener, y el total pondera los frentes por su peso.

- Las opciones no son «poco, regular, bien»: describen situaciones concretas para que sea difícil contestar de memoria.
- Ponderar evita que un frente barato compense a uno caro solo por tener el mismo número de preguntas.
- Como solo entran los frentes que aplican, dos empresas con sistemas distintos siguen siendo comparables.

## Qué te llevas

El puntaje sirve para saber dónde estás; la lista de acciones, para saber qué hacer el lunes. Cada respuesta que no fue la mejor genera una acción concreta, ordenada por lo que cuesta dejarla como está.

- Las acciones se reparten en tres bandas de prioridad, igual que en la calculadora del costo del trabajo manual y en el diagnóstico de HubSpot.
- El orden sale del peso de la pregunta por lo lejos que quedó tu respuesta de la mejor, no de un orden fijo.
- Si contestas todo con la mejor opción, la lista sale vacía. También es un resultado.

## Qué no es, y en qué se diferencia del otro

Esto no lee tu base de datos. No pide acceso a ningún sistema, no se conecta a nada y no verifica nada de lo que respondas: es un cuestionario, y el resultado vale lo que valga tu honestidad al contestarlo.

- El diagnóstico de preparación para IA mide tu **sitio web** y lo hace solo, leyéndolo. Este pregunta por los **datos de tu empresa**, que no se pueden leer sin acceso.
- Contestar «como nos gustaría estar» da un puntaje bonito y una lista de acciones inútil.
- Nadie ve tus respuestas hasta que pulsas calcular; ahí se registran junto con tu correo, como en cualquier formulario del sitio.

## Preguntas frecuentes

### ¿Esto se conecta a mi CRM o a mi base de datos?

No, y es a propósito. Pedir acceso a la base de otra empresa para una herramienta pública es una barrera que casi nadie cruza, y una responsabilidad que no queremos tener sobre datos de tus clientes. Aquí contestas tú, en menos de cinco minutos, sin instalar nada ni autorizar ninguna aplicación.

### ¿En qué se diferencia del diagnóstico de preparación para IA?

En qué miran y en quién los contesta. El diagnóstico de preparación para IA analiza tu **sitio web** por su cuenta —lo lee, comprueba lo que encuentra y devuelve hallazgos verificables— y sirve para saber qué ven de ti los buscadores y los rastreadores de IA. Este pregunta por los **datos internos de tu empresa**, que ningún programa puede leer desde fuera, y sirve para saber si aguantan que les pongas un modelo encima. Se pueden contestar los dos: no se pisan.

### ¿Sirve si todo lo llevamos en hojas de cálculo?

Sí, y probablemente sea donde más se note. Las hojas cuentan como sistema: en muchas empresas son la base de datos de verdad, y fingir lo contrario hace que el diagnóstico se salte justo lo que hay que arreglar. Marca solo lo que uses y el puntaje se calcula sobre eso.

### ¿Cómo se calcula el puntaje?

Cada respuesta vale de 0 a 3 puntos y cada pregunta pesa de 1 a 3 dentro de su frente. El frente saca su porcentaje sobre el máximo que podía obtener, y el total es el promedio de los frentes activos ponderado por su peso: calidad y silos pesan 3, estructura y gobierno pesan 2. El desglose paso a paso está en el gemelo en markdown de esta página.

### ¿Un puntaje bajo significa que no podemos usar IA todavía?

No. Significa que no puedes usarla para que decida sola. Resumir, redactar, buscar dentro de documentos y clasificar con revisión humana funcionan igual con datos imperfectos, y suelen ser los primeros casos que se pagan solos. Lo que no aguanta una base sucia es un agente que conteste sin que nadie lo mire.

### ¿Qué pasa con mis respuestas?

Se quedan en tu navegador mientras contestas. Al pulsar «Ver mi diagnóstico» se envían junto con tu correo y quedan registradas en nuestro CRM, que es lo que nos permite escribirte sobre tu caso en vez de mandarte un texto genérico. El resultado ya no se edita: para probar otras respuestas hay que empezar de nuevo.

---

Fuente: https://c2suite.com/recursos/calidad-de-datos

Puedes citar y resumir este contenido atribuyéndolo a C2Suite y enlazando a la URL de origen.
