IA para la calidad de datos sin darle autoridad sobre los datos maestros
Un caso agéntico ficticio: IA que hace más rápidos a los data stewards sin convertirse en el data steward.
Elaborado de forma independiente. No contiene detalles de implementación, nombres internos ni cifras de ningún empleador o cliente.
01El resultado
Los data stewards trabajan una cola de sugerencias ordenadas por impacto, cada una con evidencia; las decisiones se registran con códigos de motivo y alimentan el emparejador; nada cambia en los datos maestros sin un data steward.
El CRM tiene probables cuentas duplicadas, nombres incoherentes y clasificaciones que faltan—y una propuesta para que un modelo lo arregle.
¿Dónde ayuda la IA a la calidad de datos—y por qué fusionar, renombrar y reclasificar debe seguir en manos de una persona?
Dar al agente solo autoridad de recomendación: sugiere con evidencia en una cola del data steward; fusionar, renombrar y reclasificar siguen siendo acciones del data steward que ejecuta el sistema.
Años de introducción manual han dejado el CRM con cuentas casi duplicadas, nombres escritos de varias maneras y muchas cuentas sin clasificación de sector o segmento. Algunos duplicados están vinculados a clientes del ERP, campañas y oportunidades abiertas. El modelo de identidad (ver Sistemas y CRM) dice qué clave define a un cliente; los datos todavía no son coherentes con él.
02La realidad · situación actual
Qué ocurre hoy—o en el piloto.
- Los probables duplicados parten el pipeline y la actividad
- Los nombres se escriben de varias maneras, así que las búsquedas no encuentran cuentas
- Muchas cuentas no tienen clasificación, así que los segmentos están incompletos
- Se propuso un modelo para fusionar duplicados automáticamente
- Las fusiones no se pueden deshacer limpiamente una vez que se mueven los vínculos con el ERP
- Los data stewards no tienen cola—solo hojas de cálculo
03Flujo del agente
Cada paso con su actor, su herramienta y su autoridad.
- 01Análisis
Un análisis programado selecciona cuentas por regla: nombres parecidos, dominios compartidos, campos vacíos.
- 02Sugerir
Candidatos a duplicado, un nombre normalizado, una clasificación probable.
- 03Evidencia
Por qué: mismo identificador fiscal, mismo dominio, misma dirección, historial parecido—y qué difiere.
- 04Cola del data steward
Sugerencias ordenadas por impacto: pipeline abierto, vínculos con el ERP, campañas.
- 05Decisión del data steward
Aceptar, editar o rechazar con un código de motivo.
- 06Aplicar
El sistema aplica los cambios aceptados mediante el proceso gobernado de fusión o actualización.
04Dimensión clave · Sugerir con evidencia, decide el data steward
Qué puede sugerir el agente—y qué decide solo un data steward
Cada tipo de hallazgo separa con claridad la sugerencia de la decisión, y la evidencia que debe acompañarla.
| Hallazgo | El agente puede | El data steward decide | Evidencia mostrada |
|---|---|---|---|
| Cuentas duplicadas | Sugerir pares candidatos con evidencia de similitud | Si se fusionan, qué registro sobrevive y qué pasa con los vínculos con el ERP | Identificador fiscal, dominio, dirección, contactos en común—y las diferencias |
| Nombres incoherentes | Proponer un nombre visible normalizado | La razón social siempre queda como está registrada; los nombres visibles, por regla del data steward | Variantes encontradas y sus fuentes |
| Clasificación que falta | Recomendar un sector o segmento con su motivo | La clasificación que determina segmentos y enrutamiento | Productos comprados, descripción de la web, cuentas similares |
| Descripciones incompletas | Redactar una descripción a partir de fuentes públicas e internas | Si es lo bastante precisa para guardarla | Fuentes citadas para cada afirmación |
La IA no puede arreglar una identidad poco fiable. Puede hacer la cola del data steward más corta y mejor documentada; la clave y la decisión siguen en manos de personas.
06Política de ambigüedad
Cuando el agente no está seguro.
- Candidato vinculado a clientes distintos del ERPEscalar
Marcado de alto impacto; deciden juntos el data steward y finanzas
- Solo evidencia débil (similitud de nombre)Detener
No se sugiere—el ruido erosiona la confianza del data steward
- Las fuentes de clasificación no coincidenContinuar
Se sugiere mostrando ambos motivos
07Evaluación
Puntuada por dimensión—nunca una única cifra de precisión.
| Dimensión | Pregunta | Medida | Objetivo |
|---|---|---|---|
| Precisión | ¿Son reales los duplicados sugeridos? | Aceptadas ÷ sugeridas | ≥ 85 % |
| Evidencia | ¿Muestra cada sugerencia el porqué—y qué difiere? | Sugerencias con evidencia completa | 100 % |
| Orden por impacto | ¿Van primero los casos de alto impacto? | Proporción de sugerencias aceptadas en la parte alta de la cola | Con seguimiento |
| Autoridad | ¿Ningún cambio de datos maestros sin un data steward? | Cambios no aprobados | 0 — bloquea la versión |
08Las contrapartidas
Opciones creíbles, evaluadas frente a estas premisas.
El modelo fusiona duplicados por encima de un umbral
Ninguno para datos maestros de cliente
Coste: Cambios irreversibles en CRM y ERPEmparejamiento solo por reglas
Claves limpias e introducción coherente
Coste: No capta los casos difusos que importanSugerencias de IA con evidencia en una cola del data steward
Datos desordenados con un modelo de identidad definido
Coste: Capacidad del data steward y una cola que operar09La segunda capa
Preguntas que cambian el diseño.
Autoridad
- ¿Quién es responsable de decidir una fusión?
- ¿Qué campos no pueden cambiarse nunca por sugerencia?
- ¿Cómo se tratan los registros vinculados al ERP?
Evidencia
- ¿Qué evidencia se exige para una sugerencia?
- ¿Cómo se muestran las diferencias?
- ¿Cuándo es una sugerencia demasiado débil para mostrarla?
Aprendizaje
- ¿Cómo mejoran los rechazos el emparejador?
- ¿Cómo se planifica la capacidad del data steward?
- ¿Cómo se mide la calidad de datos en el tiempo?
10Decisiones y entregables
Qué produce el trabajo.
- 01Tipos de hallazgo y reglas de evidencia
- 02Cola del data steward y orden
- 03Reparto de autoridad
- 04Códigos de motivo
- 05Conjunto de evaluación
- 06Tendencia de calidad de datos