K-medias
Algoritmo de aprendizaje no supervisado que agrupa observaciones en k grupos asignándolas al centroide más cercano.
Explicado fácil
K-medias busca formar k grupos de datos parecidos. No recibe etiquetas que indiquen de antemano a qué grupo pertenece cada observación: compara sus características y las reúne según su cercanía.
Una analogía
Imagina que colocas k mesas en una sala y repartes a cada persona entre la mesa más cercana. Después mueves cada mesa al centro de las personas que tiene alrededor y repites el reparto.
Un ejemplo
Una tienda puede agrupar clientes según la frecuencia de compra y el gasto medio. Los grupos resultantes ayudan a explorar patrones, pero el algoritmo no les asigna por sí mismo nombres como «ocasionales» o «fieles».
Cómo funciona (nivel técnico)
Se eligen k centroides iniciales. Cada punto se asigna al centroide más cercano y, a continuación, cada centroide se recalcula como la media de los puntos asignados. El proceso continúa hasta que las asignaciones o los centroides dejan de cambiar de forma apreciable. La función objetivo es la suma de distancias cuadráticas dentro de los grupos.
Errores comunes
- Creer que el algoritmo descubre automáticamente el número correcto de grupos: k se fija antes de ejecutarlo.
- Interpretar los grupos como categorías verdaderas; dependen de las variables, la escala y la inicialización.
- Aplicarlo sin revisar valores atípicos o variables con escalas muy distintas, que pueden dominar las distancias.