Gestión de Datos en Inteligencia Artificial
Prof. Ignacio Olmeda AI LAB
La importancia del preprocesamiento de datos e ingeniería de características
- Como hemos visto, los algoritmos de aprendizaje automático (ML) utilizan datos para desarrollar modelos predictivos.
- Antes de utilizar tales algoritmos, el desarrollador debe seguir el proceso ETL (Extraer, Transformar, Cargar), que consiste en extraer información de fuentes confiables, transformar esa información para que sea utilizable y cargar la información en el sistema que utilizaremos para alimentar el algoritmo.
- Muchos investigadores sugieren que el proceso ETL consume más del 80% del tiempo de desarrollo en un proyecto de aprendizaje automático.
Extracción y carga de datos
- Respecto a la extracción y carga de datos, existen diversas soluciones que pueden emplearse para gestionar la cantidad masiva de datos que caracteriza a las aplicaciones de ML. Ejemplos de tales soluciones/sistemas/tecnologías comerciales son Hadoop, Hive, Spark, AWS, etc.
Transformación de datos
-
Con respecto a la transformación o procesamiento de datos, la tarea es altamente dependiente de aplicación y requiere un esfuerzo considerable del desarrollador.
-
Los algoritmos de ML pueden, teóricamente, encontrar patrones ocultos en datos sin procesar; esto significa que, en principio, no es necesario transformar los datos para hacerlos accesibles.
-
Sin embargo, al igual que los humanos, los algoritmos de aprendizaje automático pueden procesar más eficientemente datos con una representación particular. La representación o preprocesamiento proporciona una “pista” al algoritmo, facilitando en la mayoría de los casos el proceso de aprendizaje.
-
Observe también que algunas características de las instancias que podemos querer emplear pueden no ser numéricas (p. ej., etiquetas) y, por lo tanto, no pueden ser tratadas de manera analítica eficiente.
-
Por ejemplo, piense en el caso de las tareas de Amazon Mechanical Turk.
-
Finalmente, muchos algoritmos requieren que la dimensionalidad de los datos de entrada se mantenga constante; por ejemplo, el mismo número de píxeles en una imagen, de modo que los datos sin procesar pueden necesitar algún tipo de transformación.
-
Por estas y otras razones, el preprocesamiento de datos es una parte esencial de construcción de modelos de ML y condiciona fuertemente el resultado de todo el proceso.
-
La calidad de los datos es esencial en ML, ya que los datos son la materia prima para construir los modelos.
Características: propiedades e ingeniería
- Como mencionamos, los atributos en ML se llaman características, y pueden interpretarse como propiedades del objeto (medibles o no).
- Generalmente se requiere que las características sean independientes (sin relación entre ellas) y tengan poder discriminativo (de modo que añadan algo al problema en cuestión), pero incluso detectar tales propiedades simples es infeasible en la mayoría de los casos.
- Por ejemplo, las características pueden parecer independientes por pares, pero puede haber una variable latente que afecte a dos variables aparentemente independientes.
- Además, algunas variables pueden parecer no tener poder discriminativo, pero cuando se toman conjuntamente con otra variable, su poder puede aumentar radicalmente. Por ejemplo: .
Ingeniería de características
- La ingeniería de características es el área del ML que intenta obtener los mejores resultados posibles de un modelo predictivo transformando datos sin procesar en características que mejor representen el problema subyacente a los modelos predictivos.
- Tenga en cuenta que las características pueden ser propiedades directamente observables (p. ej., fecha de nacimiento), deben estimarse usando un modelo o aparato (temperatura) o pueden ser subjetivas.
Intuición sobre datos
-
Para detectar si los datos en cuestión son consistentes, el primer paso es tener una vista intuitiva. La visualización y las estadísticas descriptivas permiten entender la naturaleza de los datos.
-
Respecto a las estadísticas, algunas medidas estadísticas útiles son la media, la mediana (el punto central de distribución) y la moda (el valor más frecuente).
-
Ejemplo: datos 4 8 3 5 6 9 2 3 1
-
Media: 4.6
-
Mediana: 4
-
Moda: 3
-
También es relevante evaluar algunas medidas de dispersión, como el rango (la distancia entre el valor máximo y mínimo) o la varianza.
Medidas de co-movimiento
- También puede ser útil analizar medidas de co-movimiento, como la correlación.