data mining process models
Este tutorial sobre el proceso de minería de datos cubre los modelos, los pasos y los desafíos de la minería de datos involucrados en el proceso de extracción de datos:
Técnicas de minería de datos se explicaron en detalle en nuestro tutorial anterior en este Capacitación completa en minería de datos para todos . La minería de datos es un campo prometedor en el mundo de la ciencia y la tecnología.
La minería de datos, que también se conoce como descubrimiento de conocimientos en bases de datos, es un proceso de descubrimiento de información útil a partir de grandes volúmenes de datos almacenados en bases de datos y almacenes de datos. Este análisis se realiza para los procesos de toma de decisiones en las empresas.
La minería de datos se lleva a cabo utilizando diversas técnicas, como agrupación, asociación y análisis de patrones secuenciales y árbol de decisiones.
Lo que vas a aprender:
- ¿Qué es la minería de datos?
- Extracción de datos como proceso
- Modelos de minería de datos
- Pasos en el proceso de minería de datos
- Proceso de minería de datos en Oracle DBMS
- Proceso de minería de datos en Datawarehouse
- ¿Cuáles son las aplicaciones de la extracción de datos?
- Desafíos de la minería de datos
- Conclusión
- Lectura recomendada
¿Qué es la minería de datos?
La minería de datos es un proceso de descubrimiento de patrones y conocimientos interesantes a partir de grandes cantidades de datos. Las fuentes de datos pueden incluir bases de datos, almacenes de datos, la web y otros repositorios de información o datos que se transmiten al sistema de forma dinámica.
¿Por qué las empresas necesitan la extracción de datos?
Con la llegada de Big Data, la minería de datos se ha vuelto más frecuente. Big data son conjuntos de datos extremadamente grandes que pueden ser analizados por computadoras para revelar ciertos patrones, asociaciones y tendencias que los humanos pueden entender. Big data tiene amplia información sobre diversos tipos y contenido variado.
Por lo tanto, con esta cantidad de datos, las estadísticas simples con intervención manual no funcionarían. Esta necesidad la satisface el proceso de minería de datos. Esto conduce a un cambio de estadísticas de datos simples a algoritmos complejos de minería de datos.
El proceso de minería de datos extraerá información relevante de datos sin procesar como transacciones, fotos, videos, archivos planos y procesará automáticamente la información para generar informes útiles para que las empresas tomen medidas.
Por lo tanto, el proceso de minería de datos es crucial para que las empresas tomen mejores decisiones al descubrir patrones y tendencias en los datos, resumir los datos y extraer información relevante.
Extracción de datos como proceso
Cualquier problema empresarial examinará los datos sin procesar para construir un modelo que describirá la información y generará los informes que utilizará la empresa. La construcción de un modelo a partir de fuentes de datos y formatos de datos es un proceso iterativo, ya que los datos sin procesar están disponibles en muchas fuentes diferentes y en muchas formas.
Los datos aumentan día a día, por lo tanto, cuando se encuentra una nueva fuente de datos, puede cambiar los resultados.
A continuación se muestra el esquema del proceso.

(imagen fuente )
Modelos de minería de datos
Muchas industrias, como la de fabricación, marketing, química y aeroespacial, están aprovechando la minería de datos. Por lo tanto, la demanda de procesos de minería de datos estándar y confiables aumenta drásticamente.
Los modelos de minería de datos importantes incluyen:
# 1) Proceso estándar entre industrias para minería de datos (CRISP-DM)
CRISP-DM es un modelo de minería de datos confiable que consta de seis fases. Es un proceso cíclico que proporciona un enfoque estructurado para el proceso de minería de datos. Las seis fases se pueden implementar en cualquier orden, pero a veces sería necesario retroceder a los pasos anteriores y repetir las acciones.
¿Qué es la clave de seguridad de red para wifi?
Las seis fases de CRISP-DM incluyen:
# 1) Comprensión empresarial: En este paso, se establecen las metas de las empresas y se descubren los factores importantes que ayudarán a lograr la meta.
# 2) Comprensión de datos: Este paso recopilará todos los datos y completará los datos en la herramienta (si usa alguna herramienta). Los datos se enumeran con su fuente de datos, ubicación, cómo se adquieren y si se encuentra algún problema. Los datos se visualizan y consultan para comprobar su integridad.
# 3) Preparación de datos: Este paso implica seleccionar los datos apropiados, limpiar, construir atributos a partir de datos, integrar datos de múltiples bases de datos.
# 4) Modelado: En este paso se realiza la selección de la técnica de minería de datos, como el árbol de decisiones, generar un diseño de prueba para evaluar el modelo seleccionado, construir modelos a partir del conjunto de datos y evaluar el modelo construido con expertos para discutir el resultado.
# 5) Evaluación: Este paso determinará el grado en que el modelo resultante cumple con los requisitos comerciales. La evaluación se puede realizar probando el modelo en aplicaciones reales. El modelo se revisa para detectar errores o pasos que deban repetirse.
# 6) Despliegue: En este paso se hace un plan de implementación, se forma una estrategia para monitorear y mantener los resultados del modelo de minería de datos para verificar su utilidad, se hacen informes finales y se revisa todo el proceso para verificar cualquier error y ver si se repite algún paso .

preguntas de la entrevista core java con respuestas
(imagen fuente )
# 2) SEMMA (muestra, explora, modifica, modela, evalúa)
SEMMA es otra metodología de minería de datos desarrollada por SAS Institute. El acrónimo SEMMA significa muestrear, explorar, modificar, modelar, evaluar.
SEMMA facilita la aplicación de técnicas de visualización y estadísticas exploratorias, la selección y transformación de las variables predichas significativas, la creación de un modelo utilizando las variables para obtener el resultado y la verificación de su precisión. SEMMA también está impulsado por un ciclo altamente iterativo.

Pasos en SEMMA
- Muestra: En este paso, se extrae un gran conjunto de datos y se saca una muestra que representa todos los datos. El muestreo reducirá los costos computacionales y el tiempo de procesamiento.
- Explorar: Los datos se exploran en busca de valores atípicos y anomalías para una mejor comprensión de los datos. Los datos se verifican visualmente para averiguar las tendencias y agrupaciones.
- Modificar: En este paso, la manipulación de datos como la agrupación y la subgrupación se realiza manteniendo enfocado el modelo que se va a construir.
- Modelo: Con base en las exploraciones y modificaciones, se construyen los modelos que explican los patrones en los datos.
- Evaluar: En este paso se evalúa la utilidad y confiabilidad del modelo construido. Aquí se realiza la prueba del modelo con datos reales.
Tanto el enfoque SEMMA como el CRISP funcionan para el proceso de descubrimiento de conocimientos. Una vez que se crean los modelos, se implementan para empresas y trabajos de investigación.
Pasos en el proceso de minería de datos
El proceso de minería de datos se divide en dos partes, es decir, preprocesamiento de datos y minería de datos. El preprocesamiento de datos implica la limpieza de datos, la integración de datos, la reducción de datos y la transformación de datos. La parte de minería de datos realiza minería de datos, evaluación de patrones y representación del conocimiento de los datos.


(imagen fuente )
¿Por qué preprocesamos los datos?
Hay muchos factores que determinan la utilidad de los datos, como la precisión, la integridad, la coherencia y la puntualidad. Los datos deben ser de calidad si satisfacen el propósito previsto. Por lo tanto, el preprocesamiento es crucial en el proceso de minería de datos. A continuación se explican los pasos principales involucrados en el preprocesamiento de datos.
# 1) Limpieza de datos
La limpieza de datos es el primer paso en la minería de datos. Tiene importancia ya que los datos sucios si se usan directamente en la minería pueden causar confusión en los procedimientos y producir resultados inexactos.
Básicamente, este paso implica la eliminación de datos ruidosos o incompletos de la colección. Existen muchos métodos que generalmente limpian los datos por sí mismos, pero no son sólidos.
Este paso realiza el trabajo de limpieza de rutina mediante:
(i) Complete los datos que faltan:
Los datos faltantes se pueden completar mediante métodos como:
- Ignorando la tupla.
- Llenar el valor faltante manualmente.
- Utilice la medida de tendencia central, mediana o
- Completando el valor más probable.
(ii) Eliminar los datos ruidosos: El error aleatorio se denomina datos ruidosos.
Los métodos para eliminar el ruido son:
Binning: Los métodos de agrupación se aplican ordenando los valores en depósitos o agrupaciones. El alisado se realiza consultando los valores vecinos.
El binning se realiza suavizando por bin, es decir, cada bin se reemplaza por la media del bin. Suavizado por una mediana, donde cada valor de ubicación se reemplaza por una mediana de ubicación. Suavizado por límites de contenedor, es decir, los valores mínimo y máximo en el contenedor son límites de contenedor y cada valor de contenedor se reemplaza por el valor de límite más cercano.
- Identificar los valores atípicos
- Resolución de inconsistencias
# 2) Integración de datos
Cuando se combinan varias fuentes de datos heterogéneas, como bases de datos, cubos de datos o archivos para el análisis, este proceso se denomina integración de datos. Esto puede ayudar a mejorar la precisión y la velocidad del proceso de minería de datos.
Las diferentes bases de datos tienen diferentes convenciones de nomenclatura de variables, lo que provoca redundancias en las bases de datos. Se puede realizar una limpieza de datos adicional para eliminar las redundancias e inconsistencias de la integración de datos sin afectar la confiabilidad de los datos.
La integración de datos se puede realizar utilizando herramientas de migración de datos como Oracle Data Service Integrator y Microsoft SQL, etc.
# 3) Reducción de datos
Esta técnica se aplica para obtener datos relevantes para el análisis a partir de la recolección de datos. El tamaño de la representación es mucho menor en volumen mientras se mantiene la integridad. La reducción de datos se realiza utilizando métodos como Naive Bayes, árboles de decisión, red neuronal, etc.
Algunas estrategias de reducción de datos son:
- Reducción de dimensionalidad: Reducir la cantidad de atributos en el conjunto de datos.
- Reducción de la numerosidad: Reemplazo del volumen de datos original por formas más pequeñas de representación de datos.
- Compresión de datos: Representación comprimida de los datos originales.
# 4) Transformación de datos
En este proceso, los datos se transforman en una forma adecuada para el proceso de minería de datos. Los datos se consolidan para que el proceso de minería sea más eficiente y los patrones sean más fáciles de entender. La transformación de datos implica el mapeo de datos y el proceso de generación de código.
Las estrategias para la transformación de datos son:
- Suavizado: Eliminación de ruido de los datos mediante agrupamiento, técnicas de regresión, etc.
- Agregación: Las operaciones de resumen se aplican a los datos.
- Normalización: Escalado de datos para que caigan dentro de un rango más pequeño.
- Discretización: Los valores brutos de los datos numéricos se reemplazan por intervalos. Por ejemplo, Edad.
# 5) Minería de datos
La minería de datos es un proceso para identificar patrones y conocimientos interesantes a partir de una gran cantidad de datos. En estos pasos, se aplican patrones inteligentes para extraer los patrones de datos. Los datos se representan en forma de patrones y los modelos se estructuran mediante técnicas de clasificación y agrupamiento.
# 6) Evaluación de patrones
Este paso implica identificar patrones interesantes que representan el conocimiento basado en medidas de interés. Los métodos de resumen y visualización de datos se utilizan para hacer que los datos sean comprensibles para el usuario.
# 7) Representación del conocimiento
La representación del conocimiento es un paso en el que se utilizan herramientas de visualización de datos y representación del conocimiento para representar los datos extraídos. Los datos se visualizan en forma de informes, tablas, etc.
Proceso de minería de datos en Oracle DBMS
RDBMS representa datos en forma de tablas con filas y columnas. Se puede acceder a los datos escribiendo consultas en la base de datos.
Los sistemas de gestión de bases de datos relacionales, como Oracle, admiten la minería de datos mediante CRISP-DM. Las instalaciones de la base de datos Oracle son útiles para la preparación y comprensión de datos. Oracle admite la minería de datos a través de la interfaz java, la interfaz PL / SQL, la minería de datos automatizada, las funciones SQL y las interfaces gráficas de usuario.
Proceso de minería de datos en Datawarehouse
Un almacén de datos se modela para una estructura de datos multidimensional denominada cubo de datos. Cada celda de un cubo de datos almacena el valor de algunas medidas agregadas.
Minería de datos en espacio multidimensional realizada en estilo OLAP (Procesamiento Analítico Online) donde permite la exploración de múltiples combinaciones de dimensiones en distintos niveles de granularidad.
¿Cuáles son las aplicaciones de la extracción de datos?
La lista de áreas donde la minería de datos se usa ampliamente incluye:
# 1) Análisis de datos financieros: La minería de datos se utiliza ampliamente en banca, inversiones, servicios de crédito, hipotecas, préstamos para automóviles y servicios de inversión en seguros y acciones. Los datos recopilados de estas fuentes son completos, fiables y de alta calidad. Esto facilita el análisis y la minería de datos sistemáticos.
# 2) Industrias minoristas y de telecomunicaciones: El sector minorista recopila grandes cantidades de datos sobre ventas, historial de compras de los clientes, transporte de mercancías, consumo y servicio. La minería de datos minorista ayuda a identificar los comportamientos de compra de los clientes, los patrones de compra de los clientes y las tendencias, mejorar la calidad del servicio al cliente, mejorar la retención y la satisfacción de los clientes.
# 3) Ciencia e Ingeniería: La informática y la ingeniería de minería de datos pueden ayudar a monitorear el estado del sistema, mejorar el rendimiento del sistema, aislar errores de software, detectar plagio de software y reconocer fallas del sistema.
# 4) Detección y prevención de intrusiones: La intrusión se define como cualquier conjunto de acciones que amenacen la integridad, la confidencialidad o la disponibilidad de los recursos de la red. Los métodos de minería de datos pueden ayudar en el sistema de prevención y detección de intrusos para mejorar su rendimiento.
# 5) Sistemas de recomendación: Los sistemas de recomendación ayudan a los consumidores haciendo recomendaciones de productos que son de interés para los usuarios.
Desafíos de la minería de datos
A continuación se enumeran los diversos desafíos involucrados en la minería de datos.
- La minería de datos necesita grandes bases de datos y recopilación de datos que son difíciles de administrar.
- El proceso de minería de datos requiere expertos en el dominio que nuevamente son difíciles de encontrar.
- La integración de bases de datos heterogéneas es un proceso complejo.
- Las prácticas de nivel organizacional deben modificarse para utilizar los resultados de la minería de datos. Reestructurar el proceso requiere esfuerzo y costo.
Conclusión
La minería de datos es un proceso iterativo en el que el proceso de minería se puede refinar y se pueden integrar nuevos datos para obtener resultados más eficientes. La minería de datos cumple con el requisito de análisis de datos eficaz, escalable y flexible.
Puede considerarse como una evaluación natural de la tecnología de la información. Como proceso de descubrimiento de conocimientos, las tareas de preparación y extracción de datos completan el proceso de extracción de datos.
Los procesos de minería de datos se pueden realizar en cualquier tipo de datos, como datos de bases de datos y bases de datos avanzadas, como series de tiempo, etc. El proceso de minería de datos también presenta sus propios desafíos.
¡Estén atentos a nuestro próximo tutorial para saber más sobre los ejemplos de minería de datos!
mejores sitios para ver anime gratis
PREV Tutorial | SIGUIENTE Tutorial
Lectura recomendada
- Minería de datos: procesos, técnicas y problemas principales en el análisis de datos
- Técnicas de minería de datos: algoritmos, métodos y principales herramientas de minería de datos
- Las 10 mejores herramientas de mapeo de datos útiles en el proceso ETL (2021 LIST)
- Las 10 mejores herramientas de diseño de bases de datos para crear modelos de datos complejos
- Minería de datos Vs Aprendizaje automático Vs Inteligencia artificial Vs Aprendizaje profundo
- Las 15 mejores herramientas gratuitas de minería de datos: la lista más completa
- Concepto, proceso y estrategia de gestión de datos de prueba
- Parametrización de datos de JMeter mediante variables definidas por el usuario