Skip to content

Latest commit

 

History

168 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Data Analytics Portfolio

Proyectos de datos que he hecho durante el bootcamp de Data Analytics: SQL, Python, Machine Learning e Inteligencia Artificial, siempre sobre un caso de negocio concreto.

Autor: Borja Mora Méndez · Email: borja.mora.mendez@gmail.com · LinkedIn: linkedin.com/in/borjamoramendez


Estructura del portfolio

Data-Analytics-Portfolio/
├── 01-SQL/                     Consultas, modelado dimensional, ETL en T-SQL
├── 02-Python/                  4 casos de negocio EDA + 4 manuales de referencia
├── 03-Machine-Learning/        41 casos: supervisado, no supervisado, RRNN, series, refuerzo
└── 04-IA-BigData/              Agentes IA, LLMs, APIs, minería de datos, Big Data

Cada carpeta tiene su propio README con la lista de proyectos y las técnicas que usa cada uno.


Categorías

3 proyectos con T-SQL y SQL Server: CTEs, Window Functions (ROW_NUMBER, RANK, DENSE_RANK, NTILE, LAG, LEAD), subqueries correlacionadas, PERCENTILE_CONT, sumas acumuladas y un ejercicio tipo entrevista técnica.

Stack: T-SQL, SQL Server Management Studio, AdventureWorks2025.

Proyecto Qué se aprende
Análisis de ventas — Red de concesionarios CTEs, subqueries correlacionadas, LAG, PERCENTILE_CONT, PERCENT_RANK
AdventureWorks Avanzado — Window Functions ROW_NUMBER, RANK, DENSE_RANK, NTILE, LAG, LEAD, sumas acumuladas, examen tipo entrevista
Análisis de clientes — Tienda LEFT JOIN, subqueries IN/NOT IN, CASE, CTEs, Window Functions, PARTITION BY

Ver la sección completa →

4 análisis exploratorios sobre casos de negocio (comercial, educación, seguros y restauración) y 4 manuales de referencia de Pandas, NumPy y Matplotlib.

Stack: pandas, numpy, matplotlib, seaborn.

Ver la sección completa →

41 casos de ML ordenados por tipo de aprendizaje y familia de modelo: regresión, clasificación, clustering, PCA, t-SNE, redes neuronales (MLP, SOM), series temporales (ARIMA) y aprendizaje por refuerzo (SARSA).

Stack: scikit-learn, TensorFlow/Keras, XGBoost, minisom, statsmodels, pmdarima.

Cinco de ellos los he llevado hasta el final y tienen una app interactiva publicada:

Proyecto Qué se aprende App en vivo
Segmentación de clientes retail (K-Means + t-SNE) t-SNE para visualizar en 2D, elección honesta de k, validación contra el perfil que el negocio ya intuía Abrir app
Comparativa de modelos — Segmentación de aerolínea Regresión Logística vs Random Forest vs Gradient Boosting, mismo split y validación cruzada, explicabilidad Abrir app
Previsión de ventas retail (SARIMA vs SARIMAX) Series temporales con variables exógenas (huelgas, promociones), backtesting, cuánto aporta el contexto frente al histórico puro Abrir app
Preferencias de vuelos — análisis conjoint Valor de cada atributo del vuelo (utilidades parciales, importancia) y cómo cambia por segmento de cliente Abrir app
Ventas semanales retail (SARIMA) Previsión solo con el histórico: estacionariedad, ACF/PACF y comparación con referencias más exigentes que «repetir el año anterior» Abrir app

Ver los 41 proyectos →

Agentes de IA, sistemas de recomendación, APIs externas con mapas interactivos, minería de datos, visión artificial y procesamiento distribuido con Apache Spark. Lo siguiente que quiero añadir es la integración con LLMs (OpenAI, Anthropic, Groq y Ollama vía LangChain).

Stack: scikit-learn (TF-IDF, similitud coseno), ipyleaflet, mlxtend, ultralytics (YOLOv8), ByteTrack, PySpark (Spark SQL, MLlib).

Proyecto Qué se aprende
Chatbot de reservas — Nivel 0 Motor de reglas de negocio, menú conversacional, línea base de la progresión hacia agentes con IA
Recomendador de películas por contenido Filtrado basado en contenido (TF-IDF + similitud coseno), visualización PCA del espacio de películas, cuándo usarlo frente al filtrado colaborativo
Simulador de rutas reales — OSRM Consumo de API REST, fórmula de Haversine, interpolación de rutas, mapas interactivos con ipyleaflet
Cesta de la compra — Apriori Support/confidence/lift manual, algoritmo Apriori (mlxtend), reglas de asociación de 3+ productos
Detección de objetos en imágenes YOLOv8 preentrenado, límites de un modelo genérico frente a clases no vistas
Conteo de vehículos en vídeo YOLOv8 + ByteTrack, tracking de identidad entre frames, conteo por cruce de línea
Pipeline de ventas distribuido con PySpark Spark SQL, funciones de ventana, broadcast joins, planes de ejecución, particiones y caché, UDF vs nativo, Parquet, MLlib

Ver la sección completa →


Stack técnico

Ámbito Tecnologías
Análisis y modelado Python, SQL Server (T-SQL), pandas, NumPy
Machine Learning e IA scikit-learn, TensorFlow, Keras, statsmodels
Big Data Apache Spark (PySpark), Spark SQL, MLlib, Parquet
Business Intelligence Power BI, DAX, Power Query, Tabular Editor
Visualización Matplotlib, Seaborn
Entorno de desarrollo Jupyter, Visual Studio Code, Git, GitHub

Contacto


About

Portfolio de proyectos de datos: SQL, Python, Machine Learning e IA. Bootcamp de Data Analytics.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages