A comprehensive, industry-grade data science repository showcasing end-to-end data pipelines, exploratory analytics, statistical modeling, machine learning, and model deployment across eight specialized domain projects.
Developed as part of the WorldQuant University Applied Data Science Lab program under Chipu Data Labs.
| Module | Project Focus | Core Techniques & Technologies |
|---|---|---|
| 01 | Housing in Latin America | EDA, Data Wrangling, Plotly, Pandas |
| 02 | Housing in Mexico Prediction | Linear Regression, Regularization (Ridge/Lasso), Scikit-Learn Pipelines |
| 03 | Air Quality in Nairobi | Time Series Analysis, AR/ARMA Models, Resampling |
| 04 | Earthquake Damage in Nepal | Classification, Decision Trees, Random Forests, Confusion Matrix |
| 05 | Bankruptcy in Poland | Imbalanced Data, Resampling, XGBoost, Precision-Recall Metrics |
| 06 | Customer Segmentation in US | Unsupervised Learning, PCA, K-Means Clustering |
| 07 | A/B Testing in E-commerce | Statistical Inference, Hypothesis Testing, Z-test, Chi-Square |
| 08 | Data Product Deployment | FastAPI, Model Serialization, Docker, Streamlit Deployment |
- Language: Python 3.10+
- Environment: Visual Studio Code / Jupyter Notebooks
- Libraries: Pandas, NumPy, Matplotlib, Seaborn, Plotly, Scikit-Learn, XGBoost, Statsmodels
- Version Control: Git & GitHub