Projekt analityczny (Big Data) badający globalny rynek gier wideo na podstawie klasycznego zbioru Video Game Sales (~16,5 tys. tytułów). Pełny pipeline w Pythonie: od eksploracji i czyszczenia danych, przez segmentację metodami uczenia nienadzorowanego, po model przewidujący sprzedaż.
- Zbiór: Video Game Sales (vgsales) — Rank, Name, Platform, Year, Genre, Publisher oraz sprzedaż w regionach NA/EU/JP/Other i globalnie.
- Plik:
video games sales.csv— nie jest dołączony do repozytorium; pobierz go z Kaggle (Video Game Sales) i umieść obok notebooka.
- EDA — sprzedaż wg regionów, platform, gatunków i wydawców; analiza trendów w czasie (m.in. „złota era" 2006–2009).
- Jakość danych — braki, duplikaty, niespójności sumowania sprzedaży regionalnej vs globalnej, ustalenie zakresu lat.
- Wartości odstające — detekcja metodą IQR (1.5×IQR) i analiza percentyli; kategoryzacja gier (Niche / Standard / Hit / Blockbuster).
- Feature engineering — udziały regionalne, dekady, rodziny platform; eksport oczyszczonego zbioru.
- Wizualizacje — histogramy, boxploty, heatmapy region–gatunek, mapy czasowe, interaktywny dashboard Plotly.
- Redukcja wymiarowości — PCA (2D/3D) na agregatach platforma–gatunek + analiza ładunków i wariancji wyjaśnionej.
- Klastrowanie — K-Means (metoda łokcia + silhouette score, k=5) z charakterystyką segmentów; opcjonalnie t-SNE.
- Model predykcyjny — RandomForestRegressor przewidujący
log(Global_Sales)na podstawie cech (platforma/gatunek/wydawca/rok); ocena R²/RMSE i ważność cech.
Projekt powstawał iteracyjnie. W katalogu głównym zostały dwa komplementarne, najbogatsze notebooki — razem pokrywają całość analizy:
| Notebook | Czym jest |
|---|---|
bg6.ipynb |
Najpełniejsza analiza eksploracyjna i segmentacja: EDA, jakość danych, PCA, K-Means + klastrowanie hierarchiczne (dendrogram, Adjusted Rand Index), wykrywanie anomalii Isolation Forest, analiza wydawców, cykle życia platform — z kompletem wyrenderowanych wykresów. |
vg4.ipynb |
Część predykcyjna: pełny pipeline + model RandomForestRegressor (log(Global_Sales), podział train/test, R²/RMSE, ważność cech) oraz interaktywne dashboardy Plotly. |
Wcześniejsze iteracje (video_games_analysis, vga, vga2, bg5, vg3) znajdują się w katalogu legacy/ — zachowane dla porządku, nie są potrzebne do uruchomienia projektu.
pip install pandas numpy matplotlib seaborn scikit-learn scipy plotlyOtwórz bg6.ipynb (analiza i segmentacja) lub vg4.ipynb (model predykcyjny) w Jupyterze albo Google Colab, upewnij się, że plik video games sales.csv jest dostępny obok notebooka, i uruchom komórki po kolei.
Python · pandas · numpy · scikit-learn (KMeans, PCA, t-SNE, RandomForest) · matplotlib · seaborn · plotly