Уроки 6-9: autolog, hyperparam sweep, grid search, serving + MLproject, walkthrough
This commit is contained in:
@@ -1,7 +1,10 @@
|
||||
# 🧪 MLflow Practice — практический проект
|
||||
|
||||
Проект для изучения MLflow на практике: от логирования экспериментов
|
||||
до Model Registry и загрузки моделей. Поддерживает **GPU (RTX 3090)** и CPU.
|
||||
до Model Registry, Model Serving и воспроизводимых запусков.
|
||||
Поддерживает **GPU (RTX 3090)** и CPU.
|
||||
|
||||
📖 **[CODE_WALKTHROUGH.md](CODE_WALKTHROUGH.md)** — подробный разбор каждого файла.
|
||||
|
||||
---
|
||||
|
||||
@@ -9,113 +12,128 @@
|
||||
|
||||
```
|
||||
mlflow-practice/
|
||||
├── requirements.txt # зависимости
|
||||
├── start_ui.sh # запуск MLflow Tracking Server
|
||||
├── README.md # этот файл
|
||||
├── data/ # датасеты (MNIST скачается автоматически)
|
||||
├── artifacts/ # графики, отчёты
|
||||
├── MLproject # Формат MLflow Projects (воспроизводимость)
|
||||
├── python_env.yaml # Окружение для MLproject
|
||||
├── requirements.txt # зависимости
|
||||
├── setup_server.sh # установка на GPU-сервере
|
||||
├── start_ui.sh # запуск MLflow Tracking Server
|
||||
├── CODE_WALKTHROUGH.md # экскурс по коду
|
||||
├── scripts/
|
||||
│ └── setup_git.sh # настройка Git (HTTPS + токен)
|
||||
└── src/
|
||||
├── train_simple.py # Урок 1: scikit-learn + Tracking
|
||||
├── train_gpu.py # Урок 2: PyTorch CNN на GPU (3090)
|
||||
├── register_model.py # Урок 3: Model Registry
|
||||
├── load_and_predict.py # Урок 4: загрузка и предсказание
|
||||
└── compare_runs.py # Урок 5: сравнение запусков
|
||||
├── train_simple.py # Урок 1: sklearn + Tracking (ручное)
|
||||
├── train_gpu.py # Урок 2: PyTorch CNN на GPU
|
||||
├── register_model.py # Урок 3: Model Registry
|
||||
├── load_and_predict.py # Урок 4: загрузка + предсказание
|
||||
├── compare_runs.py # Урок 5: сравнение через API
|
||||
├── autolog_demo.py # Урок 6: autolog (автоматическое)
|
||||
├── hyperparam_sweep.py # Урок 7: перебор гиперпараметров
|
||||
├── grid_search_cv.py # Урок 8: GridSearchCV + autolog
|
||||
└── serve_model.py # Урок 9: REST API сервер
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 🚀 Быстрый старт
|
||||
|
||||
### 1. Установка зависимостей
|
||||
### 1. Установка
|
||||
|
||||
```bash
|
||||
cd mlflow-practice
|
||||
# На GPU-сервере:
|
||||
bash setup_server.sh
|
||||
source .venv/bin/activate
|
||||
|
||||
# Базовые зависимости (CPU — работает везде)
|
||||
pip install mlflow scikit-learn pandas numpy matplotlib
|
||||
|
||||
# Для GPU-урока (RTX 3090) — установите PyTorch под вашу CUDA:
|
||||
# PyTorch под CUDA:
|
||||
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
|
||||
pip install flask # для serve_model.py
|
||||
```
|
||||
|
||||
### 2. Запуск MLflow UI (в отдельном терминале)
|
||||
### 2. Запуск MLflow UI
|
||||
|
||||
```bash
|
||||
./start_ui.sh
|
||||
# → откройте http://localhost:5000
|
||||
# → http://10.0.0.7:5000
|
||||
```
|
||||
|
||||
### 3. Урок 1 — scikit-learn (быстрый, CPU)
|
||||
### 3. Уроки по порядку
|
||||
|
||||
```bash
|
||||
python src/train_simple.py --n-estimators 50 --max-depth 5
|
||||
# Урок 1 — scikit-learn (CPU, ~5 сек)
|
||||
python src/train_simple.py --n-estimators 100 --max-depth 8
|
||||
python src/train_simple.py --n-estimators 200 --max-depth 12
|
||||
```
|
||||
python src/train_simple.py --n-estimators 50 --max-depth 5
|
||||
|
||||
Сравните результаты в UI → вкладка **Experiments → digits_classification**.
|
||||
|
||||
### 4. Урок 2 — PyTorch CNN на 3090
|
||||
|
||||
```bash
|
||||
# На GPU — быстро (3090 справится за пару минут)
|
||||
# Урок 2 — PyTorch CNN на 3090 (~1-2 мин)
|
||||
python src/train_gpu.py --epochs 10 --batch-size 256 --lr 0.001
|
||||
|
||||
# На CPU — медленно, уменьшите эпохи
|
||||
python src/train_gpu.py --epochs 2 --batch-size 64 --lr 0.01
|
||||
```
|
||||
|
||||
В UI посмотрите графики `train_loss` и `test_accuracy` по эпохам.
|
||||
|
||||
### 5. Урок 3 — Model Registry
|
||||
|
||||
```bash
|
||||
# Урок 3 — Регистрация лучшей модели
|
||||
python src/register_model.py --experiment digits_classification
|
||||
```
|
||||
|
||||
В UI → вкладка **Models** появится модель `digits_rf_model` со стадией **Production**.
|
||||
|
||||
### 6. Урок 4 — Загрузка и предсказание
|
||||
|
||||
```bash
|
||||
# Урок 4 — Загрузка и предсказание
|
||||
python src/load_and_predict.py
|
||||
|
||||
# Урок 5 — Сравнение запусков
|
||||
python src/compare_runs.py --experiment digits_classification --top 10
|
||||
|
||||
# Урок 6 — Autolog (автоматическое логирование)
|
||||
python src/autolog_demo.py
|
||||
|
||||
# Урок 7 — Hyperparameter sweep (20 комбинаций)
|
||||
python src/hyperparam_sweep.py --max-combos 20
|
||||
|
||||
# Урок 8 — GridSearchCV + autolog (parent/child runs)
|
||||
python src/grid_search_cv.py
|
||||
|
||||
# Урок 9 — Model serving (REST API)
|
||||
python src/serve_model.py --port 5001
|
||||
# → curl http://localhost:5001/predict_random
|
||||
```
|
||||
|
||||
### 7. Урок 5 — Сравнение запусков
|
||||
### 4. MLflow Projects (воспроизводимый запуск)
|
||||
|
||||
```bash
|
||||
python src/compare_runs.py --experiment digits_classification --top 10
|
||||
# Запуск через MLproject — MLflow сам создаст окружение
|
||||
mlflow run . -P n_estimators=200 -P max_depth=12
|
||||
mlflow run . -e gpu -P epochs=10 -P batch_size=256 -P lr=0.001
|
||||
mlflow run . -e sweep -P max_combos=30
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 🖥️ Специфика RTX 3090
|
||||
## 📚 Что изучает каждый урок
|
||||
|
||||
| Урок | Концепция MLflow | На чём |
|
||||
|---|---|---|
|
||||
| 1 | **Tracking**: params, metrics, artifacts, tags | RandomForest (digits) |
|
||||
| 2 | **Tracking + GPU**: логирование по эпохам, learning curves | PyTorch CNN (MNIST) на 3090 |
|
||||
| 3 | **Model Registry**: версии, стадии Staging→Production | лучшая модель из Урока 1 |
|
||||
| 4 | **Model Loading**: models:/name/stage | предсказание |
|
||||
| 5 | **API**: search_runs, order_by | сортировка по accuracy |
|
||||
| 6 | **Autolog**: одна строка вместо ручного логирования | GradientBoosting (wine) |
|
||||
| 7 | **Hyperparameter sweep**: itertools + random search | 20+ комбинаций RandomForest |
|
||||
| 8 | **GridSearchCV + autolog**: parent/child runs | 18 комбинаций × 5 фолдов |
|
||||
| 9 | **Model serving**: Flask REST API | REST эндпоинты для модели |
|
||||
|
||||
---
|
||||
|
||||
## 🖥️ RTX 3090
|
||||
|
||||
| Параметр | Значение |
|
||||
|---|---|
|
||||
| VRAM | 24 GB GDDR6X |
|
||||
| CUDA cores | 10496 |
|
||||
| Рекомендуемый batch-size | 256–512 для MNIST |
|
||||
| CUDA версия | 12.1 (рекомендуется) |
|
||||
| CUDA | 12.1 |
|
||||
| MNIST 10 epochs | ~1-2 минуты |
|
||||
|
||||
Код в `train_gpu.py` **автоматически** определяет CUDA:
|
||||
|
||||
```python
|
||||
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
|
||||
```
|
||||
|
||||
На 3090 обучение MNIST (10 epochs) займёт ~1-2 минуты.
|
||||
Код GPU-aware — автоматически выбирает CUDA если доступна.
|
||||
|
||||
---
|
||||
|
||||
## 💡 Эксперименты для самостоятельной работы
|
||||
|
||||
1. **Подбор гиперпараметров**: запустите `train_simple.py` с разными
|
||||
`--n-estimators` и `--max-depth`, сравните в UI
|
||||
2. **Визуализация**: добавьте логирование ROC-кривой как артефакта
|
||||
3. **Автолог**: попробуйте `mlflow.autolog()` вместо ручного логирования
|
||||
4. **GPU эксперименты**: в `train_gpu.py` попробуйте разные `--lr` и
|
||||
`--batch-size`, сравните графики learning curves
|
||||
5. **Model Registry**: обучите несколько версий, переведите лучшую в
|
||||
Production, остальные в Archived
|
||||
6. **Serving**: попробуйте `mlflow models serve -m models:/digits_rf_model/Production -p 5001`
|
||||
1. **Подбор гиперпараметров** — запустите sweep с `--max-combos 50`
|
||||
2. **Сравнение моделей** — обучите RandomForest vs GradientBoosting vs SVM
|
||||
3. **Autolog vs ручное** — запустите один датасет с autolog и без, сравните
|
||||
4. **Model Registry** — обучите несколько версий, переведите лучшую в Production
|
||||
5. **Serving** — поднимите REST API, отправьте запрос через curl
|
||||
6. **MLproject** — запустите через `mlflow run .` на другой машине
|
||||
|
||||
Reference in New Issue
Block a user