Проектирует алгоритмически эффективные ML-системы. Оптимизирует end-to-end пайплайны с учётом вычислительной сложности. Применяет approximate algorithms для работы с большими данными (HyperLogLog, Count-Min Sketch).
Роли · ML Engineer · Senior
Что должен уметь Senior }
26 ключевых навыков, всего 58. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, API и интеграции.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 4
Проектирует стандарты качества ML-кода. Внедряет pre-commit hooks для ML-проектов. Настраивает CI для ML (тесты, линтинг, data validation). Создаёт cookiecutter-шаблоны для ML-проектов.
Проектирует ML-фреймворки с использованием SOLID. Создаёт расширяемые абстракции для training loops, model registry, experiment tracking. Применяет composition over inheritance для ML-компонентов.
Проектирует кастомные структуры данных для ML-пайплайнов. Работает с PyTorch Dataset/DataLoader. Оптимизирует data layouts для GPU-вычислений. Использует memory-mapped files для больших датасетов.
Backend Development · 1
Проектирует production-ready ML API: rate limiting, caching predictions, A/B testing через routing. Оптимизирует API для high-throughput inference. Использует middleware для logging и monitoring.
API и интеграции · 1
Проектирует production ML API: A/B testing через routing, model fallback, caching. Оптимизирует API для high-throughput inference. Реализует streaming responses для генеративных моделей.
Облако и инфраструктура · 2
Проектирует Docker strategy для ML workloads. Оптимизирует build cache для ML images. Создаёт base images для ML-команды. Настраивает GPU scheduling в Docker.
Проектирует Kubernetes deployment strategy для ML. Настраивает GPU scheduling и node affinity. Оптимизирует resource utilization для ML workloads. Использует Kubernetes Operators для ML.
Тестирование и QA · 1
Проектирует testing strategy для ML systems. Тестирует model behavior (regression tests, invariance tests). Настраивает automated model quality tests в CI.
Data Engineering · 4
Проектирует Spark-based ML pipelines для production. Оптимизирует Spark для ML workloads: memory tuning, shuffle optimization. Интегрирует Spark с ML platform (MLflow, feature store).
Проектирует data quality framework для ML. Интегрирует data validation в ML pipeline. Настраивает алертинг на аномалии в данных. Определяет data quality SLAs для ML.
Проектирует data processing pipelines для ML. Выбирает pandas vs Polars vs Spark для разных масштабов. Оптимизирует memory usage для больших датасетов. Пишет переиспользуемые feature transformers.
Проектирует ETL architecture для ML data pipeline. Оптимизирует ETL для больших объёмов данных. Настраивает data quality checks в ETL. Интегрирует ETL с feature store.
Machine Learning и AI · 9
Проектирует model monitoring architecture. Настраивает custom monitoring для специфических ML задач. Интегрирует monitoring с ML pipeline для closed-loop retraining.
Проектирует experiment tracking infrastructure. Автоматизирует experiment analysis. Интегрирует tracking с CI/CD для автоматического продвижения моделей.
Проектирует ML-системы на scikit-learn для production. Создаёт custom transformers и estimators. Оптимизирует pipeline performance. Интегрирует sklearn с MLflow для tracking и serving.
Проектирует feature store architecture. Оптимизирует materialization для больших объёмов. Настраивает streaming feature computation. Обеспечивает feature consistency between training и serving.
Проектирует production gradient boosting системы. Оптимизирует inference speed (model pruning, quantization). Строит ensemble из нескольких gradient boosting моделей. Интегрирует с feature store и model serving.
Проектирует ML pipeline architecture. Оптимизирует pipeline execution (caching, parallel steps). Настраивает CI/CD для pipeline deployment. Обеспечивает reproducibility.
Проектирует MLflow infrastructure для команды. Настраивает MLflow на Kubernetes. Интегрирует MLflow с CI/CD для automated model promotion. Создаёт custom model flavors.
Проектирует model serving architecture. Оптимизирует throughput (batching, GPU scheduling). Настраивает autoscaling для ML serving. Реализует model fallback и canary deployment.
Проектирует custom architectures и training frameworks. Оптимизирует inference: ONNX export, TensorRT. Настраивает distributed training (DDP, FSDP). Работает с PyTorch Lightning для production training.
Observability и мониторинг · 2
Проектирует logging strategy: retention, sampling, costs. Настраивает centralized logging (EFK/Loki/Datadog). Оптимизирует log volume и стоимость. Интегрирует логи с traces (через OpenTelemetry). Настраивает log-based alerting.
Проектирует observability stack для сервиса. Создаёт SLI/SLO дашборды. Пишет сложные PromQL (rate, histogram_quantile, recording rules). Настраивает Alertmanager с routing и silencing. Оптимизирует cardinality метрик. Интегрирует с PagerDuty/OpsGenie.
Контроль версий и коллаборация · 2
Ревьюит архитектуру ML-систем. Проверяет production readiness ML-кода. Менторит через code review. Формирует checklist для ML code review.
Проектирует Git workflow для ML-команды. Настраивает Git hooks для ML code quality. Интегрирует DVC с CI/CD. Управляет ML monorepo/multirepo strategy.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
37 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Мониторинг моделей: Продвинутый → Эксперт
- Трекинг экспериментов: Продвинутый → Эксперт
- Apache Spark: Продвинутый → Эксперт
- Classical ML (scikit-learn): Продвинутый → Эксперт
- Data Quality: Продвинутый → Эксперт
- Feature Stores: Продвинутый → Эксперт
- Gradient Boosting: Продвинутый → Эксперт
- ML-пайплайны: Продвинутый → Эксперт
- MLflow: Продвинутый → Эксперт
- Model Serving: Продвинутый → Эксперт
} в открытой матрице компетенций: 58 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.