Проектирует алгоритмически эффективные ML-системы для работы с большими объёмами данных. Применяет approximate algorithms (LSH, HyperLogLog) для масштабируемых решений. Оценивает computational complexity моделей при выборе архитектуры.
Роли · Data Scientist · Senior
Что должен уметь Senior }
31 ключевых навыков, всего 78. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 4
Проектирует стандарты качества кода для ML-исследовательских кодовых баз: конвенции трекинга экспериментов, паттерны рефакторинга из ноутбуков в модули, требования воспроизводимости. Рефакторит прототипы моделей в production-grade код с правильным тестированием. Устанавливает практики ревью, балансируя скорость исследований и сопровождаемость кода.
Применяет ООП/SOLID в архитектуре ML-систем: абстрактные интерфейсы моделей для фреймворка экспериментов, strategy pattern для оптимизации гиперпараметров, чистые абстракции для загрузки/трансформации данных. Проектирует переиспользуемые фреймворки ML-экспериментов, позволяющие консистентно сравнивать различные архитектуры моделей.
Проектирует custom data structures для специфических ML-задач: efficient feature stores, approximate data structures для streaming data. Оптимизирует работу с данными через memory-mapped files и zero-copy операции. Применяет tries и suffix arrays для text mining.
Backend Development · 1
Проектирует решения на основе Python Web Frameworks для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Базы данных · 4
Проектирует архитектуру индексирования для инфраструктуры данных ML: векторные индексы (HNSW, IVF) для поиска по похожести эмбеддингов, time-series индексы для temporal feature store и специализированные индексы для graph-based feature engineering. Настраивает индексы БД для эффективного model serving и real-time извлечения фич. Оптимизирует паттерны доступа к данным между пайплайнами тренировки и инференса.
Проектирует архитектуру запросов для инфраструктуры данных ML: оптимизация запросов feature store, паттерны распределённых запросов для извлечения тренировочных данных большого масштаба и real-time извлечение фич для model serving. Реализует кеширование запросов для вычисления фич и автоматический бенчмаркинг производительности запросов. Менторит команду по эффективным паттернам доступа к данным для ML-воркфлоу.
Проектирует сквозные ML-пайплайны признаков на ClickHouse, оптимизируя извлечение данных для обучения и инференса. Использует встроенные ML-функции и статистические агрегаты ClickHouse для вычисления признаков внутри базы данных на петабайтных масштабах. Проектирует эффективные паттерны доступа к данным, минимизирующие потребление памяти при подаче больших датасетов в распределённые фреймворки обучения через чанковую итерацию.
Проектирует архитектуру PostgreSQL для ML-инфраструктуры данных: оптимизирует БД для крупномасштабных операций feature store, внедряет эффективное версионирование данных и отслеживание lineage, настраивает партиционирование и архивирование для жизненного цикла обучающих данных. Менторит команду по паттернам SQL-based feature engineering и оптимизации пайплайнов данных.
API и интеграции · 1
Проектирует архитектуру API для ML-сервисов: паттерны API model serving с версионированием, дизайн API feature store, эндпоинты управления экспериментами. Определяет API-контракты для компонентов ML-платформы. Менторит команду по дизайну production-grade API предсказаний ML.
Облако и инфраструктура · 2
Проектирует инфраструктурные решения AWS для продакшн-платформ data science — SageMaker Pipelines для ML-процессов, EMR для распределённого feature engineering и управляемый трекинг экспериментов. Оптимизирует затраты через SageMaker Savings Plans, spot-инстансы для обучения и интеллектуальное управление жизненным циклом данных. Внедряет security hardening с шифрованием данных, кросс-аккаунтной изоляцией и воспроизводимыми окружениями экспериментов.
Проектирует Docker-инфраструктуру для ML-workflow: воспроизводимые среды обучения с зафиксированными зависимостями, оркестрация GPU-контейнеров для экспериментальных пайплайнов, архитектура контейнеризованного model serving. Внедряет лучшие практики версионирования сред экспериментов и управления data volumes.
Тестирование и QA · 1
Проектирует стратегию тестирования для ML-исследовательского кода: пирамида тестирования, балансирующая скорость прототипирования и надёжность продакшена, фреймворки статистических assertions для качества моделей, тестирование воспроизводимости с фиксированными seeds и snapshot данных. Менторит команду по переводу исследовательского кода в тестированные продакшен-модули.
Data Engineering · 5
Проектирует аналитические фреймворки на Spark: кастомные MLlib-трансформеры для доменных признаков, распределённые пайплайны экспериментов и интеграция Spark с GPU-ускоренным обучением (Rapids). Оптимизирует end-to-end ML workflow'ы от подготовки данных до serving моделей в петабайтном масштабе.
Проектирует сквозные дашборды наблюдаемости ML, покрывающие жизненный цикл модели от обучения до продакшена. Оптимизирует системы визуализации для масштабного трекинга экспериментов. Внедряет фреймворки governance для отчётности по важности признаков и прозрачности моделей.
Проектирует data-архитектуру с Data Quality. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует архитектуру данных ML с Pandas/Polars: интеграция feature store, автоматизированные пайплайны валидации фич и эффективная загрузка данных для распределённой тренировки. Реализует фреймворки качества данных для целостности тренировочных данных. Создаёт организационные библиотеки и стандарты feature engineering. Менторит команду по масштабируемым паттернам обработки данных для ML.
Проектирует ETL-воркфлоу для сквозных ML-пайплайнов включая feature stores. Разрабатывает масштабируемые feature engineering трансформации, внедряет стратегии версионирования данных и строит автоматизированную валидацию обучающих данных в ETL.
Machine Learning и AI · 12
Проектирует end-to-end архитектуры мониторинга моделей для production ML-систем. Внедряет продвинутый drift detection, комбинируя статистические тесты, прокси производительности моделей и корреляцию с бизнес-KPI. Строит автоматические feedback loops от сигналов мониторинга к пайплайнам переобучения. Менторит команду по observability и реагированию на инциденты.
Глубоко владеет Основы рекомендательных систем. Проектирует решения для production-систем. Оптимизирует и масштабирует. Менторит команду.
Архитектурит масштабируемую инфраструктуру трекинга экспериментов: оптимизирует деплой MLflow/Neptune для высоконагруженного обучения, проектирует кастомные визуализации метрик для сложных сравнений моделей, устанавливает политики управления метаданными экспериментов и хранения артефактов
Обладает глубокой экспертизой в расширении scikit-learn кастомными estimators, meta-learners и stacking ensembles для production ML. Проектирует выбор моделей с Bayesian optimization и автоматизированным feature engineering. Менторит команду по воспроизводимости экспериментов и версионированию.
Проектирует архитектуру feature store для кросс-командного обмена и обнаружения фичей. Определяет политики управления фичами: версионирование, устаревание, контроль доступа. Менторит команды по лучшим практикам feature engineering и масштабируемым фиче-пайплайнам.
Проектирует gradient boosting системы для production: incremental learning, model compression, ONNX export. Оптимизирует inference speed через tree pruning и quantization. Реализует multi-output boosting и custom objective functions для специфических бизнес-задач.
Проектирует продвинутые RAG-архитектуры с гибридным поиском, ре-ранкингом и оптимизацией контекстного окна. Разрабатывает кастомные пайплайны NER и извлечения связей, комбинируя LLM с графами знаний. Менторит команду по анализу пространств эмбеддингов и методологии оценки LLM.
Проектирует масштабируемые ML-пайплайны для enterprise: Kubeflow, Vertex AI Pipelines, SageMaker Pipelines. Реализует continuous training, automated model promotion. Оптимизирует pipeline performance через caching, parallel execution и incremental processing.
Проектирует архитектуры MLflow tracking для продакшен ML, интегрируя с CI/CD и автоматическими гейтами валидации. Реализует кастомные плагины для доменных метрик и хранилищ артефактов (S3, GCS). Устанавливает governance model registry с воркфлоу согласования и процедурами отката.
Проектирует архитектуру model serving: масштабируемые inference-платформы, интеграция реестра моделей с автоматическим деплоем и гарантии консистентности online/offline фич. Реализует продвинутый мониторинг: детекция data drift, алерты деградации производительности моделей и автоматические триггеры переобучения. Создаёт лучшие практики serving и стандарты деплоя моделей. Менторит команду по паттернам MLOps.
Архитектурирует сложные пайплайны обучения PyTorch с распределённым параллелизмом данных. Реализует кастомные autograd-функции для исследований. Ведёт решения по архитектуре: механизмы внимания, residual connections, нормализация. Менторит команду по отладке и профилированию с torch.profiler.
Проектирует end-to-end NLP-системы на Transformer-моделях для production: custom-архитектуры, distributed training, distillation и квантизация. Оптимизирует latency и throughput для real-time приложений. Менторит команду по multi-task learning и domain adaptation.
Контроль версий и коллаборация · 1
Проектирует процессы код-ревью для ML-исследований: стандарты ревью экспериментального кода, чек-листы воспроизводимости обучения моделей, gates ревью перехода от исследований в продакшен. Менторит команду по балансу свободы исследований и качества продакшен-кода в ревью.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
77 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Алгоритмы и сложность: Продвинутый → Эксперт
- Индексирование БД: Продвинутый → Эксперт
- Качество кода и рефакторинг: Продвинутый → Эксперт
- Мониторинг моделей: Продвинутый → Эксперт
- Оптимизация запросов: Продвинутый → Эксперт
- Основы рекомендательных систем: Продвинутый → Эксперт
- Принципы ООП и SOLID: Продвинутый → Эксперт
- Структуры данных: Продвинутый → Эксперт
- Трекинг экспериментов: Продвинутый → Эксперт
- Apache Spark: Продвинутый → Эксперт
} в открытой матрице компетенций: 78 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.