Определяет алгоритмические стандарты для data science команды, проводит review сложности решений. Формирует guidelines по выбору алгоритмов для различных масштабов данных. Координирует оптимизацию production ML-систем по computational cost.
Роли · Data Scientist · Lead
Что должен уметь Lead }
31 ключевых навыков, всего 78. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Lead }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Lead
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 4
Определяет стандарты использования Качество кода и рефакторинг на уровне команды/продукта. Проводит архитектурные review. Формирует best practices и обучающие материалы для всей команды.
Определяет стандарты ООП/SOLID для ML-исследовательской команды: архитектура классов экспериментальных пайплайнов, интерфейсные контракты обёрток моделей, гайдлайны дизайна модулей feature engineering. Проводит ревью, балансируя строгость ООП и скорость итерации исследований.
Определяет стандарты работы со структурами данных в ML-проектах команды. Формирует guidelines по оптимизации memory usage в production ML-системах. Координирует выбор data structures для масштабируемых feature engineering пайплайнов.
Backend Development · 1
Определяет архитектуру API обслуживания ML-моделей и трекинга экспериментов на FastAPI и Django. Устанавливает стандарты для эндпоинтов предсказаний, API результатов A/B-тестов и интеграций с feature store. Проводит ревью дизайна и определяет дорожную карту веб-сервисов ML-платформы.
Базы данных · 4
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Индексирование БД. Проводит review схем данных и стратегий масштабирования.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Оптимизация запросов. Проводит review схем данных и стратегий масштабирования.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты ClickHouse. Проводит review схем данных и стратегий масштабирования.
Определяет стратегию данных PostgreSQL для ML-команд: устанавливает стандарты проектирования feature store и управления обучающими данными, проектирует архитектуру БД для воспроизводимых ML-экспериментов, обеспечивает внедрение лучших практик PostgreSQL для воркфлоу data science.
API и интеграции · 1
Определяет API-стратегию для ML-сервисов на уровне продукта: стандарты API model serving, governance API ML-пайплайнов, политики эндпоинтов управления экспериментами. Проводит архитектурные ревью API для сервисов ML-платформы и устанавливает практики дизайна ML API.
Облако и инфраструктура · 2
Определяет стратегию инфраструктуры AWS для платформ data science, охватывающих экспериментальные окружения и продакшн ML-сервинг. Формирует стандарты IaC для SageMaker Studio, кластеров распределённого обучения и воспроизводимости экспериментов. Проводит архитектурные ревью, оптимизируя затраты ML-нагрузок, и координирует FinOps для вычислительных ресурсов data science.
Определяет Docker-стратегию для ML-workflow: governance GPU-контейнерной платформы, стандартизация сред экспериментов, политики жизненного цикла контейнеров моделей. Проводит архитектурные ревью контейнеризованной ML-инфраструктуры и оптимизирует FinOps GPU-вычислительных ресурсов.
Тестирование и QA · 1
Определяет стратегию тестирования на уровне продукта для ML-проектов: стандарты тестирования воспроизводимости экспериментов, governance валидации моделей, статистические фреймворки тестирования для сравнения моделей. Устанавливает культуру shift-left тестирования, балансируя скорость исследований и качество продакшен ML-кода.
Data Engineering · 5
Определяет data engineering стратегию. Формирует data platform. Координирует data teams. Оптимизирует data mesh/data fabric подходы.
Определяет стратегию ML-дашбордов для трекинга экспериментов и мониторинга моделей в DS-командах. Формирует платформу MLOps-визуализации, интегрируя MLflow, W&B и кастомные дашборды. Координирует ML-команды по стандартизированной отчётности производительности моделей и важности признаков.
Определяет стратегию качества данных для ML-команд, обеспечивая качество обучающих датасетов. Координирует стандарты валидации в feature stores и модельных пайплайнах. Продвигает инструменты observability и quality gates перед обучением моделей. Согласовывает практики качества с MLOps и data mesh.
Определяет стратегию data engineering для ML-команд. Формирует ML data-платформу: архитектура feature store, стандарты пайплайнов данных и governance тренировочных данных. Координирует ML-команды по общим библиотекам feature engineering и практикам качества данных. Продвигает внедрение современных инструментов обработки данных (Polars, Ray) для ML-нагрузок.
Определяет стратегию ETL ML data platform и стандарты feature engineering. Управляет воркфлоу подготовки обучающих данных в DS-командах, устанавливает политики версионирования данных и координирует ETL-инфраструктуру для обучения моделей.
Machine Learning и AI · 12
Определяет стратегию мониторинга моделей на уровне команды и продукта. Устанавливает стандарты порогов drift detection, SLO алертинга и эскалации инцидентов для задеплоенных моделей. Проводит ревью покрытия мониторингом и продвигает observability-инструментарий — Evidently или Arize — в командах.
Определяет стратегию Основы рекомендательных систем на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Определяет стратегию трекинга экспериментов для функции data science: выбирает и стандартизирует инструментарий (MLflow, W&B, Neptune) между командами, устанавливает межкомандные протоколы обмена экспериментами, обеспечивает соответствие практик трекинга требованиям управления моделями и аудита
Определяет стратегию Classical ML (scikit-learn) на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Определяет стратегию Feature Stores на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Определяет стандарты gradient boosting для data science команды. Формирует reusable training pipelines для табличных данных. Координирует выбор между gradient boosting и deep learning для различных типов задач и данных.
Определяет стратегическую дорожную карту внедрения LLM в data science процессы организации. Устанавливает стандарты оценки LLM-аналитики, включая детекцию предвзятости, измерение галлюцинаций и доменные бенчмарки точности. Принимает решения build-vs-buy для инфраструктуры эмбеддингов и RAG.
Определяет стратегию ML pipeline infrastructure для data science команды. Формирует стандарты pipeline development, testing и monitoring. Координирует унификацию pipeline-подходов между проектами и командами.
Определяет стандарты MLflow tracking для команд data science: соглашения именования, таксономии метрик и организацию экспериментов. Продвигает Model Registry как единый источник истины для governance. Ревьюит дизайн экспериментов и практики трекинга, обеспечивая воспроизводимость ML-проектов.
Определяет стратегию model serving для ML-команд. Устанавливает стандарты деплоя моделей, требования инфраструктуры serving и governance мониторинга. Проводит ревью архитектур serving. Продвигает внедрение лучших практик MLOps для надёжного деплоя моделей между командами.
Определяет стандарты PyTorch для DS-команды: структура экспериментов, требования воспроизводимости, версионирование моделей. Оценивает инструменты экосистемы (Lightning, TorchRec) для внедрения. Ревьюит архитектурные решения в пайплайнах обучения. Драйвит обмен знаниями по продвинутым паттернам.
Определяет стратегию NLP и Transformer на уровне команды: выбор архитектур, инфраструктура обучения, бенчмарки качества. Проводит архитектурные ревью ML-пайплайнов. Продвигает best practices по experiment tracking, версионированию моделей и воспроизводимости.
Контроль версий и коллаборация · 1
Определяет стратегию код-ревью для ML-исследовательской команды: стандарты ревью экспериментального кода, governance ревью качества моделей, практики ревью перехода от исследований к продакшену. Устанавливает культуру ревью, балансирующую свободу исследований и качество кода.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Principal
0 навыков получают более высокое ожидание или становятся ключевыми при переходе с Lead на Principal. Сначала самые большие скачки.
} в открытой матрице компетенций: 78 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.