Формирует стратегию алгоритмической эффективности ML-платформы организации. Оценивает новые алгоритмические подходы (quantum-inspired, streaming algorithms) для масштабирования data science инфраструктуры. Определяет архитектурные принципы для compute-efficient ML.
Роли · Data Scientist · Principal
Что должен уметь Principal }
31 ключевых навыков, всего 77. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Principal }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Principal
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 4
Определяет стратегию применения Качество кода и рефакторинг на уровне организации. Принимает решения о подходах и инструментах. Менторит lead-разработчиков и формирует technical vision.
Определяет организационную ООП-стратегию для ML-исследований: корпоративные стандарты архитектуры экспериментальных пайплайнов, кросс-командный governance абстракций моделей, фреймворки дизайна кода от исследований до продакшена. Принимает стратегические решения по архитектуре ML-кода, балансируя скорость инноваций и сопровождаемость.
Формирует архитектурные принципы организации данных для ML-платформы. Определяет стратегию масштабирования data structures для петабайтных объёмов. Оценивает новые подходы к организации данных для ML-workloads.
Backend Development · 1
Определяет стратегию организации по веб-платформам обслуживания ML-моделей и экспериментирования, оценивая FastAPI и Django для MLOps-инструментов. Устанавливает корпоративные стандарты архитектур API предсказаний, фронтендов трекинга экспериментов и эталонные проекты сервисов ML-платформы.
Базы данных · 4
Определяет организационную стратегию данных для ML/AI нагрузок: выбор векторных БД для embedding-систем, архитектура feature store и мульти-региональная инфраструктура данных. Оценивает новые технологии БД для AI-кейсов (графовые БД, time-series, векторный поиск). Принимает решения по архитектуре данных, обеспечивающие эффективную тренировку и serving моделей в масштабе.
Определяет организационную стратегию доступа к данным для ML/AI нагрузок: архитектура запросов feature store, паттерны доступа к распределённым тренировочным данным и инфраструктура real-time serving фич. Оценивает новые data-технологии для эффективности ML. Продвигает data engineering excellence между data science командами для оптимизированной тренировки и serving моделей.
Определяет стратегическую роль ClickHouse в ML-платформе, проектируя слои вычисления и сервинга признаков для поддержки real-time и пакетного инференса. Обеспечивает кросс-командное согласование стандартов feature engineering между дата-сайентистами и дата-инженерами с использованием ClickHouse как вычислительного ядра. Оценивает новые возможности ClickHouse для ML-нагрузок и формирует инвестиционную стратегию организации в аналитическую инфраструктуру.
Определяет организационную стратегию данных для ML-платформ: оценивает PostgreSQL и комплементарные технологии для корпоративных feature stores, проектирует мультирегиональные архитектуры данных для глобальных пайплайнов обучения ML, устанавливает governance для жизненного цикла обучающих данных и управления lineage.
API и интеграции · 1
Определяет организационную API-стратегию для ML: корпоративные стандарты платформы ML API, кросс-командный governance API model serving, решения об инвестициях в API-инфраструктуру для ML-сервисов. Проектирует enterprise-grade архитектуру API для ML-платформ.
Облако и инфраструктура · 2
Определяет организационную облачную стратегию для инфраструктуры data science, оценивая мультиоблачные ML-платформы vs экосистему AWS SageMaker. Проектирует платформы экспериментов enterprise-уровня с воспроизводимыми окружениями, управляемым доступом к данным и масштабируемым управлением вычислениями. Формирует FinOps-практики для оптимизации затрат на обучение ML и экспериментирование на организационном уровне.
Определяет организационную контейнерную стратегию для data science: корпоративные стандарты платформы ML-экспериментов, кросс-командный governance GPU-ресурсов, фреймворки воспроизводимых сред обучения. Проектирует enterprise-grade контейнерную инфраструктуру для ML-экспериментирования и устанавливает практики FinOps.
Тестирование и QA · 1
Определяет организационную QA-стратегию для ML-исследований: корпоративные стандарты воспроизводимости экспериментов, кросс-командный governance валидации моделей, фреймворки quality engineering для workflow от исследований до продакшена. Внедряет платформенные решения тестирования качества ML-кода.
Data Engineering · 5
Определяет data стратегию организации. Проектирует enterprise data platform. Формирует data governance framework.
Определяет организационную стратегию наблюдаемости ML, объединяя трекинг экспериментов, мониторинг моделей и анализ признаков в единую платформу дашбордов. Проектирует корпоративный фреймворк MLOps-визуализации на базе MLflow, W&B и кастомных систем. Устанавливает governance прозрачности и воспроизводимости ML.
Определяет стратегию качества данных, обеспечивая надёжность данных для обучения и продакшена ML. Проектирует governance с валидацией в feature stores и model registries. Устанавливает стандарты сертификации и модели зрелости качества для ML-процессов. Формирует лучшие практики data-centric AI.
Определяет организационную стратегию данных для ML/AI: enterprise ML data-платформа, архитектура feature store и data governance для ответственного AI. Оценивает новые data-технологии для ML-нагрузок в масштабе. Продвигает data engineering excellence между data science командами. Формирует организационную data-культуру и практики для AI-ready инфраструктуры данных.
Формирует ML data архитектуру и видение ETL на уровне организации. Продвигает внедрение feature stores, определяет enterprise-стандарты lineage и версионирования обучающих данных и согласует ETL-инфраструктуру со стратегией AI/ML платформы.
Machine Learning и AI · 12
Определяет стратегию мониторинга моделей на уровне организации для ML-платформ и бизнес-подразделений. Устанавливает корпоративные стандарты model governance, drift detection и автоматической ремедиации. Продвигает централизованную инфраструктуру мониторинга с MLOps и DataOps. Менторит лидов по построению культуры мониторинга.
Определяет стратегию Основы рекомендательных систем на уровне организации. Формирует enterprise-подходы. Менторит leads и architects.
Формирует общеорганизационное видение трекинга экспериментов: продвигает внедрение единых платформ управления экспериментами в ML, аналитике и инженерии; определяет стандарты метаданных для межфункционального обнаружения экспериментов, аудита воспроизводимости и сохранения институциональных знаний
Определяет стратегию Classical ML (scikit-learn) на уровне организации. Формирует enterprise-подходы. Менторит leads и architects.
Определяет стратегию Feature Stores на уровне организации. Формирует enterprise-подходы. Менторит leads и architects.
Формирует стратегию использования gradient boosting на уровне ML-платформы. Определяет архитектурные решения для масштабируемого training и serving GBM-моделей. Оценивает новые подходы: differentiable trees, neural-boosting hybrids.
Формирует видение организации по LLM-аугментированной аналитике, согласуя исследовательские инициативы с бизнес-стратегией. Пионерит новые подходы, комбинируя LLM с каузальным выводом, симуляциями и системами принятия решений. Публикует результаты и влияет на индустриальные стандарты ответственного применения LLM.
Формирует стратегию ML orchestration platform на уровне организации. Определяет enterprise requirements: scalability, governance, cost management. Проектирует unified ML pipeline platform для всех data science команд.
Определяет корпоративную стратегию MLflow для бизнес-юнитов, проектируя единую масштабируемую инфраструктуру трекинга. Архитектурит интеграцию с Databricks, Snowflake и feature stores. Устанавливает общекорпоративный governance моделей с проверками compliance, аудит-трейлами и протоколами межкомандного шаринга.
Определяет организационную стратегию ML serving: стандартизация inference-платформы, governance деплоя моделей и дорожная карта инвестиций в ML-инфраструктуру. Оценивает новые технологии и оборудование для serving. Продвигает внедрение лучших практик production ML для всех data science команд.
Формирует стратегию PyTorch на уровне организации: управление версиями, миграция с TensorFlow, политики GPU-кластеров. Драйвит внедрение torch.compile и torch.export между командами. Определяет кросс-командные стандарты инфраструктуры обучения и деплоя. Влияет на экосистему через контрибьюции.
Определяет стратегию NLP и Transformer на уровне организации: инвестиции в foundation models, build-vs-buy для language AI. Устанавливает стандарты model governance, responsible AI и архитектуры data pipeline. Менторит лидов по масштабированию ML-организаций.
Контроль версий и коллаборация · 1
Определяет организационную стратегию код-ревью для ML-исследований: корпоративные стандарты ревью ML-кода, кросс-командный governance исследовательского кода, модель зрелости культуры ревью для ML-команд. Менторит лидов по балансу agility исследований и строгости код-ревью.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
} в открытой матрице компетенций: 77 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.