Эти навыки не влияют на основной грейд, но покажут полноту вашего профиля.
AI-ассистенты кодирования
▼
Использует ChatGPT и Claude как ассистентов для написания кода обработки данных и EDA. Формулирует промпты для генерации pandas-скриптов, SQL-запросов и базовых визуализаций. Проверяет корректность сгенерированного кода на тестовых данных.
Системно применяет LLM-ассистентов для ускорения data science workflow: генерация feature engineering кода, написание документации экспериментов, объяснение сложных статистических концепций. Критически оценивает предложенные решения.
Интегрирует LLM-ассистентов в процесс исследования и прототипирования моделей. Использует для literature review, генерации гипотез и code review ML-пайплайнов. Формирует best practices использования AI-ассистентов для команды.
Определяет политику использования AI-ассистентов в data science команде. Формирует guidelines по безопасности данных при работе с LLM, стандартизирует workflows. Оценивает ROI от внедрения AI-инструментов в data science процессы.
Знает о Cursor как AI-first IDE. Использует AI-чат для объяснения ML-кода и пайплайнов данных. Просит Cursor разъяснить незнакомые библиотеки: pandas, scikit-learn, PyTorch.
Использует Cursor Composer для multi-file editing. Применяет AI chat для рефакторинга. Генерирует тесты через AI. Использует @ mentions для добавления контекста (файлы, документация). Понимает разницу между Chat и Composer режимами.
Стандартизирует использование Cursor в DS-команде. Создаёт шаблоны .cursorrules для ML-пайплайнов, ноутбуков и репо экспериментов. Оценивает Cursor vs Copilot для исследования данных. Интегрирует AI-воркфлоу в ревью моделей и трекинг экспериментов. Настраивает MCP для платформы данных.
Использует GitHub Copilot для автодополнения кода обработки данных в Python. Применяет для генерации типовых pandas-операций, matplotlib-графиков и SQL-запросов. Критически оценивает предложенный код перед применением.
Продуктивно использует Copilot для ускорения data science workflow: feature engineering код, тесты, документация. Формирует эффективные комментарии-промпты для генерации ML-кода. Знает ограничения Copilot для специфического ML-кода.
Формирует best practices использования Copilot для data science команды. Оценивает quality сгенерированного ML-кода, настраивает Copilot для специфических ML-фреймворков. Интегрирует AI-assisted coding в code review процесс.
Определяет политику использования AI-coding assistants в data science команде. Формирует guidelines по security и IP compliance при работе с Copilot. Оценивает ROI от Copilot для различных data science tasks и ролей.
Batch-обработка данных
▼
Понимает основы Apache Spark для data science: Spark DataFrames для крупномасштабного анализа данных, базовые Spark SQL запросы и MLlib для распределённого обучения моделей. Следует командным паттернам для notebook-based Spark workflow'ов и feature engineering в масштабе.
Самостоятельно использует Spark для крупномасштабного анализа: пишет оптимизированный Spark SQL для сложных агрегаций, реализует распределённый feature engineering с window functions и использует MLlib для подбора гиперпараметров в масштабе. Управляет выделением ресурсов Spark для интерактивной аналитики.
Проектирует аналитические фреймворки на Spark: кастомные MLlib-трансформеры для доменных признаков, распределённые пайплайны экспериментов и интеграция Spark с GPU-ускоренным обучением (Rapids). Оптимизирует end-to-end ML workflow'ы от подготовки данных до serving моделей в петабайтном масштабе.
Определяет data engineering стратегию. Формирует data platform. Координирует data teams. Оптимизирует data mesh/data fabric подходы.
Понимает основы Pandas для data science воркфлоу: извлечение фич из сырых датасетов, статистический анализ через groupby/agg и подготовка данных для пайплайнов scikit-learn. Работает с категориальным кодированием, нормализацией и разбиением train/test. Следует командным практикам воспроизводимой обработки данных.
Реализует эффективные ML пайплайны данных с Pandas/Polars: feature engineering со сложными трансформациями, автоматический отбор фич на основе статистических тестов и эффективные стратегии сэмплирования данных. Использует Polars для высокопроизводительных вычислений фич на больших датасетах. Создаёт воспроизводимые фич-пайплайны с правильным версионированием.
Проектирует архитектуру данных ML с Pandas/Polars: интеграция feature store, автоматизированные пайплайны валидации фич и эффективная загрузка данных для распределённой тренировки. Реализует фреймворки качества данных для целостности тренировочных данных. Создаёт организационные библиотеки и стандарты feature engineering. Менторит команду по масштабируемым паттернам обработки данных для ML.
Определяет стратегию data engineering для ML-команд. Формирует ML data-платформу: архитектура feature store, стандарты пайплайнов данных и governance тренировочных данных. Координирует ML-команды по общим библиотекам feature engineering и практикам качества данных. Продвигает внедрение современных инструментов обработки данных (Polars, Ray) для ML-нагрузок.
Понимает основы SQL-based ETL для подготовки ML-данных. Пишет базовые запросы для извлечения и фильтрации обучающих датасетов. Следует установленным паттернам feature extraction и выполняет простые преобразования типов в ETL.
Строит ETL-пайплайны для feature engineering и подготовки обучающих данных ML. Реализует SQL-based feature-трансформации, управляет версионированием датасетов через snapshot-таблицы и обеспечивает воспроизводимость извлечения данных для экспериментов.
Проектирует ETL-воркфлоу для сквозных ML-пайплайнов включая feature stores. Разрабатывает масштабируемые feature engineering трансформации, внедряет стратегии версионирования данных и строит автоматизированную валидацию обучающих данных в ETL.
Определяет стратегию ETL ML data platform и стандарты feature engineering. Управляет воркфлоу подготовки обучающих данных в DS-командах, устанавливает политики версионирования данных и координирует ETL-инфраструктуру для обучения моделей.
CI/CD
▼
Использует GitHub Actions для DS: автоматический запуск тестов моделей, linting notebooks. Понимает basic CI workflow.
Проектирует CI для DS: automated model testing, data validation pipelines, notebook execution. Интегрирует MLflow в CI.
Определяет CI/CD стратегию: model training pipelines, automated evaluation, A/B test deployment. Внедряет ML CI best practices.
Определяет CI/CD стандарты DS: mandatory model tests, automated evaluation gates, reproducibility requirements.
Code Review
▼
Понимает базовые практики код-ревью для ML-кода: ревью изменений экспериментального кода, проверка логики feature engineering, валидация конфигураций обучения моделей. Следует командным гайдлайнам ревью для качества исследовательского кода.
Самостоятельно проводит код-ревью для ML-кода: оценивает качество экспериментального кода, ревьюит реализации feature engineering, проверяет воспроизводимость обучения моделей. Даёт конструктивную обратную связь, балансируя исследовательскую работу и сопровождаемость кода.
Проектирует процессы код-ревью для ML-исследований: стандарты ревью экспериментального кода, чек-листы воспроизводимости обучения моделей, gates ревью перехода от исследований в продакшен. Менторит команду по балансу свободы исследований и качества продакшен-кода в ревью.
Определяет стратегию код-ревью для ML-исследовательской команды: стандарты ревью экспериментального кода, governance ревью качества моделей, практики ревью перехода от исследований к продакшену. Устанавливает культуру ревью, балансирующую свободу исследований и качество кода.
Deep Learning
▼
Понимает основы глубокого обучения: нейронные сети, backpropagation, функции активации, loss functions. Обучает простые fully-connected и CNN модели через Keras/PyTorch. Использует предобученные модели для transfer learning задач.
Самостоятельно проектирует и обучает deep learning модели для production-задач. Работает с CNN, RNN/LSTM, Transformer-архитектурами. Применяет регуляризацию (dropout, batch norm, weight decay), оптимизирует гиперпараметры через systematic search.
Проектирует сложные deep learning архитектуры: multi-task learning, attention mechanisms, generative models (VAE, GAN). Оптимизирует обучение через mixed precision, distributed training, gradient accumulation. Применяет knowledge distillation для деплоя моделей.
Определяет стратегию deep learning для data science команды. Формирует стандарты training infrastructure, model architecture guidelines. Оценивает state-of-the-art подходы и принимает решения об их внедрении в production-системы.
Строит простые нейронные сети в PyTorch для табличных данных. Использует nn.Module для определения моделей. Понимает тензорные операции, autograd и базовый цикл обучения. Экспериментирует с функциями потерь и оптимизаторами (Adam, SGD). Отслеживает метрики экспериментов.
Проектирует кастомные архитектуры с nn.Module для сложных экспериментов. Использует PyTorch Lightning для структурированного обучения с callbacks и early stopping. Подбирает гиперпараметры через Optuna. Реализует кастомные функции потерь и LR-планировщики. Профилирует узкие места обучения.
Архитектурирует сложные пайплайны обучения PyTorch с распределённым параллелизмом данных. Реализует кастомные autograd-функции для исследований. Ведёт решения по архитектуре: механизмы внимания, residual connections, нормализация. Менторит команду по отладке и профилированию с torch.profiler.
Определяет стандарты PyTorch для DS-команды: структура экспериментов, требования воспроизводимости, версионирование моделей. Оценивает инструменты экосистемы (Lightning, TorchRec) для внедрения. Ревьюит архитектурные решения в пайплайнах обучения. Драйвит обмен знаниями по продвинутым паттернам.
Понимает основы reinforcement learning: agent, environment, reward, policy, value function. Знаком с базовыми алгоритмами: Q-learning, SARSA, policy gradient. Решает простые задачи через OpenAI Gym environments и stable-baselines3.
Применяет RL для бизнес-задач: рекомендательные системы, dynamic pricing, content personalization. Использует PPO, SAC, A2C через stable-baselines3. Проектирует reward functions для real-world задач, обрабатывает sparse rewards.
Проектирует production RL-системы: offline RL, contextual bandits, multi-agent RL. Применяет model-based RL для data-efficient обучения. Решает challenges production RL: safety constraints, online evaluation, sim-to-real transfer.
Определяет стратегию RL для data science команды. Формирует guidelines по применимости RL vs supervised learning. Координирует development RL infrastructure: simulation environments, evaluation frameworks, safety tools.
Работает с PyTorch или TensorFlow для обучения deep learning моделей. Создаёт Dataset/DataLoader, строит модели через nn.Module или Sequential API. Обучает модели с базовыми training loops, логирует loss и метрики.
Самостоятельно разрабатывает DL-модели в PyTorch/TensorFlow для production. Использует PyTorch Lightning или Keras для структурирования training кода. Применяет transfer learning, learning rate scheduling, gradient clipping. Работает с GPU training.
Проектирует production DL-системы на PyTorch/TensorFlow. Оптимизирует training через mixed precision, distributed training (DDP/FSDP), gradient checkpointing. Экспортирует модели в ONNX/TorchScript для оптимизированного inference.
Определяет DL framework стратегию для data science команды. Формирует training infrastructure standards и best practices. Координирует GPU resource management и distributed training setup для команды.
Понимает концепцию transfer learning: pre-trained модели, feature extraction, fine-tuning. Применяет transfer learning через Hugging Face и torchvision для image и text задач. Знает когда transfer learning эффективнее training from scratch.
Применяет transfer learning с предобученными моделями (ResNet, BERT) для доменно-специфичных задач. Дообучает модели на пользовательских датасетах с подходящим расписанием learning rate. Оценивает компромиссы между полным дообучением и извлечением признаков.
Проектирует transfer learning pipelines для масштабируемого fine-tuning. Применяет multi-task transfer learning, domain adaptation, few-shot learning. Создаёт domain-specific pre-trained модели для организации. Оптимизирует compute cost transfer learning.
Определяет стратегию transfer learning для data science команды. Формирует internal model hub с pre-validated pre-trained моделями. Координирует shared pre-training efforts и knowledge transfer между проектами.
Понимает базовые архитектуры нейросетей: MLP, CNN, RNN/LSTM и их применение. Знает компоненты: layers, activations, optimizers, loss functions. Создаёт простые архитектуры в PyTorch/Keras для типовых задач classification и regression.
Проектирует и реализует современные архитектуры: Transformers, U-Net, ResNet, EfficientNet. Применяет attention mechanisms, skip connections, residual learning. Выбирает оптимальную архитектуру в зависимости от задачи, данных и production-требований.
Проектирует custom архитектуры для специфических бизнес-задач. Применяет neural architecture search (NAS), progressive growing, модульный design. Оптимизирует архитектуры по latency/accuracy trade-off для production deployment.
Определяет architectural guidelines для deep learning проектов команды. Формирует model zoo с pre-validated архитектурами. Координирует research направления и evaluation новых архитектурных подходов для production использования.
Distributed Tracing
▼
Понимает OpenTelemetry для ML: tracing prediction requests, monitoring model latency.
Инструментирует ML: distributed tracing для prediction pipeline, custom metrics, feature latency.
Проектирует ML observability: end-to-end prediction tracing, model performance metrics, SLI.
Определяет observability стандарты: mandatory ML instrumentation, metric requirements.
Git и workflow
▼
Использует Git для версионирования notebooks и ML-кода. Выполняет базовые операции: commit, push, pull, branch, merge. Работает с .gitignore для исключения данных и моделей из репозитория. Понимает Git flow для data science проектов.
Применяет advanced Git workflows для командной data science работы. Использует git hooks для автоматического запуска linters и tests. Работает с Git LFS для версионирования моделей и датасетов. Решает merge conflicts в notebooks через nbdime.
Формирует Git-стратегию для ML-проектов: branching model для экспериментов, integration с DVC для data versioning. Настраивает CI/CD pipelines с Git hooks для автоматического тестирования ML-кода. Проводит code review ML-пайплайнов.
Определяет стандарты версионирования для data science команды: код, данные, модели, эксперименты. Формирует Git workflow guidelines для ML-проектов. Координирует integration Git с ML-платформой для reproducibility.
GraphQL
▼
Понимает GraphQL для DS: flexible data queries для ML features, metadata exploration.
Проектирует GraphQL для ML: feature discovery API, model metadata queries, experiment exploration.
Проектирует ML data API: unified feature access, model registry GraphQL, real-time subscriptions.
Определяет GraphQL стандарты для ML: schema design, access patterns, performance.
Kubernetes и оркестрация
▼
Понимает K8s для DS: containerized model serving, basic deployment. Запускает notebooks в K8s.
Деплоит ML в K8s: model serving (Seldon/KServe), training jobs, GPU scheduling. Настраивает resource limits.
Проектирует ML K8s architecture: Kubeflow, distributed training, auto-scaling model serving.
Определяет K8s стандарты для ML: GPU policies, model deployment patterns, resource management.
LLM и генеративный AI
▼
Понимает концепцию fine-tuning LLM: full fine-tuning vs parameter-efficient methods. Использует Hugging Face API для fine-tuning небольших моделей на custom-данных. Подготавливает training data в правильном формате для различных LLM-платформ.
Самостоятельно проводит fine-tuning LLM с использованием LoRA, QLoRA и prefix-tuning. Настраивает training hyperparameters, мониторит loss curves. Оценивает quality fine-tuned модели через domain-specific benchmarks и human evaluation.
Проектирует fine-tuning pipelines для production LLM-систем. Применяет RLHF, DPO для alignment моделей. Оптимизирует training через DeepSpeed, FSDP. Проводит systematic evaluation через automated benchmarks и red-teaming.
Определяет стратегию LLM fine-tuning для организации. Формирует стандарты data preparation, training, evaluation для custom LLM. Координирует GPU-инфраструктуру и бюджеты для LLM-экспериментов.
Применяет LLM API для базовой классификации текстов и извлечения именованных сущностей на структурированных данных. Генерирует эмбеддинги для простого поиска по схожести и кластеризации. Использует предобученные модели для извлечения инсайтов из текста.
Строит RAG-пайплайны, комбинируя векторные хранилища с LLM-генерацией для доменного поиска знаний. Проектирует стратегии эмбеддингов для мультимодального поиска по схожести. Дообучает классификационные головы поверх LLM-эмбеддингов, сравнивая с классическим ML.
Проектирует продвинутые RAG-архитектуры с гибридным поиском, ре-ранкингом и оптимизацией контекстного окна. Разрабатывает кастомные пайплайны NER и извлечения связей, комбинируя LLM с графами знаний. Менторит команду по анализу пространств эмбеддингов и методологии оценки LLM.
Определяет стратегическую дорожную карту внедрения LLM в data science процессы организации. Устанавливает стандарты оценки LLM-аналитики, включая детекцию предвзятости, измерение галлюцинаций и доменные бенчмарки точности. Принимает решения build-vs-buy для инфраструктуры эмбеддингов и RAG.
Создаёт базовые промпты для LLM: структурированные запросы для анализа данных, генерации кода, извлечения информации. Понимает принципы zero-shot и few-shot prompting. Итеративно улучшает промпты на основе качества ответов модели.
Применяет advanced prompting техники для data science задач: chain-of-thought, self-consistency, ReAct. Проектирует промпт-пайплайны для автоматизации аналитики. Оценивает качество промптов через systematic benchmarking на тестовых наборах.
Проектирует production prompt engineering systems для масштабируемых LLM-приложений. Применяет prompt optimization, automatic prompt tuning. Формирует prompt testing framework с regression testing и quality monitoring для production.
Определяет стратегию prompt engineering для data science команды. Формирует shared prompt library и best practices. Координирует prompt development workflow с version control и collaborative review.
MLOps
▼
Извлекает фичи из существующих feature store для обучения моделей. Понимает концепцию переиспользования фичей и online/offline-обслуживания. Следует командным соглашениям по именованию и версионированию фичей.
Разрабатывает и регистрирует новые фичи в feature store с надлежащей документацией. Реализует фиче-пайплайны с point-in-time корректностью для предотвращения утечки данных. Оценивает важность фичей и управляет их жизненным циклом для экспериментов.
Проектирует архитектуру feature store для кросс-командного обмена и обнаружения фичей. Определяет политики управления фичами: версионирование, устаревание, контроль доступа. Менторит команды по лучшим практикам feature engineering и масштабируемым фиче-пайплайнам.
Определяет стратегию Feature Stores на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Понимает основы деплоя ML-моделей: сериализация через pickle/joblib, REST API через веб-фреймворк. Создаёт простой inference endpoint для обученной модели. Тестирует модель в staging-среде перед production релизом.
Самостоятельно деплоит ML-модели в production с использованием MLflow, BentoML или TorchServe. Настраивает model versioning, A/B-тестирование моделей, canary releases. Мониторит prediction quality и data drift через automated alerts.
Проектирует ML serving infrastructure для high-throughput production-систем. Оптимизирует inference через model optimization: ONNX, TensorRT, quantization. Реализует feature store integration, online/offline serving, shadow mode для новых моделей.
Определяет стратегию ML deployment для data science команды. Формирует стандарты production readiness: SLA, monitoring, rollback procedures. Координирует ML engineering и DevOps для построения reliable ML serving platform.
Отслеживает ML-эксперименты в MLflow, логируя гиперпараметры, метрики и артефакты моделей для воспроизводимости. Использует MLflow UI для сравнения запусков различных алгоритмов (XGBoost, LightGBM, sklearn). Следует командным стандартам именования экспериментов, тегирования и хранения артефактов.
Выстраивает структурированные MLflow-воркфлоу для feature engineering, выбора моделей и оптимизации гиперпараметров. Интегрирует с Optuna/Hyperopt для автоматизированного тюнинга с полным логированием trials. Управляет жизненным циклом моделей в Model Registry, проводя через staging и production.
Проектирует архитектуры MLflow tracking для продакшен ML, интегрируя с CI/CD и автоматическими гейтами валидации. Реализует кастомные плагины для доменных метрик и хранилищ артефактов (S3, GCS). Устанавливает governance model registry с воркфлоу согласования и процедурами отката.
Определяет стандарты MLflow tracking для команд data science: соглашения именования, таксономии метрик и организацию экспериментов. Продвигает Model Registry как единый источник истины для governance. Ревьюит дизайн экспериментов и практики трекинга, обеспечивая воспроизводимость ML-проектов.
Понимает основы model serving: экспорт обученных моделей (pickle, ONNX, SavedModel), базовое создание API-обёрток с Flask/FastAPI и определение схем input/output модели. Следует командным практикам упаковки моделей и воркфлоу деплоя.
Реализует решения model serving: контейнеризированный деплой моделей (Docker/K8s), мониторинг data drift и качества предсказаний и canary deployment для безопасного роллаута моделей. Использует MLflow/BentoML для упаковки и serving моделей. Реализует feature engineering в serving-пайплайне, консистентный с тренировкой.
Проектирует архитектуру model serving: масштабируемые inference-платформы, интеграция реестра моделей с автоматическим деплоем и гарантии консистентности online/offline фич. Реализует продвинутый мониторинг: детекция data drift, алерты деградации производительности моделей и автоматические триггеры переобучения. Создаёт лучшие практики serving и стандарты деплоя моделей. Менторит команду по паттернам MLOps.
Определяет стратегию model serving для ML-команд. Устанавливает стандарты деплоя моделей, требования инфраструктуры serving и governance мониторинга. Проводит ревью архитектур serving. Продвигает внедрение лучших практик MLOps для надёжного деплоя моделей между командами.
Понимает базовые принципы мониторинга моделей для ML-экспериментов и задеплоенных моделей. Отслеживает ключевые метрики — accuracy, precision, recall — через MLflow или Weights & Biases. Следует стандартам команды по логированию предсказаний, обнаружению data drift и отчётности о деградации моделей.
Самостоятельно внедряет мониторинг моделей на всех этапах ML-lifecycle. Настраивает обнаружение data drift через Evidently или Great Expectations, отслеживает распределения фичей и создаёт автоматические триггеры переобучения. Понимает компромиссы статистических тестов для детекции дрифта в табличных и временных данных.
Проектирует end-to-end архитектуры мониторинга моделей для production ML-систем. Внедряет продвинутый drift detection, комбинируя статистические тесты, прокси производительности моделей и корреляцию с бизнес-KPI. Строит автоматические feedback loops от сигналов мониторинга к пайплайнам переобучения. Менторит команду по observability и реагированию на инциденты.
Определяет стратегию мониторинга моделей на уровне команды и продукта. Устанавливает стандарты порогов drift detection, SLO алертинга и эскалации инцидентов для задеплоенных моделей. Проводит ревью покрытия мониторингом и продвигает observability-инструментарий — Evidently или Arize — в командах.
Понимает основные метрики ML: accuracy, precision, recall, F1, ROC-AUC для классификации; RMSE, MAE, R² для регрессии. Проводит cross-validation для оценки generalization. Строит confusion matrix и classification report через scikit-learn.
Применяет advanced evaluation методы: stratified cross-validation, time-series split, nested cross-validation. Оценивает модели с учётом бизнес-метрик: lift, gain charts, expected calibration error. Анализирует модели на fairness и bias через disaggregated metrics.
Проектирует comprehensive evaluation framework для ML-моделей: offline metrics, online metrics, business KPIs. Реализует automated model validation gates перед production deployment. Применяет counterfactual analysis и SHAP для deep model diagnostics.
Определяет стандарты model evaluation для data science команды. Формирует evaluation checklist для каждого типа ML-задач. Координирует model review process и alignment между offline metrics и business outcomes.
Использует MLflow или W&B для базового трекинга экспериментов: логирование параметров, метрик и артефактов. Структурирует эксперименты по проектам, сравнивает runs через UI. Сохраняет модели с метаданными для воспроизводимости.
Самостоятельно выстраивает experiment tracking workflow для ML-проектов. Интегрирует MLflow/W&B с training pipelines для автоматического логирования. Настраивает artifact storage, model registry, experiment tags для организации работы.
Проектирует enterprise experiment tracking infrastructure. Интегрирует tracking с CI/CD, automated model promotion и deployment. Настраивает multi-team collaboration, access control и experiment governance для масштабной data science работы.
Определяет стандарты experiment management для data science команды. Формирует процессы experiment review, knowledge sharing и best practices. Координирует development experiment platform и интеграцию с ML infrastructure.
Отслеживает запуски обучения моделей с гиперпараметрами, метриками и версиями датасетов через MLflow или Neptune; следует командным инструкциям по организации экспериментов в проекты и сравнению с базовыми результатами
Проектирует структурированные иерархии экспериментов в MLflow или Neptune: группирует связанные запуски в родительские эксперименты, отслеживает решения по feature engineering наряду с метриками моделей, понимает компромиссы между детализацией трекинга и накладными расходами
Архитектурит масштабируемую инфраструктуру трекинга экспериментов: оптимизирует деплой MLflow/Neptune для высоконагруженного обучения, проектирует кастомные визуализации метрик для сложных сравнений моделей, устанавливает политики управления метаданными экспериментов и хранения артефактов
Определяет стратегию трекинга экспериментов для функции data science: выбирает и стандартизирует инструментарий (MLflow, W&B, Neptune) между командами, устанавливает межкомандные протоколы обмена экспериментами, обеспечивает соответствие практик трекинга требованиям управления моделями и аудита
NLP
▼
Понимает основы NLP: токенизация, стемминг, лемматизация, bag-of-words, TF-IDF. Применяет базовые NLP-методы для text classification и sentiment analysis. Использует spaCy и NLTK для обработки текстов на русском и английском языках.
Применяет современные NLP-методы: word embeddings (Word2Vec, FastText), sequence models (LSTM), pre-trained transformers (BERT, RuBERT). Решает задачи: NER, topic modeling, text summarization, semantic similarity. Fine-tunes BERT для domain-specific задач.
Проектирует production NLP-системы с LLM-integration. Разрабатывает RAG-pipelines, semantic search, document understanding системы. Оптимизирует NLP-модели для production: distillation, quantization, efficient inference. Работает с multilingual NLP.
Определяет NLP-стратегию для data science команды. Формирует reusable NLP-компоненты и shared text processing infrastructure. Координирует выбор между custom NLP моделей и LLM-based подходов для различных задач.
Понимает архитектуру Transformer (attention mechanisms, positional encoding) и базовые NLP-пайплайны. Использует pre-trained модели из Hugging Face для задач классификации текста и NER. Следует рекомендациям команды по предобработке данных и токенизации.
Fine-tune Transformer-моделей для доменных NLP-задач: sentiment analysis, суммаризация, question answering. Оценивает trade-offs между размером модели, скоростью inference и точностью. Реализует custom training loops с метриками и кросс-валидацией.
Проектирует end-to-end NLP-системы на Transformer-моделях для production: custom-архитектуры, distributed training, distillation и квантизация. Оптимизирует latency и throughput для real-time приложений. Менторит команду по multi-task learning и domain adaptation.
Определяет стратегию NLP и Transformer на уровне команды: выбор архитектур, инфраструктура обучения, бенчмарки качества. Проводит архитектурные ревью ML-пайплайнов. Продвигает best practices по experiment tracking, версионированию моделей и воспроизводимости.
NoSQL базы данных
▼
Запрашивает данные из ClickHouse через Python (clickhouse-driver, clickhouse-connect) для извлечения датасетов для ML-экспериментов. Преобразует результаты запросов в pandas DataFrame для разведочного анализа данных. Пишет базовые запросы выборки с использованием SAMPLE или ORDER BY rand() для создания репрезентативных обучающих подмножеств из больших таблиц.
Строит пайплайны извлечения признаков в ClickHouse с использованием агрегатных функций, оконных вычислений и операций с массивами для генерации ML-признаков в масштабе. Реализует эффективные стратегии стратифицированной выборки для подготовки обучающих данных на таблицах с миллиардами строк. Интегрирует ClickHouse с паттернами feature store, материализуя вычисленные признаки для повторного использования в нескольких ML-моделях.
Проектирует сквозные ML-пайплайны признаков на ClickHouse, оптимизируя извлечение данных для обучения и инференса. Использует встроенные ML-функции и статистические агрегаты ClickHouse для вычисления признаков внутри базы данных на петабайтных масштабах. Проектирует эффективные паттерны доступа к данным, минимизирующие потребление памяти при подаче больших датасетов в распределённые фреймворки обучения через чанковую итерацию.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты ClickHouse. Проводит review схем данных и стратегий масштабирования.
Prompt Engineering
▼
Создаёт базовые промпты для LLM в контексте data science: извлечение структурированных данных из текста, генерация описаний, классификация. Понимает различия между моделями (GPT-4, Claude, Llama) и их применимость для разных задач.
Проектирует промпт-системы для автоматизации data labeling и data augmentation. Применяет structured output, JSON mode, function calling для интеграции LLM в data pipelines. Оценивает стоимость и качество LLM-powered data processing.
Проектирует scalable prompt systems для production data science workflows. Оптимизирует cost/quality trade-offs через prompt chaining, caching и model routing. Реализует evaluation pipelines для prompt quality с automated regression testing.
Определяет стратегию использования LLM для data augmentation и labeling в команде. Формирует shared prompt library и evaluation standards. Координирует cost management для LLM-powered data processing.
REST API
▼
Понимает базовые концепции REST API для ML-workflow: эндпоинты предсказаний моделей, API получения данных фич, основы API трекинга экспериментов. Следует командным конвенциям потребления и дизайна простых API model serving.
Самостоятельно проектирует REST API для ML-сервисов: эндпоинты предсказаний моделей с правильной валидацией входных данных, API получения фич, эндпоинты результатов экспериментов. Понимает лучшие практики форматов ответов ML API, версионирования моделей в эндпоинтах и паттернов async-предсказаний.
Проектирует архитектуру API для ML-сервисов: паттерны API model serving с версионированием, дизайн API feature store, эндпоинты управления экспериментами. Определяет API-контракты для компонентов ML-платформы. Менторит команду по дизайну production-grade API предсказаний ML.
Определяет API-стратегию для ML-сервисов на уровне продукта: стандарты API model serving, governance API ML-пайплайнов, политики эндпоинтов управления экспериментами. Проводит архитектурные ревью API для сервисов ML-платформы и устанавливает практики дизайна ML API.
System Design
▼
Понимает базовые принципы проектирования систем: клиент-сервер, REST API, базы данных. Знает, как ML-модели интегрируются в production-системы. Понимает scalability challenges при деплое ML-моделей и работе с большими данными.
Проектирует ML-системы с учётом scalability и reliability. Понимает microservices architecture, message queues, caching для ML-serving. Работает с Docker для containerization ML-моделей, настраивает basic monitoring и alerting.
Проектирует end-to-end ML-системы: data ingestion, feature computation, training, serving, monitoring. Применяет event-driven architecture для real-time ML. Оптимизирует system design для cost efficiency и reliability.
Определяет architectural standards для ML-систем команды. Формирует reference architectures для типовых ML use cases. Координирует ML engineering и platform teams для построения reliable ML infrastructure.
Unit-тестирование
▼
Пишет базовые unit-тесты для data science кода через тестовый фреймворк. Тестирует функции обработки данных, feature engineering и model predictions. Понимает важность тестирования для reproducibility ML-экспериментов и data quality.
Систематически тестирует ML-код: data processing pipelines, model training, inference. Применяет fixtures, parametrize, mocking в pytest для изоляции тестов. Пишет data quality тесты через Great Expectations. Настраивает test coverage для ML-проектов.
Проектирует testing strategy для ML-систем: unit tests, integration tests, model performance tests. Создаёт тестовые фреймворки для validation ML-пайплайнов. Внедряет property-based testing через Hypothesis для data processing функций.
Определяет стандарты тестирования для data science команды. Формирует test automation framework, CI/CD integration для ML-тестов. Координирует quality gates для ML model deployment через automated testing.
Понимает основы юнит-тестирования ML-кода: pytest для функций предобработки данных, тестовые фикстуры с примерами датасетов, паттерны assertions для форм выходов модели. Следует командным практикам тестирования feature engineering и логики трансформации данных.
Самостоятельно пишет юнит-тесты для ML-кода: pytest для функций feature engineering и трансформации данных, тестовые фикстуры с воспроизводимыми датасетами, покрытие граничных случаев обработки пропущенных данных. Интегрирует ML-тесты в CI/CD с фиксированными random seeds и tolerance-based assertions.
Проектирует стратегию тестирования для ML-исследовательского кода: пирамида тестирования, балансирующая скорость прототипирования и надёжность продакшена, фреймворки статистических assertions для качества моделей, тестирование воспроизводимости с фиксированными seeds и snapshot данных. Менторит команду по переводу исследовательского кода в тестированные продакшен-модули.
Определяет стратегию тестирования на уровне продукта для ML-проектов: стандарты тестирования воспроизводимости экспериментов, governance валидации моделей, статистические фреймворки тестирования для сравнения моделей. Устанавливает культуру shift-left тестирования, балансируя скорость исследований и качество продакшен ML-кода.
Безопасность приложений
▼
Понимает security для DS: data access control, model security basics. Защищает sensitive training data.
Реализует ML security: secure model serving, adversarial robustness, data privacy. Применяет differential privacy.
Проектирует ML security: model security architecture, adversarial defense, data protection pipeline.
Определяет ML security стандарты: model security requirements, data privacy policies, security review.
Применяет secure coding для DS: secrets management, secure data access. Не хардкодит credentials в notebooks.
Реализует security: encrypted data access, secure model serving, audit logging. Сканирует dependencies.
Проектирует secure ML: end-to-end data encryption, model access control, compliance automation.
Определяет security стандарты: ML security guidelines, data protection, audit requirements.
Веб-фреймворки
▼
Использует Python Web Frameworks на базовом уровне в scikit-learn/pandas. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Python Web Frameworks в scikit-learn/pandas. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью cross-validation.
Проектирует решения на основе Python Web Frameworks для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Определяет архитектуру API обслуживания ML-моделей и трекинга экспериментов на FastAPI и Django. Устанавливает стандарты для эндпоинтов предсказаний, API результатов A/B-тестов и интеграций с feature store. Проводит ревью дизайна и определяет дорожную карту веб-сервисов ML-платформы.
Визуализация данных
▼
Строит базовые дашборды ML-экспериментов для отслеживания метрик моделей. Понимает стандартные графики важности признаков и производительности моделей. Интегрирует простые визуализации с MLflow или W&B по практикам команды.
Самостоятельно строит дашборды мониторинга моделей, отслеживая дрифт, точность и латентность. Оптимизирует пайплайны визуализации для трекинга экспериментов в реальном времени. Интегрирует дашборды MLflow и W&B в процессы команды для воспроизводимой ML-отчётности.
Проектирует сквозные дашборды наблюдаемости ML, покрывающие жизненный цикл модели от обучения до продакшена. Оптимизирует системы визуализации для масштабного трекинга экспериментов. Внедряет фреймворки governance для отчётности по важности признаков и прозрачности моделей.
Определяет стратегию ML-дашбордов для трекинга экспериментов и мониторинга моделей в DS-командах. Формирует платформу MLOps-визуализации, интегрируя MLflow, W&B и кастомные дашборды. Координирует ML-команды по стандартизированной отчётности производительности моделей и важности признаков.
Создаёт базовые визуализации через matplotlib и seaborn: гистограммы, scatter plots, box plots, heatmaps. Визуализирует распределения признаков и корреляции для EDA. Строит графики метрик моделей: ROC-curve, confusion matrix.
Создаёт интерактивные визуализации через Plotly и Altair для исследования данных. Строит информативные дашборды в Streamlit для коммуникации результатов стейкхолдерам. Визуализирует результаты экспериментов и A/B-тестов с confidence intervals.
Проектирует визуализации для объяснения сложных ML-моделей: SHAP-plots, partial dependence plots, attention maps. Создаёт custom визуализации для высокоразмерных данных через t-SNE/UMAP. Формирует стандарты визуализации для data science команды.
Определяет стандарты визуализации данных и результатов ML для организации. Формирует шаблоны отчётов для различных стейкхолдеров: технических, продуктовых, бизнесовых. Координирует создание self-service analytics дашбордов.
Интеграционное тестирование
▼
Тестирует ML интеграции: model + API integration, data pipeline connectivity. Проверяет end-to-end prediction flow.
Проектирует integration тесты: model serving testing, feature pipeline validation, data source integration.
Определяет ML integration testing: model deployment validation, A/B test infrastructure, data quality gates.
Внедряет integration testing стандарты: mandatory model tests, deployment validation, quality gates.
Качество данных
▼
Валидирует обучающие датасеты на полноту и качество разметки с помощью pandas и numpy. Применяет профилирование для обнаружения пропусков и аномалий распределений в Jupyter. Использует утилиты scikit-learn для валидации признаков перед обучением модели. Документирует проблемы качества данных.
Самостоятельно реализует data pipelines с Data Quality. Оптимизирует производительность. Обеспечивает data quality.
Проектирует data-архитектуру с Data Quality. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Определяет стратегию качества данных для ML-команд, обеспечивая качество обучающих датасетов. Координирует стандарты валидации в feature stores и модельных пайплайнах. Продвигает инструменты observability и quality gates перед обучением моделей. Согласовывает практики качества с MLOps и data mesh.
Классический ML
▼
Понимает фундаментальные алгоритмы scikit-learn (LogisticRegression, RandomForest, GradientBoosting) и их допущения. Применяет Pipeline и ColumnTransformer для воспроизводимого feature engineering. Следует гайдлайнам оценки моделей через classification_report и ROC-AUC.
Самостоятельно проектирует эксперименты scikit-learn со стратифицированной кросс-валидацией и кастомными scorers. Понимает компромиссы bias-variance между регуляризованными моделями (Ridge, Lasso) и tree ensembles. Строит production pipelines с кастомными transformers и FeatureUnion.
Обладает глубокой экспертизой в расширении scikit-learn кастомными estimators, meta-learners и stacking ensembles для production ML. Проектирует выбор моделей с Bayesian optimization и автоматизированным feature engineering. Менторит команду по воспроизводимости экспериментов и версионированию.
Определяет стратегию Classical ML (scikit-learn) на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Создаёт базовые признаки из структурированных данных: one-hot encoding, label encoding, binning. Применяет стандартные трансформации: scaling, normalization, log-transform. Обрабатывает missing values через imputation-стратегии.
Проектирует feature engineering pipelines с domain-specific признаками. Создаёт temporal features, interaction features, aggregate features. Применяет feature selection методы: mutual information, recursive feature elimination, L1 regularization.
Проектирует масштабируемые feature engineering системы для production ML. Создаёт real-time feature computation через feature store (Feast, Tecton). Применяет automated feature engineering (featuretools) и feature drift detection для мониторинга.
Определяет стратегию feature engineering для data science команды. Формирует shared feature catalog, стандарты quality и documentation features. Координирует развитие feature platform и переиспользование features между командами.
Работает в Jupyter Notebook/Lab для EDA, прототипирования моделей и визуализации результатов. Структурирует notebooks с markdown-описаниями, создаёт воспроизводимые эксперименты. Использует magic commands и extensions для повышения продуктивности.
Эффективно использует JupyterLab для полного ML-цикла: от EDA до model evaluation. Применяет papermill для параметризованного запуска notebooks, nbconvert для генерации отчётов. Настраивает kernel-ы для различных environments и проектов.
Проектирует notebook-based workflows для командной data science работы. Интегрирует notebooks с MLflow, DVC и CI/CD. Формирует стандарты notebook-разработки: templates, code quality checks, reproducibility. Создаёт reusable notebook components.
Определяет инфраструктуру notebook-разработки для data science команды. Координирует настройку JupyterHub, управление ресурсами и доступами. Формирует процессы перехода от notebook-прототипов к production-коду.
Работает с pandas DataFrame для загрузки, очистки и анализа данных. Выполняет базовые операции: фильтрация, группировка, агрегация, merge/join. Использует numpy для математических операций и работы с массивами. Строит сводные таблицы и описательную статистику.
Эффективно работает с большими датасетами через pandas: чанковая обработка, оптимизация dtype, multi-index. Применяет vectorized operations numpy для высокопроизводительных вычислений. Использует pandas profiling для автоматического EDA.
Проектирует high-performance data processing pipelines на pandas/numpy. Применяет advanced техники: Cython extensions, numba JIT compilation для numpy. Оптимизирует memory footprint через chunked processing и memory-mapped arrays для out-of-core computing.
Определяет стандарты работы с данными для data science команды. Формирует shared data processing utilities и best practices. Координирует migration от pandas к distributed frameworks (Dask, Polars, Spark) при необходимости.
Пишет чистый Python-код для data science: функции обработки данных, скрипты EDA, простые ML-пайплайны. Использует list comprehensions, generators, decorators. Работает с виртуальными окружениями и управлением зависимостями через pip/conda.
Разрабатывает production-ready Python-код для ML-систем. Применяет ООП для структурирования ML-кода, type hints для документации API. Использует dataclasses, pydantic для data validation. Пишет модульный, тестируемый код с proper error handling.
Проектирует Python-архитектуру для масштабируемых ML-систем. Оптимизирует производительность через profiling, multiprocessing, async/await. Создаёт reusable packages и libraries для data science команды. Применяет advanced patterns: metaclasses, context managers, descriptors.
Определяет Python-стандарты для data science команды: code style, architecture patterns, package management. Формирует shared Python infrastructure: internal packages, CI/CD templates, development tools. Проводит architecture review ML-кода.
Использует scikit-learn для полного ML-цикла: preprocessing, model training, evaluation. Применяет базовые модели: LogisticRegression, RandomForest, SVM, KMeans. Работает с Pipeline, GridSearchCV, train_test_split для корректного ML-workflow.
Самостоятельно решает production-задачи через scikit-learn с advanced preprocessing и model selection. Применяет ColumnTransformer для heterogeneous данных, custom transformers. Использует RandomizedSearchCV, cross_val_predict и calibration tools.
Проектирует масштабируемые ML-решения на scikit-learn для production. Создаёт custom estimators, scorers и cross-validators. Оптимизирует production pipelines через partial_fit для incremental learning. Интегрирует scikit-learn с distributed computing.
Определяет стандарты использования scikit-learn в data science команде. Формирует shared preprocessing pipelines и model templates. Координирует decision-making: когда scikit-learn достаточно vs когда нужны DL-фреймворки.
Понимает основы анализа временных рядов: trend, seasonality, stationarity. Применяет базовые модели: moving average, exponential smoothing, ARIMA. Проводит decomposition и визуализацию временных рядов через statsmodels и pandas.
Применяет продвинутые методы time series: Prophet, SARIMA, VAR, state space models. Проводит feature engineering для temporal данных: лаговые признаки, rolling statistics, Fourier features. Использует cross-validation для time series (TimeSeriesSplit).
Проектирует production time series forecasting системы. Применяет deep learning для временных рядов: N-BEATS, Temporal Fusion Transformer, DeepAR. Реализует probabilistic forecasting с quantile regression. Работает с многомерными и hierarchical time series.
Определяет стратегию forecasting для data science команды. Формирует reusable forecasting framework и evaluation standards. Координирует development forecasting platform для бизнес-пользователей и автоматизированных систем.
Понимает базовые принципы ансамблевых методов: bagging, boosting, stacking. Использует Random Forest и простые ансамбли из scikit-learn. Понимает, почему ансамбли работают лучше отдельных моделей через bias-variance trade-off.
Самостоятельно проектирует ансамблевые решения для production-задач. Использует blending и stacking, комбинирует модели разных типов (linear, tree-based, neural). Оптимизирует composition ансамбля через cross-validation и grid search.
Проектирует сложные ансамблевые системы для production: cascading ensembles, mixture of experts, dynamic ensemble selection. Оптимизирует inference time ансамблей для real-time serving. Балансирует accuracy и latency для production-деплоя.
Определяет стратегию ансамблирования для ML-проектов команды. Формирует best practices по выбору и комбинации моделей. Координирует разработку ensemble serving infrastructure для production-систем.
Понимает теорему Байеса и базовые концепции байесовского вывода. Знаком с понятиями prior, likelihood и posterior, может применять наивный Байесовский классификатор для простых задач классификации текстов.
Применяет байесовские методы для A/B-тестирования и оценки параметров моделей. Использует PyMC3/PyMC для построения probabilistic models. Понимает MCMC-сэмплирование и convergence diagnostics для валидации результатов.
Проектирует сложные байесовские модели: hierarchical models, Gaussian processes, Bayesian neural networks. Применяет variational inference для масштабируемого вывода. Использует Bayesian optimization для hyperparameter tuning ML-моделей.
Определяет стратегию применения байесовских методов в data science команде. Формирует стандарты байесовского подхода к экспериментам и принятию решений. Обучает команду probabilistic programming и Bayesian workflow.
Понимает основы дизайна экспериментов: контрольная и тестовая группы, randomization, sample size calculation. Проводит простые A/B-тесты с фиксированным горизонтом. Документирует гипотезы, методологию и результаты экспериментов.
Проектирует сложные эксперименты: multi-variant тесты, sequential testing, stratified randomization. Применяет causal inference методы: difference-in-differences, instrumental variables. Рассчитывает minimum detectable effect и планирует длительность экспериментов.
Проектирует experimentation platform для систематического A/B-тестирования ML-моделей. Применяет advanced методы: switchback experiments, cluster randomization, synthetic control. Формирует guardrail metrics и early stopping rules для безопасных экспериментов.
Определяет культуру экспериментирования в data science команде. Формирует стандарты эксперимент-дизайна, review-процесс для экспериментов. Координирует развитие experimentation platform и интеграцию с ML-пайплайнами.
Понимает основы статистической проверки гипотез: null/alternative hypothesis, p-value, significance level. Проводит базовые тесты: t-test, chi-square, Mann-Whitney U для сравнения групп. Интерпретирует результаты тестов для принятия решений.
Применяет специализированные статистические тесты для ML-задач: bootstrap hypothesis testing, permutation tests, multiple comparison correction (Bonferroni, FDR). Рассчитывает confidence intervals для ML-метрик. Проводит statistical significance testing моделей.
Проектирует framework для статистической валидации ML-моделей. Применяет sequential testing, always-valid confidence intervals для continuous monitoring. Использует causal inference: propensity score matching, regression discontinuity для оценки эффекта ML.
Определяет стандарты статистической валидации для data science команды. Формирует guidelines по выбору тестов, расчёту sample size и интерпретации результатов. Координирует development статистической инфраструктуры для ML-экспериментов.
Понимает концепцию curse of dimensionality и необходимость снижения размерности. Применяет PCA для уменьшения числа признаков, интерпретирует explained variance ratio. Визуализирует высокоразмерные данные через t-SNE и PCA.
Применяет различные методы снижения размерности: PCA, SVD, UMAP, autoencoders для feature extraction. Выбирает оптимальный метод в зависимости от задачи и данных. Использует dimensionality reduction как preprocessing step для улучшения качества моделей.
Проектирует pipelines для работы с очень высокоразмерными данными (100K+ features). Применяет non-linear dimensionality reduction, kernel PCA, variational autoencoders. Оптимизирует trade-off между compression ratio и information loss для production ML.
Определяет стандарты dimensionality reduction для data science команды. Формирует guidelines по выбору методов для различных типов данных. Координирует integration dimensionality reduction в feature engineering платформу.
Проводит описательную статистику и базовый статистический анализ данных. Вычисляет меры центральной тенденции, дисперсии, корреляции. Строит доверительные интервалы и проводит базовые статистические тесты через scipy.stats.
Применяет продвинутый статистический анализ: regression analysis, ANOVA, non-parametric tests, survival analysis. Проводит power analysis для планирования экспериментов. Использует statsmodels для regression и time series decomposition.
Проектирует statistical frameworks для data science команды. Применяет advanced методы: causal inference, mixed effects models, GAMs. Проводит simulation studies для валидации методологий. Формирует standards statistical rigor для ML-исследований.
Определяет стандарты статистического анализа для организации. Формирует guidelines по применению статистических методов для различных бизнес-задач. Координирует statistical consulting для продуктовых и data science команд.
Контейнеризация
▼
Понимает базовые концепции Docker для data science: контейнеризованные Jupyter-среды, Docker-образы для зависимостей ML-библиотек, базовый docker-compose для локального стека обработки данных. Использует существующие конфигурации для контейнеров обучения с поддержкой GPU.
Самостоятельно настраивает Docker для data science: Jupyter-контейнеры с поддержкой GPU, multi-stage сборки для образов обучения моделей, docker-compose для экспериментальных сред с хранилищами данных. Понимает управление ресурсами контейнеров для ML-нагрузок и монтирование volumes для доступа к датасетам.
Проектирует Docker-инфраструктуру для ML-workflow: воспроизводимые среды обучения с зафиксированными зависимостями, оркестрация GPU-контейнеров для экспериментальных пайплайнов, архитектура контейнеризованного model serving. Внедряет лучшие практики версионирования сред экспериментов и управления data volumes.
Определяет Docker-стратегию для ML-workflow: governance GPU-контейнерной платформы, стандартизация сред экспериментов, политики жизненного цикла контейнеров моделей. Проводит архитектурные ревью контейнеризованной ML-инфраструктуры и оптимизирует FinOps GPU-вычислительных ресурсов.
Кэширование
▼
Использует Redis для DS: кеширует prediction results, feature values. Понимает caching для ML serving.
Проектирует ML caching: feature store caching, prediction caching, model metadata. Оптимизирует serving latency.
Проектирует ML caching architecture: real-time feature serving, prediction caching strategy, cache warming.
Определяет caching стандарты: feature serving requirements, cache policies, performance targets.
Логирование
▼
Использует logging для DS: experiment logging через MLflow, structured metrics tracking. Логирует training progress.
Реализует structured logging: experiment tracking, model metrics, data pipeline logging. Интегрирует с monitoring.
Проектирует ML observability: experiment lineage, model performance tracking, data quality logging.
Определяет logging стандарты: experiment tracking requirements, model monitoring, data quality logging.
Метрики и мониторинг
▼
Мониторит ML через Prometheus/Grafana: model latency, prediction throughput. Просматривает ML dashboards.
Создаёт ML monitoring: model performance dashboards, data drift metrics, feature importance tracking.
Проектирует ML monitoring: automated drift detection, performance alerting, experiment dashboards.
Определяет ML monitoring стандарты: mandatory metrics, model health dashboards, alerting policies.
Многопоточность и конкурентность
▼
Понимает async для DS: asyncio для parallel data fetching, concurrent API calls к ML сервисам.
Реализует async data processing: parallel data loading, async model inference, concurrent feature extraction.
Проектирует async ML pipelines: parallel training experiments, async feature engineering, distributed data loading.
Определяет async стандарты: parallel processing guidelines, async patterns для ML workflows.
Понимает parallelism для DS: multi-processing для data loading, parallel model evaluation.
Реализует parallel ML: multiprocessing для feature engineering, parallel hyperparameter tuning, concurrent data loading.
Проектирует parallel ML: distributed training, parallel experiment execution, multi-GPU optimization.
Определяет parallelism стандарты: GPU utilization policies, distributed training guidelines.
Облачные провайдеры
▼
Понимает базовые концепции AWS для нагрузок data science — S3 для датасетов, SageMaker notebooks для экспериментов и ECR для образов контейнеров. Использует существующие конфигурации для окружений Jupyter notebooks на SageMaker. Выполняет простые операции — запуск инстансов notebooks и доступ к обучающим данным — под руководством.
Самостоятельно настраивает сервисы AWS для процессов data science — SageMaker Studio, EMR для распределённой обработки и Athena для ad-hoc запросов. Пишет IaC для воспроизводимых окружений экспериментов с GPU-планированием. Понимает VPC-сетевое взаимодействие для безопасного доступа к данным и политики IAM для разрешений кросс-сервисных дата-пайплайнов.
Проектирует инфраструктурные решения AWS для продакшн-платформ data science — SageMaker Pipelines для ML-процессов, EMR для распределённого feature engineering и управляемый трекинг экспериментов. Оптимизирует затраты через SageMaker Savings Plans, spot-инстансы для обучения и интеллектуальное управление жизненным циклом данных. Внедряет security hardening с шифрованием данных, кросс-аккаунтной изоляцией и воспроизводимыми окружениями экспериментов.
Определяет стратегию инфраструктуры AWS для платформ data science, охватывающих экспериментальные окружения и продакшн ML-сервинг. Формирует стандарты IaC для SageMaker Studio, кластеров распределённого обучения и воспроизводимости экспериментов. Проводит архитектурные ревью, оптимизируя затраты ML-нагрузок, и координирует FinOps для вычислительных ресурсов data science.
ООП и паттерны проектирования
▼
Применяет паттерны в DS: Pipeline pattern для data processing, Strategy для model selection. Организует ML код.
Использует ML design patterns: feature store pattern, model registry, experiment tracking. Реализует reproducible pipelines.
Проектирует ML architecture на паттернах: ML platform patterns, model serving architecture, feature engineering patterns.
Определяет ML architectural patterns: reference ML architectures, pattern catalog для DS команды.
Понимает основы Принципы ООП и SOLID на базовом уровне. Применяет простые концепции в рабочих задачах с использованием Python/R. Следует рекомендациям senior-разработчиков при решении задач.
Самостоятельно применяет ООП/SOLID в ML-исследовательском коде: правильный дизайн классов для экспериментальных пайплайнов, инкапсулированные обёртки моделей с чистыми интерфейсами, единственная ответственность в модулях feature engineering. Понимает компромиссы между ООП-структурой и быстрым прототипированием в workflow из ноутбука в продакшен.
Применяет ООП/SOLID в архитектуре ML-систем: абстрактные интерфейсы моделей для фреймворка экспериментов, strategy pattern для оптимизации гиперпараметров, чистые абстракции для загрузки/трансформации данных. Проектирует переиспользуемые фреймворки ML-экспериментов, позволяющие консистентно сравнивать различные архитектуры моделей.
Определяет стандарты ООП/SOLID для ML-исследовательской команды: архитектура классов экспериментальных пайплайнов, интерфейсные контракты обёрток моделей, гайдлайны дизайна модулей feature engineering. Проводит ревью, балансируя строгость ООП и скорость итерации исследований.
Оптимизация БД
▼
Понимает базовые концепции индексирования для эффективного извлечения данных при тренировке моделей и feature engineering. Знает, как индексы влияют на скорость запросов при извлечении больших датасетов. Следует командным практикам создания индексов для часто запрашиваемых таблиц фич.
Проектирует стратегии индексирования для нагрузок feature engineering: индексы для извлечения time-series фич, пространственные индексы для геопространственных фич и GIN-индексы для JSONB метаданных фич. Оптимизирует запросы извлечения данных для пайплайнов тренировки и инференса. Понимает компромиссы индексирования для write-heavy таблиц логирования экспериментов.
Проектирует архитектуру индексирования для инфраструктуры данных ML: векторные индексы (HNSW, IVF) для поиска по похожести эмбеддингов, time-series индексы для temporal feature store и специализированные индексы для graph-based feature engineering. Настраивает индексы БД для эффективного model serving и real-time извлечения фич. Оптимизирует паттерны доступа к данным между пайплайнами тренировки и инференса.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Индексирование БД. Проводит review схем данных и стратегий масштабирования.
Понимает основы оптимизации запросов для извлечения данных ML: эффективные запросы извлечения фич, паттерны пакетной загрузки данных и избегание memory-heavy паттернов запросов при извлечении тренировочных датасетов. Следует командным практикам оптимизации запросов пайплайнов данных.
Самостоятельно оптимизирует запросы ML-данных: эффективное извлечение фич с оконными функциями, стратегии пакетной загрузки для тренировочных данных и инкрементальные паттерны запросов для потокового вычисления фич. Понимает поведение оптимизатора запросов для сложных запросов feature engineering. Балансирует производительность запросов с требованиями свежести данных.
Проектирует архитектуру запросов для инфраструктуры данных ML: оптимизация запросов feature store, паттерны распределённых запросов для извлечения тренировочных данных большого масштаба и real-time извлечение фич для model serving. Реализует кеширование запросов для вычисления фич и автоматический бенчмаркинг производительности запросов. Менторит команду по эффективным паттернам доступа к данным для ML-воркфлоу.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Оптимизация запросов. Проводит review схем данных и стратегий масштабирования.
Рекомендательные системы
▼
Понимает основы Основы рекомендательных систем. Применяет базовые практики в повседневной работе. Следует рекомендациям команды.
Самостоятельно применяет Основы рекомендательных систем на практике. Понимает trade-offs различных подходов. Решает типовые задачи.
Глубоко владеет Основы рекомендательных систем. Проектирует решения для production-систем. Оптимизирует и масштабирует. Менторит команду.
Определяет стратегию Основы рекомендательных систем на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Реляционные БД
▼
Понимает базовый PostgreSQL для data science: извлечение обучающих датасетов SQL-запросами, понимание проектирования схем для feature stores, базовая оптимизация запросов для извлечения больших данных. Следует командным конвенциям взаимодействия с БД в ML-пайплайнах данных.
Самостоятельно проектирует схемы для ML-пайплайнов данных: оптимизирует запросы для крупномасштабного извлечения фич, внедряет эффективные стратегии сэмплирования данных, настраивает COPY для быстрой массовой загрузки данных в пайплайны обучения. Понимает компромиссы между SQL-based feature engineering и внешними фреймворками обработки.
Проектирует архитектуру PostgreSQL для ML-инфраструктуры данных: оптимизирует БД для крупномасштабных операций feature store, внедряет эффективное версионирование данных и отслеживание lineage, настраивает партиционирование и архивирование для жизненного цикла обучающих данных. Менторит команду по паттернам SQL-based feature engineering и оптимизации пайплайнов данных.
Определяет стратегию данных PostgreSQL для ML-команд: устанавливает стандарты проектирования feature store и управления обучающими данными, проектирует архитектуру БД для воспроизводимых ML-экспериментов, обеспечивает внедрение лучших практик PostgreSQL для воркфлоу data science.
Пишет SQL-запросы для извлечения и анализа данных: JOIN, GROUP BY, HAVING, подзапросы. Проводит EDA через SQL в data warehouse. Работает с агрегатными функциями и basic window functions для аналитических запросов.
Пишет сложные аналитические SQL-запросы с window functions: LAG, LEAD, RANK, running totals. Создаёт CTE-based queries для feature engineering в data warehouse. Оптимизирует запросы через EXPLAIN ANALYZE и правильное индексирование.
Проектирует SQL-based feature pipelines для production ML-систем. Оптимизирует запросы для BigQuery/Redshift/Snowflake с учётом partitioning, clustering, materialized views. Создаёт dbt-модели для reproducible data transformations.
Определяет стандарты SQL-разработки для data science команды. Формирует shared SQL-модели и naming conventions. Координирует data engineering и data science для эффективной работы с data warehouse.
Сети
▼
Понимает networking для DS: API calls к ML сервисам, data transfer protocols. Настраивает secure connections.
Реализует ML networking: model serving endpoints, distributed training communication, data pipeline networking.
Проектирует ML network architecture: GPU cluster networking, model serving load balancing, data transfer optimization.
Определяет networking стандарты: ML service networking, security policies, performance requirements.
Управление API
▼
Документирует ML API: описывает prediction endpoints, model inputs/outputs, example requests.
Создаёт ML documentation: model cards, API reference, integration guides, evaluation reports.
Проектирует ML documentation: model registry docs, automated model cards, experiment reports.
Определяет documentation стандарты: mandatory model cards, API docs, review process.
Чистый код и рефакторинг
▼
Понимает основы Качество кода и рефакторинг на базовом уровне. Применяет простые концепции в рабочих задачах с использованием Python/R. Следует рекомендациям senior-разработчиков при решении задач.
Самостоятельно применяет практики качества кода в data science. Пишет организованный код экспериментов с чётким разделением загрузки данных, feature engineering и моделирования. Понимает компромиссы между гибкостью ноутбуков и модульной структурой кода. Ревьюит ML-код на утечку данных, управление гиперпараметрами и воспроизводимость результатов.
Проектирует стандарты качества кода для ML-исследовательских кодовых баз: конвенции трекинга экспериментов, паттерны рефакторинга из ноутбуков в модули, требования воспроизводимости. Рефакторит прототипы моделей в production-grade код с правильным тестированием. Устанавливает практики ревью, балансируя скорость исследований и сопровождаемость кода.
Определяет стандарты использования Качество кода и рефакторинг на уровне команды/продукта. Проводит архитектурные review. Формирует best practices и обучающие материалы для всей команды.