Роли · Data Engineer · Senior

Что должен уметь Senior }

47 ключевых навыков, всего 64. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.

47ключевых навыков
17дополнительных навыков
10областей
100%на уровне Продвинутый или Эксперт
Оценить себя как Senior Полная матрица роли

Ключевые навыки для Senior

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Основы программирования · 5

Применяет алгоритмическую экспертизу к дата-платформе: выбор алгоритмов join для распределённой обработки данных (broadcast vs sort-merge vs hash), алгоритмы оптимизации shuffle для Spark, алгоритмы инкрементальных вычислений для потокового ETL. Проектирует эффективные алгоритмы дедупликации и качества данных в масштабе.

Проектирует async-архитектуры для дата-пайплайнов: конкурентное получение данных из источников в масштабе, async-оркестрация ETL с backpressure, неблокирующая валидация качества данных. Менторит команду по async-паттернам для пропускной способности дата-пайплайнов.

Проектирует стандарты качества кода для дата-пайплайнов: структура DAG в Airflow, организация Spark-джобов, паттерны тестирования ETL. Рефакторит монолитные трансформации данных в модульные, идемпотентные стадии пайплайна. Внедряет quality gates для контроля data contracts и надёжности пайплайнов.

Принципы ООП и SOLID Продвинутый

Применяет ООП/SOLID в архитектуре дата-платформы: абстрактные интерфейсы для коннекторов к источникам данных, strategy pattern для выбора движка трансформаций, template method для стандартизированных стадий пайплайна. Проектирует расширяемые дата-фреймворки, поддерживающие добавление новых источников данных и трансформаций без модификации ядра логики пайплайна.

Структуры данных Продвинутый

Выбирает оптимальные структуры данных для нагрузок дата-платформ: партиционированные колоночные форматы Parquet/ORC, бакетированные hash-распределения для оптимизации join, структуры merge Delta Lake для upsert-паттернов. Оптимизирует структуры данных Spark shuffle для минимальных накладных расходов памяти. Проектирует стратегии эволюции схем с backward/forward-совместимыми структурами.

Backend Development · 6

Apache Kafka Продвинутый

Проектирует event-driven ingestion: Kafka producers для CDC, consumer groups для параллельной обработки, Schema Registry с Avro/Protobuf. Оптимизирует throughput: batching, compression, partition assignment.

Elasticsearch / OpenSearch Продвинутый

Проектирует поисковый индекс для data catalog: mapping, custom analyzers для metadata, nested-документы для lineage. Оптимизирует bulk indexing pipeline для миллионов записей каталога.

Python Web Frameworks Продвинутый

Разрабатывает data API на FastAPI: эндпоинты для доступа к метаданным, каталогу, lineage. Реализует async-обработку запросов к data warehouse. Интегрирует с Airflow REST API для управления DAG-ами.

Redis Продвинутый

Использует Redis для data pipeline оптимизации: кеширование lookup-таблиц, deduplication через Redis Sets, rate limiting для API-источников. Реализует Redis Streams для lightweight event processing.

S3 / Object Storage Продвинутый

Проектирует data lake на S3: partitioning strategy (year/month/day), Parquet/ORC для аналитики, lifecycle policies для архивации. Оптимизирует costs через Intelligent-Tiering и Glacier.

Task Queues Продвинутый

Проектирует асинхронную обработку через Celery/RQ: фоновые задачи для data processing, priority queues для разных SLA, dead letter queues для failed tasks. Настраивает retry policies и monitoring.

Базы данных · 9

Индексирование БД Продвинутый

Оптимизирует индексирование для data pipelines: GIN для JSONB, BRIN для time-series, bloom filters в ClickHouse. Проектирует indexing стратегию учитывая batch vs streaming access patterns.

Миграции БД Продвинутый

Проектирует migration стратегию: zero-downtime миграции для data warehouse, schema evolution в Parquet/Avro, backward compatibility в data contracts. Автоматизирует через CI/CD.

Проектирует оптимальные data access patterns: incremental extraction через watermarks, micro-batch vs full-load trade-offs. Оптимизирует Spark query plans: broadcast joins, AQE, partition coalescing.

Проектирует enterprise data модели: Data Vault 2.0 для гибкости, Anchor Modeling для high-change environments, wide tables для ClickHouse. Определяет layered architecture: raw → staging → curated → mart.

Проектирует high-availability data-архитектуры с multi-region репликацией, кросс-базовыми CDC-пайплайнами и event-driven синхронизацией. Оптимизирует репликацию для масштабных аналитических нагрузок с минимальным влиянием на production. DR-стратегии с RPO/RTO.

Apache Cassandra Продвинутый

Архитектурирует мультидатацентровые развёртывания Cassandra для real-time пайплайнов данных. Оптимизирует топологию кластера, стратегии компакции и распределение партиций для петабайтных нагрузок. Проектирует стратегии миграции между версиями схем.

Backup и Disaster Recovery Продвинутый

Проектирует disaster recovery для data-платформы: backup стратегии для разных storage (HDFS snapshots, S3 versioning, DB dumps). Реализует time-travel в Delta Lake/Iceberg для data recovery.

ClickHouse Продвинутый

Проектирует ClickHouse-архитектуру для data warehouse: distributed таблицы, sharding strategy, dictionary tables для joins. Оптимизирует запросы: projection, skip indexes, query pipeline tuning. Настраивает Kafka engine для streaming ingestion.

PostgreSQL Продвинутый

Проектирует PostgreSQL как источник/приёмник data pipelines: CDC через Debezium, materialized views для агрегатов, FDW для federation. Оптимизирует VACUUM для high-write staging tables.

API и интеграции · 2

gRPC и Protocol Buffers Продвинутый

Проектирует gRPC-интерфейсы для data services: bidirectional streaming для CDC, server streaming для bulk data delivery. Интегрирует Protobuf с Schema Registry для centralized schema management.

REST API Design Продвинутый

Проектирует API-слой data-платформы: REST для metadata catalog, webhook-эндпоинты для event-driven ingestion. Реализует data API с query parameters для self-service доступа к данным.

Облако и инфраструктура · 5

Основы сетей Продвинутый

Проектирует сетевую архитектуру data-платформы: private connectivity к data sources, Transit Gateway для multi-VPC, Direct Connect для on-prem data centers. Оптимизирует сетевую производительность для bulk data transfer.

AWS Продвинутый

Проектирует data-платформу на AWS: Lake Formation для governance, EMR для Spark, Kinesis для streaming, Glue Catalog для metadata. Оптимизирует costs: reserved instances, spot для batch, S3 lifecycle.

Docker Продвинутый

Проектирует контейнеризацию data-платформы: образы для Airflow workers, Spark executors, dbt. Оптимизирует build pipeline: кеширование pip-зависимостей, slim-образы. Настраивает local development environment.

Kubernetes Core Продвинутый

Проектирует Kubernetes-инфраструктуру для data: Spark Operator, Airflow KubernetesExecutor с dynamic resource allocation, Argo Workflows для ML pipelines. Оптимизирует node pools для разных workloads.

Terraform Продвинутый

Проектирует IaC для data-платформы: переиспользуемые модули для data services (EMR, Glue, Kinesis), environment promotion pipeline. Автоматизирует provisioning data infrastructure.

DevOps и CI/CD · 1

GitHub Actions / GitLab CI Продвинутый

Проектирует CI/CD для data-платформы: pipeline testing (unit + integration), automated schema validation, blue/green deployment для Airflow. Внедряет data quality gates в deployment pipeline.

Data Engineering · 14

Архитектура Data Lake Продвинутый

Проектирует data-архитектуру с Архитектура Data Lake. Оптимизирует для big data. Внедряет data governance и quality frameworks.

Apache Airflow Продвинутый

Проектирует Airflow-архитектуру: KubernetesExecutor для dynamic scaling, custom operators/hooks, DAG factory pattern для генерации. Оптимизирует performance: pool management, priority weight, concurrency.

Apache Spark Продвинутый

Проектирует архитектуру платформы данных на Spark: multi-tenant управление кластерами, cost-optimized планирование нагрузок с YARN/Kubernetes и lakehouse-архитектура с Delta Lake/Iceberg. Реализует фреймворки качества данных, CDC-пайплайны и мониторинг производительности Spark-приложений.

Dagster / Prefect Продвинутый

Проектирует data-архитектуру с Dagster / Prefect. Оптимизирует для big data. Внедряет data governance и quality frameworks.

Data Catalog Продвинутый

Проектирует metadata management: DataHub/OpenMetadata/Amundsen setup, custom connectors для internal systems, automated lineage extraction из Spark/Airflow. Интегрирует catalog с data quality.

Data Contracts Продвинутый

Проектирует data contract framework: schema registry integration, automated validation pipeline, versioning strategy. Реализует contract testing между producers и consumers.

Data Lineage Продвинутый

Проектирует lineage-инфраструктуру: column-level lineage, cross-system tracking (operational → analytical), custom extractors для internal tools. Интегрирует lineage с data catalog и quality monitoring.

Data Quality Продвинутый

Проектирует data quality систему: multi-layer validation (source → staging → mart), anomaly detection (statistical), automated remediation. Интегрирует quality metrics в data catalog.

Data Warehouse Design Продвинутый

Проектирует data warehouse архитектуру: multi-layer (staging → ODS → DWH → marts), Slowly Changing Dimensions, bridge tables для many-to-many. Выбирает cloud DWH (Redshift/BigQuery/Snowflake) по требованиям.

dbt Продвинутый

Проектирует dbt-архитектуру: multi-project setup, package management, custom generic tests. Реализует unit-tests для complex transformations. Оптимизирует производительность: incremental + merge, partition-based.

Delta Lake / Apache Iceberg Продвинутый

Проектирует data-архитектуру с Delta Lake / Apache Iceberg. Оптимизирует для big data. Внедряет data governance и quality frameworks.

Pandas / Polars Продвинутый

Проектирует data processing: Polars для single-node high-performance, pandas для quick prototyping, PySpark для distributed. Выбирает инструмент по объёму и паттерну обработки. Оптимизирует memory management.

SQL-based ETL Продвинутый

Проектирует SQL-based ETL архитектуру: ELT pattern (load-then-transform), incremental processing через merge/upsert, materialized views для performance. Интегрирует с dbt для version-controlled SQL.

Stream Processing Продвинутый

Проектирует сквозные архитектуры потоковых данных с Kafka Streams для высоконагруженных pipeline. Оркестрирует сложную обработку событий, реализует стратегии эволюции схем и оптимизирует обработку backpressure.

AI-ассистированная разработка · 1

GitHub Copilot Продвинутый

Максимизирует продуктивность: генерация complex SQL/dbt macros, Terraform modules, data quality rules. Выстраивает workflow где AI ускоряет рутину (boilerplate), инженер фокусируется на архитектуре.

Observability и мониторинг · 2

Проектирует observability для data pipelines: structured logging с data lineage context, metrics emission (records processed, data quality scores), alerting на anomалии. Интегрирует с OpenTelemetry.

Prometheus и Grafana Продвинутый

Проектирует observability stack для сервиса. Создаёт SLI/SLO дашборды. Пишет сложные PromQL (rate, histogram_quantile, recording rules). Настраивает Alertmanager с routing и silencing. Оптимизирует cardinality метрик. Интегрирует с PagerDuty/OpsGenie.

Контроль версий и коллаборация · 2

Code Review Продвинутый

Проводит архитектурный review: оценивает pipeline design, data model decisions, schema evolution impact. Ревьюит Airflow DAG structure, Terraform changes для data infra.

Git Advanced Продвинутый

Определяет branching-стратегию для data projects: trunk-based с feature flags для DAGs, protected branches для production models. Настраивает pre-commit hooks для SQL linting и dbt compile.

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Документирование APIИнтеграционное тестированиеМногопоточное программированиеОсновы System DesignПаттерны проектированияПрактики безопасного кодаТипобезопасность и системы типовChatGPT / ClaudeCursor IDEE2E тестированиеGraphQL DesignJWT / OAuth2 / OIDCOpenTelemetryOWASP и безопасность приложенийPrompt Engineering для кодаSLI / SLO / SLAUnit-тестирование

Что меняется на Lead

61 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.

Страница Lead →
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 64 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.