Применяет алгоритмическую экспертизу к дата-платформе: выбор алгоритмов join для распределённой обработки данных (broadcast vs sort-merge vs hash), алгоритмы оптимизации shuffle для Spark, алгоритмы инкрементальных вычислений для потокового ETL. Проектирует эффективные алгоритмы дедупликации и качества данных в масштабе.
Роли · Data Engineer · Senior
Что должен уметь Senior }
47 ключевых навыков, всего 64. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 5
Проектирует async-архитектуры для дата-пайплайнов: конкурентное получение данных из источников в масштабе, async-оркестрация ETL с backpressure, неблокирующая валидация качества данных. Менторит команду по async-паттернам для пропускной способности дата-пайплайнов.
Проектирует стандарты качества кода для дата-пайплайнов: структура DAG в Airflow, организация Spark-джобов, паттерны тестирования ETL. Рефакторит монолитные трансформации данных в модульные, идемпотентные стадии пайплайна. Внедряет quality gates для контроля data contracts и надёжности пайплайнов.
Применяет ООП/SOLID в архитектуре дата-платформы: абстрактные интерфейсы для коннекторов к источникам данных, strategy pattern для выбора движка трансформаций, template method для стандартизированных стадий пайплайна. Проектирует расширяемые дата-фреймворки, поддерживающие добавление новых источников данных и трансформаций без модификации ядра логики пайплайна.
Выбирает оптимальные структуры данных для нагрузок дата-платформ: партиционированные колоночные форматы Parquet/ORC, бакетированные hash-распределения для оптимизации join, структуры merge Delta Lake для upsert-паттернов. Оптимизирует структуры данных Spark shuffle для минимальных накладных расходов памяти. Проектирует стратегии эволюции схем с backward/forward-совместимыми структурами.
Backend Development · 6
Проектирует event-driven ingestion: Kafka producers для CDC, consumer groups для параллельной обработки, Schema Registry с Avro/Protobuf. Оптимизирует throughput: batching, compression, partition assignment.
Проектирует поисковый индекс для data catalog: mapping, custom analyzers для metadata, nested-документы для lineage. Оптимизирует bulk indexing pipeline для миллионов записей каталога.
Разрабатывает data API на FastAPI: эндпоинты для доступа к метаданным, каталогу, lineage. Реализует async-обработку запросов к data warehouse. Интегрирует с Airflow REST API для управления DAG-ами.
Использует Redis для data pipeline оптимизации: кеширование lookup-таблиц, deduplication через Redis Sets, rate limiting для API-источников. Реализует Redis Streams для lightweight event processing.
Проектирует data lake на S3: partitioning strategy (year/month/day), Parquet/ORC для аналитики, lifecycle policies для архивации. Оптимизирует costs через Intelligent-Tiering и Glacier.
Проектирует асинхронную обработку через Celery/RQ: фоновые задачи для data processing, priority queues для разных SLA, dead letter queues для failed tasks. Настраивает retry policies и monitoring.
Базы данных · 9
Оптимизирует индексирование для data pipelines: GIN для JSONB, BRIN для time-series, bloom filters в ClickHouse. Проектирует indexing стратегию учитывая batch vs streaming access patterns.
Проектирует migration стратегию: zero-downtime миграции для data warehouse, schema evolution в Parquet/Avro, backward compatibility в data contracts. Автоматизирует через CI/CD.
Проектирует оптимальные data access patterns: incremental extraction через watermarks, micro-batch vs full-load trade-offs. Оптимизирует Spark query plans: broadcast joins, AQE, partition coalescing.
Проектирует enterprise data модели: Data Vault 2.0 для гибкости, Anchor Modeling для high-change environments, wide tables для ClickHouse. Определяет layered architecture: raw → staging → curated → mart.
Проектирует high-availability data-архитектуры с multi-region репликацией, кросс-базовыми CDC-пайплайнами и event-driven синхронизацией. Оптимизирует репликацию для масштабных аналитических нагрузок с минимальным влиянием на production. DR-стратегии с RPO/RTO.
Архитектурирует мультидатацентровые развёртывания Cassandra для real-time пайплайнов данных. Оптимизирует топологию кластера, стратегии компакции и распределение партиций для петабайтных нагрузок. Проектирует стратегии миграции между версиями схем.
Проектирует disaster recovery для data-платформы: backup стратегии для разных storage (HDFS snapshots, S3 versioning, DB dumps). Реализует time-travel в Delta Lake/Iceberg для data recovery.
Проектирует ClickHouse-архитектуру для data warehouse: distributed таблицы, sharding strategy, dictionary tables для joins. Оптимизирует запросы: projection, skip indexes, query pipeline tuning. Настраивает Kafka engine для streaming ingestion.
Проектирует PostgreSQL как источник/приёмник data pipelines: CDC через Debezium, materialized views для агрегатов, FDW для federation. Оптимизирует VACUUM для high-write staging tables.
API и интеграции · 2
Проектирует gRPC-интерфейсы для data services: bidirectional streaming для CDC, server streaming для bulk data delivery. Интегрирует Protobuf с Schema Registry для centralized schema management.
Проектирует API-слой data-платформы: REST для metadata catalog, webhook-эндпоинты для event-driven ingestion. Реализует data API с query parameters для self-service доступа к данным.
Облако и инфраструктура · 5
Проектирует сетевую архитектуру data-платформы: private connectivity к data sources, Transit Gateway для multi-VPC, Direct Connect для on-prem data centers. Оптимизирует сетевую производительность для bulk data transfer.
Проектирует data-платформу на AWS: Lake Formation для governance, EMR для Spark, Kinesis для streaming, Glue Catalog для metadata. Оптимизирует costs: reserved instances, spot для batch, S3 lifecycle.
Проектирует контейнеризацию data-платформы: образы для Airflow workers, Spark executors, dbt. Оптимизирует build pipeline: кеширование pip-зависимостей, slim-образы. Настраивает local development environment.
Проектирует Kubernetes-инфраструктуру для data: Spark Operator, Airflow KubernetesExecutor с dynamic resource allocation, Argo Workflows для ML pipelines. Оптимизирует node pools для разных workloads.
Проектирует IaC для data-платформы: переиспользуемые модули для data services (EMR, Glue, Kinesis), environment promotion pipeline. Автоматизирует provisioning data infrastructure.
DevOps и CI/CD · 1
Проектирует CI/CD для data-платформы: pipeline testing (unit + integration), automated schema validation, blue/green deployment для Airflow. Внедряет data quality gates в deployment pipeline.
Data Engineering · 14
Проектирует data-архитектуру с Архитектура Data Lake. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует Airflow-архитектуру: KubernetesExecutor для dynamic scaling, custom operators/hooks, DAG factory pattern для генерации. Оптимизирует performance: pool management, priority weight, concurrency.
Проектирует архитектуру платформы данных на Spark: multi-tenant управление кластерами, cost-optimized планирование нагрузок с YARN/Kubernetes и lakehouse-архитектура с Delta Lake/Iceberg. Реализует фреймворки качества данных, CDC-пайплайны и мониторинг производительности Spark-приложений.
Проектирует data-архитектуру с Dagster / Prefect. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует metadata management: DataHub/OpenMetadata/Amundsen setup, custom connectors для internal systems, automated lineage extraction из Spark/Airflow. Интегрирует catalog с data quality.
Проектирует data contract framework: schema registry integration, automated validation pipeline, versioning strategy. Реализует contract testing между producers и consumers.
Проектирует lineage-инфраструктуру: column-level lineage, cross-system tracking (operational → analytical), custom extractors для internal tools. Интегрирует lineage с data catalog и quality monitoring.
Проектирует data quality систему: multi-layer validation (source → staging → mart), anomaly detection (statistical), automated remediation. Интегрирует quality metrics в data catalog.
Проектирует data warehouse архитектуру: multi-layer (staging → ODS → DWH → marts), Slowly Changing Dimensions, bridge tables для many-to-many. Выбирает cloud DWH (Redshift/BigQuery/Snowflake) по требованиям.
Проектирует dbt-архитектуру: multi-project setup, package management, custom generic tests. Реализует unit-tests для complex transformations. Оптимизирует производительность: incremental + merge, partition-based.
Проектирует data-архитектуру с Delta Lake / Apache Iceberg. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует data processing: Polars для single-node high-performance, pandas для quick prototyping, PySpark для distributed. Выбирает инструмент по объёму и паттерну обработки. Оптимизирует memory management.
Проектирует SQL-based ETL архитектуру: ELT pattern (load-then-transform), incremental processing через merge/upsert, materialized views для performance. Интегрирует с dbt для version-controlled SQL.
Проектирует сквозные архитектуры потоковых данных с Kafka Streams для высоконагруженных pipeline. Оркестрирует сложную обработку событий, реализует стратегии эволюции схем и оптимизирует обработку backpressure.
AI-ассистированная разработка · 1
Максимизирует продуктивность: генерация complex SQL/dbt macros, Terraform modules, data quality rules. Выстраивает workflow где AI ускоряет рутину (boilerplate), инженер фокусируется на архитектуре.
Observability и мониторинг · 2
Проектирует observability для data pipelines: structured logging с data lineage context, metrics emission (records processed, data quality scores), alerting на anomалии. Интегрирует с OpenTelemetry.
Проектирует observability stack для сервиса. Создаёт SLI/SLO дашборды. Пишет сложные PromQL (rate, histogram_quantile, recording rules). Настраивает Alertmanager с routing и silencing. Оптимизирует cardinality метрик. Интегрирует с PagerDuty/OpsGenie.
Контроль версий и коллаборация · 2
Проводит архитектурный review: оценивает pipeline design, data model decisions, schema evolution impact. Ревьюит Airflow DAG structure, Terraform changes для data infra.
Определяет branching-стратегию для data projects: trunk-based с feature flags для DAGs, protected branches для production models. Настраивает pre-commit hooks для SQL linting и dbt compile.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
61 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Алгоритмы и сложность: Продвинутый → Эксперт
- Архитектура Data Lake: Продвинутый → Эксперт
- Асинхронное программирование: Продвинутый → Эксперт
- Индексирование БД: Продвинутый → Эксперт
- Качество кода и рефакторинг: Продвинутый → Эксперт
- Миграции БД: Продвинутый → Эксперт
- Оптимизация запросов: Продвинутый → Эксперт
- Принципы ООП и SOLID: Продвинутый → Эксперт
- Проектирование схем данных: Продвинутый → Эксперт
- Репликация и High Availability: Продвинутый → Эксперт
} в открытой матрице компетенций: 64 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.