Роли · Data Engineer · Middle

Что должен уметь Middle }

25 ключевых навыков, всего 64. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Middle }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Базы данных, Облако и инфраструктура, Data Engineering.

25ключевых навыков
39дополнительных навыков
4областей
0%на уровне Продвинутый или Эксперт
Оценить себя как Middle Полная матрица роли

Ключевые навыки для Middle

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Базы данных · 9

Индексирование БД Применение

Проектирует стратегию индексирования для ETL-источников: partial indexes для active records, covering indexes для частых extractions. Понимает trade-off между скоростью чтения и записи в OLTP-источниках.

Миграции БД Применение

Проектирует schema evolution для data pipelines: backward-compatible миграции, expand-contract для zero-downtime, версионирование через Flyway/Alembic. Обрабатывает schema drift в источниках.

Оптимизирует extraction и transformation: predicate pushdown, partition pruning, выбор между JOIN и subquery. Профилирует SQL-запросы в Airflow через query tags. Оптимизирует Spark SQL execution plans.

Проектирует dimensional модели: Kimball methodology (conformed dimensions, bus matrix), Data Vault (hubs, links, satellites). Применяет SCD Type 2 с effective dates. Моделирует semi-structured данные.

Настраивает и управляет репликацией БД для data-пайплайнов: read replicas для ETL-разгрузки, schema migrations в реплицированных средах, change data capture (CDC). Понимает trade-offs консистентности, проектирует data flows с учётом replication lag.

Apache Cassandra Применение

Проектирует модели данных Cassandra, оптимизированные под query-driven паттерны доступа. Реализует эффективные batch-операции и управляет жизненным циклом данных через TTL. Настраивает уровни консистентности чтения/записи для баланса задержки и надёжности.

Backup и Disaster Recovery Применение

Настраивает backup для data pipeline артефактов: версионирование промежуточных данных в S3, point-in-time recovery в PostgreSQL. Реализует rollback-механизмы для ETL-процессов.

ClickHouse Применение

Проектирует таблицы ClickHouse для аналитических pipeline-ов: выбор engine (MergeTree, AggregatingMergeTree, ReplacingMergeTree), partitioning by date, materialized views для pre-aggregation. Оптимизирует вставку через batch inserts.

PostgreSQL Применение

Оптимизирует extraction из PostgreSQL: COPY для bulk export, cursor-based pagination, partitioned tables. Настраивает logical replication для CDC. Проектирует staging-таблицы для ETL.

Облако и инфраструктура · 1

Основы сетей Применение

Настраивает сетевую связность для data infrastructure: VPC peering для cross-account access, PrivateLink для managed services, security groups для data pipeline компонентов. Диагностирует connection issues.

Data Engineering · 14

Архитектура Data Lake Применение

Самостоятельно проектирует ETL-пайплайны между зонами data lake с поддержкой эволюции схем. Оптимизирует стоимость хранения через lifecycle-политики, компактификацию и многоуровневое хранение. Реализует контроль качества данных между слоями медальонной архитектуры с автоматизированной валидацией.

Apache Airflow Применение

Проектирует Airflow DAGs: dynamic task generation, XCom для передачи данных, TaskGroups для организации. Использует sensors, hooks для интеграции с external systems. Настраивает connections и variables.

Apache Spark Применение

Самостоятельно реализует Spark-пайплайны данных: оптимизирует shuffle-операции и стратегии партиционирования, реализует Structured Streaming для real-time ETL, управляет Delta Lake таблицами с ACID-транзакциями. Тюнит конфигурации Spark для памяти, параллелизма и стоимостной эффективности.

Dagster / Prefect Применение

Самостоятельно реализует data pipelines с Dagster / Prefect. Оптимизирует производительность. Обеспечивает data quality.

Data Catalog Применение

Настраивает data catalog: интеграция с metadata sources (Hive, Glue, dbt), автоматический harvesting. Создаёт business glossary. Тегирует данные для классификации (PII, financial).

Data Contracts Применение

Создаёт data contracts: YAML/JSON schema definitions, quality checks, SLA metrics. Интегрирует contract validation в CI/CD. Настраивает alerting при нарушении контрактов.

Data Lineage Применение

Настраивает автоматический сбор lineage: интеграция Airflow/dbt/Spark с lineage-системой. Использует lineage для debugging data quality issues. Визуализирует зависимости в DataHub/OpenMetadata.

Data Quality Применение

Настраивает data quality framework: Great Expectations/Soda для automated checks, custom expectations, alerting при failures. Мониторит data freshness и volume anomalies.

Data Warehouse Design Применение

Проектирует DWH-компоненты: dimensional modeling по Kimball, SCD Types (1, 2, 3), aggregate tables. Настраивает incremental loading. Оптимизирует производительность через distribution keys и sort keys.

dbt Применение

Проектирует dbt-проект: custom macros, incremental models, snapshots для SCD Type 2. Настраивает environments (dev/staging/prod). Оптимизирует модели через materialization выбор.

Delta Lake / Apache Iceberg Применение

Самостоятельно реализует data pipelines с Delta Lake / Apache Iceberg. Оптимизирует производительность. Обеспечивает data quality.

Pandas / Polars Применение

Оптимизирует обработку через pandas/Polars: chunked reading для больших файлов, category dtype для memory, vectorized operations вместо iterrows. Мигрирует на Polars для performance-critical задач.

SQL-based ETL Применение

Проектирует SQL-трансформации: stored procedures для complex ETL, parameterized queries, temp tables для промежуточных вычислений. Оптимизирует execution plans. Управляет transaction control.

Stream Processing Применение

Строит ETL-пайплайны реального времени с Kafka Streams для трансформации и обогащения данных. Реализует семантику exactly-once и мониторит consumer lag на этапах обработки.

Observability и мониторинг · 1

Prometheus и Grafana Применение

Добавляет custom metrics в приложение (counter, gauge, histogram). Пишет PromQL-запросы для дашбордов. Создаёт Grafana dashboards. Настраивает базовые алерты (high error rate, high latency).

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Алгоритмы и сложностьАсинхронное программированиеДокументирование APIИнтеграционное тестированиеКачество кода и рефакторингМногопоточное программированиеОсновы System DesignПаттерны проектированияПрактики безопасного кодаПринципы ООП и SOLIDСтруктурированное логированиеСтруктуры данныхТипобезопасность и системы типовApache KafkaAWSChatGPT / ClaudeCode ReviewCursor IDEDockerE2E тестированиеElasticsearch / OpenSearchGit AdvancedGitHub Actions / GitLab CIGitHub CopilotGraphQL DesigngRPC и Protocol BuffersJWT / OAuth2 / OIDCKubernetes CoreOpenTelemetryOWASP и безопасность приложенийPrompt Engineering для кодаPython Web FrameworksRedisREST API DesignS3 / Object StorageSLI / SLO / SLATask QueuesTerraformUnit-тестирование

Что меняется на Senior

64 навыков получают более высокое ожидание или становятся ключевыми при переходе с Middle на Senior. Сначала самые большие скачки.

Страница Senior →
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 64 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.