Роли · Data Engineer · Principal

Что должен уметь Principal }

45 ключевых навыков, всего 60. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Principal }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.

45ключевых навыков
15дополнительных навыков
10областей
100%на уровне Продвинутый или Эксперт
Оценить себя как Principal Полная матрица роли

Ключевые навыки для Principal

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Основы программирования · 5

Определяет стратегию производительности data-платформы. Проектирует алгоритмы обработки петабайтных датасетов: partitioning, bucketing, approximate algorithms (HyperLogLog, Count-Min Sketch). Балансирует throughput и latency на уровне архитектуры.

Проектирует async-архитектуру data-платформы: event-driven ingestion, async CDC, streaming pipelines с exactly-once semantics. Определяет стратегию масштабирования real-time обработки через Kafka Streams и Flink.

Определяет стратегию технического качества data-платформы. Планирует миграции между версиями Spark/Airflow. Устанавливает метрики надёжности pipelines: SLA, data freshness, completeness.

Формирует архитектурную модель data-платформы: plugin-система для connectors, абстракции для data sources/sinks. Определяет где OOP оправдано, а где функциональный стиль (PySpark transformations) предпочтительнее.

Проектирует модели данных платформы: columnar форматы (Parquet, ORC) для аналитики, row-based для транзакций, graph-структуры для lineage. Определяет стратегию serialization/deserialization для cross-system совместимости.

Backend Development · 6

Apache Kafka Эксперт

Проектирует streaming-платформу организации: multi-cluster Kafka, MirrorMaker 2, tiered storage. Определяет governance для event schemas и data contracts между producer/consumer командами.

Проектирует search-инфраструктуру data mesh: federated search по каталогам доменов, ML-ранжирование для data discovery, cross-cluster search.

Python Web Frameworks Эксперт

Проектирует API-слой data-платформы: self-service data portal, metadata API, data marketplace. Определяет стандарты API для доступа к данным через query engines (Trino, Presto).

Redis Эксперт

Проектирует caching-инфраструктуру data-платформы: shared Redis для cross-pipeline lookup data, warming стратегии при деплоях, partitioning для масштабирования.

S3 / Object Storage Эксперт

Проектирует object storage архитектуру: multi-region replication, S3-compatible storage (MinIO) для on-prem, cost optimization через storage classes. Определяет governance для data retention.

Task Queues Эксперт

Проектирует архитектуру распределённой обработки: task queues для near-real-time vs batch schedulers, hybrid подходы. Определяет SLA и capacity planning для разных уровней приоритета.

Базы данных · 9

Проектирует indexing-стратегию data-платформы: columnar indexes (Parquet row groups), zone maps, min/max statistics. Определяет подходы к индексированию в data lake (Iceberg metadata) и data warehouse.

Миграции БД Эксперт

Проектирует schema management платформу: schema registry, versioned data contracts, automated compatibility checking. Определяет governance для schema evolution в data mesh.

Проектирует query optimization стратегию: federated queries через Trino/Presto, query caching, materialized views. Определяет SLA для query latency по типам: ad-hoc, scheduled, interactive.

Проектирует data modeling стратегию организации: domain-driven data models, canonical data model, data mesh domain boundaries. Определяет governance для entity resolution и master data management.

Проектирует стратегию репликации данных через платформу: CDC через Debezium/Kafka Connect, cross-region replication для geo-distributed analytics, multi-master scenarios. Определяет consistency guarantees для разных data products.

Apache Cassandra Эксперт

Проектирует NoSQL-стратегию data-платформы: Cassandra для high-write ingestion, ScyllaDB для low-latency lookups. Определяет data modeling best practices для wide-column stores и интеграцию с Spark для batch analytics.

Проектирует data resilience стратегию: multi-region replication, cross-cloud DR, cold/warm/hot backup tiers. Определяет governance для data protection и compliance (GDPR right to delete).

ClickHouse Эксперт

Проектирует OLAP-стратегию платформы: ClickHouse cluster topology, cross-DC replication, capacity planning. Определяет когда ClickHouse vs Snowflake/BigQuery. Планирует data serving layer архитектуру.

PostgreSQL Эксперт

Проектирует PostgreSQL-стратегию: logical replication для real-time CDC, Citus для distributed analytics, TimescaleDB для time-series pipelines. Определяет границы PostgreSQL в data architecture.

API и интеграции · 2

gRPC и Protocol Buffers Эксперт

Проектирует serialization-стратегию data-платформы: единый schema registry, cross-format compatibility, schema evolution governance. Определяет когда Protobuf vs Avro vs Parquet schemas.

REST API Design Эксперт

Проектирует API-стратегию data mesh: domain data product API, federated data access layer, API gateway для data services. Определяет стандарты для data-as-a-product interfaces.

Облако и инфраструктура · 4

AWS Эксперт

Проектирует cloud-стратегию данных: multi-cloud (AWS + GCP/Azure), data residency compliance, vendor lock-in mitigation. Определяет reference architecture для cloud-native data platform.

Docker Эксперт

Проектирует container-стратегию data-платформы: стандартизация runtime для Spark/Airflow/dbt, image governance, registry architecture. Определяет container vs serverless для разных workloads.

Kubernetes Core Эксперт

Проектирует Kubernetes-платформу для data: multi-cluster для staging/production, spot instances для batch, dedicated nodes для streaming. Определяет compute strategy и cost optimization.

Terraform Эксперт

Проектирует IaC-стратегию организации: self-service infrastructure provisioning для data teams, cost controls, compliance automation. Определяет multi-cloud infrastructure abstraction.

DevOps и CI/CD · 1

Проектирует CI/CD-стратегию data-платформы: unified pipeline для разных data tools (dbt, Airflow, Spark), environment management, data infrastructure provisioning. Определяет release governance.

Data Engineering · 14

Проектирует data lakehouse архитектуру: unified storage layer, query engine federation (Trino/Spark), governance framework. Определяет когда lakehouse vs traditional DWH vs data mesh.

Apache Airflow Эксперт

Проектирует orchestration-стратегию: Airflow для batch, event-driven для real-time, hybrid patterns. Определяет multi-team governance, shared infrastructure, cost allocation.

Apache Spark Эксперт

Проектирует Spark-стратегию платформы: EMR vs Databricks vs self-hosted, cluster sizing, dynamic allocation. Определяет когда Spark vs DuckDB vs Polars. Планирует миграцию на Spark 4.0.

Dagster / Prefect Эксперт

Проектирует next-gen orchestration: Dagster для software-defined data assets, Prefect для event-driven, hybrid с Airflow legacy. Определяет migration path и coexistence стратегию.

Data Catalog Эксперт

Проектирует metadata-платформу организации: federated catalog для data mesh, automated metadata extraction, ML-powered data discovery. Определяет metadata governance и interoperability standards.

Data Contracts Эксперт

Проектирует data contract платформу: centralized registry, automated enforcement, compatibility checking. Определяет governance model для inter-team data sharing в data mesh.

Data Lineage Эксперт

Проектирует lineage-платформу организации: end-to-end lineage от operational systems до BI dashboards, automated compliance reporting, lineage-driven data governance.

Data Quality Эксперт

Проектирует data quality платформу: centralized quality monitoring, ML-based anomaly detection, quality-driven data trust scoring. Определяет organization-wide data quality framework.

Data Warehouse Design Эксперт

Проектирует DWH-стратегию организации: centralized vs decentralized, semantic layer, cost management. Определяет evolution path: traditional DWH → lakehouse → data mesh. Планирует migration между платформами.

dbt Эксперт

Проектирует transformation-стратегию: dbt для SQL-transformations, Spark для complex processing, dbt mesh для multi-team. Определяет governance для shared models и cross-project dependencies.

Проектирует open table format стратегию: Delta Lake vs Iceberg vs Hudi, catalog integration (Unity/Nessie), cross-engine interop. Определяет migration path от Hive tables.

Pandas / Polars Эксперт

Определяет стратегию local data processing: DuckDB для ad-hoc analytics, Polars для batch ETL, Arrow для zero-copy data exchange. Проектирует unified API для разных backends.

SQL-based ETL Эксперт

Проектирует transformation-стратегию: SQL для declarative ETL, Python для complex logic, hybrid подходы. Определяет query engine selection (Trino, BigQuery, Redshift) по workload pattern.

Stream Processing Эксперт

Проектирует streaming-архитектуру data-платформы: Kafka Streams для lightweight processing, Flink для complex CEP, hybrid batch+streaming. Определяет lambda vs kappa architecture по сценарию.

AI-ассистированная разработка · 1

GitHub Copilot Эксперт

Определяет стратегию AI-ассистированной data engineering: выбор инструментов, governance-политики, quality gates для AI-сгенерированного кода и SQL. Оценивает LLM-based data tools (text-to-SQL).

Observability и мониторинг · 1

Контроль версий и коллаборация · 2

Code Review Эксперт

Определяет review-стандарты организации: cross-team review для shared data models, architectural review board для platform changes. Формирует engineering excellence culture.

Git Advanced Эксперт

Определяет стратегию версионирования data-платформы: mono vs multi-repo для dbt/Airflow/infra, release management для data pipeline changes. Координирует cross-team collaboration.

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Документирование APIИнтеграционное тестированиеМногопоточное программированиеОсновы System DesignПаттерны проектированияПрактики безопасного кодаТипобезопасность и системы типовChatGPT / ClaudeE2E тестированиеGraphQL DesignJWT / OAuth2 / OIDCOpenTelemetryOWASP и безопасность приложенийSLI / SLO / SLAUnit-тестирование
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 60 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.