Устанавливает performance-бюджеты для data pipelines. Проводит review алгоритмов сортировки и агрегации в ETL-процессах. Внедряет профилирование Spark jobs и оптимизацию shuffle-операций.
Роли · Data Engineer · Lead
Что должен уметь Lead }
45 ключевых навыков, всего 62. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Lead }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Lead
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 5
Определяет стратегию асинхронной обработки: asyncio для API-вызовов в ETL, aiohttp для bulk-загрузки, async generators для streaming. Внедряет стандарты обработки backpressure в data pipelines.
Формирует стандарты качества pipeline-кода: ruff/black для форматирования, mypy для типизации, pytest для unit-тестов transformations. Внедряет data contracts и schema validation в CI.
Определяет стандарты структуры pipeline-кода: абстрактные классы для ETL-компонентов, Strategy pattern для разных источников данных, Factory для reader/writer. Обучает команду применению SOLID в data engineering.
Определяет стандарты работы с данными в pipeline-коде: dataclasses для схем, TypedDict для конфигов, Pydantic-модели для валидации. Ревьюит выбор структур в контексте memory-эффективности batch-обработки.
Backend Development · 6
Определяет Kafka-стратегию data-платформы: topic naming conventions, retention policies, schema evolution rules. Внедряет Kafka Connect для интеграции с RDBMS, S3, Elasticsearch.
Определяет стратегию поиска в data-платформе: Elasticsearch для metadata discovery, full-text search по описаниям датасетов. Внедряет ILM для управления жизненным циклом индексов.
Определяет архитектуру data services: FastAPI для metadata API, внутренние API для data contracts, webhook-эндпоинты для event-driven pipelines. Выбирает между sync/async подход для разных типов data-запросов.
Определяет caching-стратегию в data pipelines: Redis для горячих reference data, TTL-политики для свежести кеша. Устанавливает метрики и SLA для cache-зависимых pipelines.
Определяет S3-стратегию data lake: naming conventions, access patterns, versioning policy. Внедряет bucket policies и cross-account access для multi-team data sharing.
Определяет стратегию task orchestration: Celery для микро-задач vs Airflow для DAG-ов, выбор между push/pull моделями. Внедряет стандарты идемпотентности и мониторинга очередей.
Базы данных · 9
Определяет стандарты индексирования: обязательный EXPLAIN review для extraction-запросов, автоматическое обнаружение missing indexes в slow query log. Балансирует read/write performance.
Определяет migration-стандарты: review процесс для schema changes, rollback стратегии, compatibility matrix. Координирует миграции между upstream producers и downstream consumers.
Определяет стандарты производительности запросов: SLA на extraction time, бюджеты на ресурсы. Внедряет автоматический мониторинг slow queries и regression detection.
Определяет стандарты data modeling: naming conventions, documentation requirements, review процесс. Выбирает подход (Kimball vs Inmon vs Data Vault) по контексту. Обучает команду modeling best practices.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Репликация и High Availability. Проводит review схем данных и стратегий масштабирования.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Apache Cassandra. Проводит review схем данных и стратегий масштабирования.
Определяет DR-стандарты data-платформы: RPO/RTO по tier-ам данных, retention policies, automated backup verification. Проводит DR-drills и recovery testing.
Определяет ClickHouse-стандарты: schema design guidelines, naming conventions, monitoring через system tables. Выбирает ClickHouse vs другие OLAP (Druid, Pinot, DuckDB) по сценарию использования.
Определяет PostgreSQL-стандарты в data-платформе: когда PostgreSQL vs аналитические БД (ClickHouse/Redshift), connection pooling через PgBouncer для ETL-нагрузки. Проводит review extraction-паттернов.
API и интеграции · 2
Определяет serialization-стратегию: Protobuf vs Avro vs JSON для разных сценариев (streaming vs batch, internal vs external). Внедряет стандарты schema management и compatibility checking.
Определяет API-стандарты data-платформы: контракты для data producers, webhook-интерфейсы для event-driven ingestion, rate limiting для shared data API. Проводит review API-дизайна.
Облако и инфраструктура · 4
Определяет AWS-стратегию data-платформы: multi-account для prod/staging, Lake Formation для fine-grained access control, cost allocation по проектам. Выбирает managed vs self-hosted.
Определяет Docker-стандарты data-команды: base images, security scanning, registry management. Внедряет container-based testing для data pipelines.
Определяет K8s-стратегию для data platform: namespace isolation, resource quotas по командам, scheduling policies для batch vs streaming. Внедряет GitOps для infrastructure.
Определяет IaC-стандарты data-платформы: module library, naming conventions, change management процесс. Внедряет policy-as-code (Sentinel/OPA) для data infrastructure.
DevOps и CI/CD · 1
Определяет CI/CD-стандарты data-команды: mandatory checks (dbt test, SQL lint, contract validation), deployment strategy, release management для data pipelines.
Data Engineering · 14
Определяет data lake стандарты: zone architecture (bronze/silver/gold), file formats, partition strategies. Внедряет access control и data classification. Координирует между data producers и consumers.
Определяет Airflow-стандарты: DAG structure, naming conventions, testing requirements, deployment workflow. Выбирает между Airflow и альтернативами (Dagster, Prefect) по сценарию.
Определяет Spark-стандарты: coding guidelines, job submission patterns, resource allocation policies. Выбирает между PySpark и Spark SQL по сценарию. Внедряет unit-тестирование Spark jobs через chispa.
Определяет orchestration-стандарты: Dagster vs Prefect vs Airflow выбор по проекту, migration стратегия. Оценивает software-defined assets (Dagster) vs task-based (Airflow) подходы.
Определяет стандарты data cataloging: обязательные метаданные, ownership policy, data stewardship процесс. Внедряет data discovery workflow для self-service analytics.
Определяет стандарты data contracts: template, review процесс, enforcement policy. Координирует между producer и consumer командами. Внедряет культуру data-as-a-product.
Определяет lineage-стандарты: покрытие, granularity (table vs column level), freshness. Использует lineage для impact analysis при schema changes. Внедряет lineage-based alerting.
Определяет data quality стандарты: SLA per dataset, quality dimensions (accuracy, completeness, consistency, timeliness), ownership model. Внедряет data quality scorecard.
Определяет DWH-стандарты: modeling methodology (Kimball vs Inmon), naming conventions, testing requirements. Координирует между domain teams для conformed dimensions. Проводит архитектурный review.
Определяет dbt-стандарты: структура проекта, naming conventions, documentation requirements, PR review checklist. Внедряет dbt metrics layer и exposure definitions для data contracts.
Определяет Delta Lake / Iceberg стандарты: table format selection, partitioning strategy, compaction schedules. Внедряет time-travel для data debugging и schema enforcement.
Определяет стандарты data processing: когда pandas/Polars vs Spark, coding guidelines, testing patterns. Внедряет benchmarking для выбора инструментов. Обучает команду Polars adoption.
Определяет SQL-стандарты data-команды: style guide, review checklist, performance budgets. Выбирает между SQL-based ETL (dbt) и code-based (PySpark) по сценарию.
Определяет streaming-стандарты: Kafka Streams vs Flink, windowing policies, state management. Внедряет мониторинг consumer lag и processing latency. Выбирает between exactly-once и at-least-once.
AI-ассистированная разработка · 1
Внедряет Copilot в команде: настраивает политики, определяет границы использования для data engineering. Оценивает ROI. Следит за security: утечки credentials, SQL injection в generated code.
Observability и мониторинг · 1
Определяет logging-стандарты data-платформы: обязательные поля (pipeline_id, dataset, stage), log levels policy, retention. Внедряет log-based monitoring для pipeline SLA.
Контроль версий и коллаборация · 2
Формирует культуру code review: определяет checklist (SQL performance, test coverage, documentation), устанавливает SLA. Автоматизирует checks (dbt test, SQL lint, contract validation).
Формирует Git-workflow data-команды: branching model, PR-процесс с dbt CI, CODEOWNERS для critical models. Определяет правила для mono/multi-repo data проектов.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Principal
0 навыков получают более высокое ожидание или становятся ключевыми при переходе с Lead на Principal. Сначала самые большие скачки.
} в открытой матрице компетенций: 62 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.