AI-ассистенты кодирования 1
▼
Использует Copilot для генерации data кода: SQL-запросы, pandas transformations, pytest fixtures для data testing. Понимает когда подсказка корректна. Пишет docstrings для лучших подсказок.
Продуктивно работает с Copilot: генерирует dbt models по описанию, Airflow DAGs, data validation rules. Использует Copilot Chat для анализа SQL-запросов. Критически оценивает suggestions на корректность.
Максимизирует продуктивность: генерация complex SQL/dbt macros, Terraform modules, data quality rules. Выстраивает workflow где AI ускоряет рутину (boilerplate), инженер фокусируется на архитектуре.
Внедряет Copilot в команде: настраивает политики, определяет границы использования для data engineering. Оценивает ROI. Следит за security: утечки credentials, SQL injection в generated code.
Batch-обработка данных 4
▼
Понимает основы Apache Spark для дата-инженерии: API RDD/DataFrame, базовые трансформации и действия, чтение/запись Parquet/CSV/JSON. Следует командным паттернам для структуры PySpark-задач, конфигурации SparkSession и выделения ресурсов кластера.
Самостоятельно реализует Spark-пайплайны данных: оптимизирует shuffle-операции и стратегии партиционирования, реализует Structured Streaming для real-time ETL, управляет Delta Lake таблицами с ACID-транзакциями. Тюнит конфигурации Spark для памяти, параллелизма и стоимостной эффективности.
Проектирует архитектуру платформы данных на Spark: multi-tenant управление кластерами, cost-optimized планирование нагрузок с YARN/Kubernetes и lakehouse-архитектура с Delta Lake/Iceberg. Реализует фреймворки качества данных, CDC-пайплайны и мониторинг производительности Spark-приложений.
Определяет Spark-стандарты: coding guidelines, job submission patterns, resource allocation policies. Выбирает между PySpark и Spark SQL по сценарию. Внедряет unit-тестирование Spark jobs через chispa.
Создаёт dbt-модели: SELECT-запросы с ref() и source(), staging и mart модели. Пишет generic tests (unique, not_null). Понимает DAG и зависимости между моделями.
Проектирует dbt-проект: custom macros, incremental models, snapshots для SCD Type 2. Настраивает environments (dev/staging/prod). Оптимизирует модели через materialization выбор.
Проектирует dbt-архитектуру: multi-project setup, package management, custom generic tests. Реализует unit-tests для complex transformations. Оптимизирует производительность: incremental + merge, partition-based.
Определяет dbt-стандарты: структура проекта, naming conventions, documentation requirements, PR review checklist. Внедряет dbt metrics layer и exposure definitions для data contracts.
Обрабатывает данные через pandas: read_csv/read_parquet, фильтрация, группировка, merge. Понимает DataFrame API. Работает с типами данных и missing values (fillna, dropna).
Оптимизирует обработку через pandas/Polars: chunked reading для больших файлов, category dtype для memory, vectorized operations вместо iterrows. Мигрирует на Polars для performance-critical задач.
Проектирует data processing: Polars для single-node high-performance, pandas для quick prototyping, PySpark для distributed. Выбирает инструмент по объёму и паттерну обработки. Оптимизирует memory management.
Определяет стандарты data processing: когда pandas/Polars vs Spark, coding guidelines, testing patterns. Внедряет benchmarking для выбора инструментов. Обучает команду Polars adoption.
Пишет SQL для ETL: INSERT INTO SELECT, MERGE для upserts, CTE для readable transformations. Использует оконные функции (ROW_NUMBER, LAG, LEAD) для data processing.
Проектирует SQL-трансформации: stored procedures для complex ETL, parameterized queries, temp tables для промежуточных вычислений. Оптимизирует execution plans. Управляет transaction control.
Проектирует SQL-based ETL архитектуру: ELT pattern (load-then-transform), incremental processing через merge/upsert, materialized views для performance. Интегрирует с dbt для version-controlled SQL.
Определяет SQL-стандарты data-команды: style guide, review checklist, performance budgets. Выбирает между SQL-based ETL (dbt) и code-based (PySpark) по сценарию.
Code Review 1
▼
Участвует в code review data кода: проверяет SQL-стиль, dbt model structure, naming conventions. Оставляет конструктивные комментарии. Учится на замечаниях к своим PR.
Проводит quality review: проверяет SQL performance (joins, window functions), dbt materialization choice, data quality tests coverage. Даёт feedback по data modeling. Предлагает оптимизации.
Проводит архитектурный review: оценивает pipeline design, data model decisions, schema evolution impact. Ревьюит Airflow DAG structure, Terraform changes для data infra.
Формирует культуру code review: определяет checklist (SQL performance, test coverage, documentation), устанавливает SLA. Автоматизирует checks (dbt test, SQL lint, contract validation).
Data Lakehouse 2
▼
Понимает основы Delta Lake / Apache Iceberg. Работает с простыми ETL-задачами. Использует SQL для базовой обработки данных.
Самостоятельно реализует data pipelines с Delta Lake / Apache Iceberg. Оптимизирует производительность. Обеспечивает data quality.
Проектирует data-архитектуру с Delta Lake / Apache Iceberg. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Определяет Delta Lake / Iceberg стандарты: table format selection, partitioning strategy, compaction schedules. Внедряет time-travel для data debugging и schema enforcement.
Понимает принципы медальонной архитектуры (bronze/silver/gold). Загружает данные в raw-зоны с помощью пакетных загрузчиков и реестров схем. Следует установленным паттернам для размещения Parquet/ORC файлов и метаданных каталога.
Самостоятельно проектирует ETL-пайплайны между зонами data lake с поддержкой эволюции схем. Оптимизирует стоимость хранения через lifecycle-политики, компактификацию и многоуровневое хранение. Реализует контроль качества данных между слоями медальонной архитектуры с автоматизированной валидацией.
Проектирует data-архитектуру с Архитектура Data Lake. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Определяет data lake стандарты: zone architecture (bronze/silver/gold), file formats, partition strategies. Внедряет access control и data classification. Координирует между data producers и consumers.
Data Warehousing 1
▼
Создаёт базовые таблицы хранилища в Snowflake, BigQuery или Redshift, следуя командным конвенциям. Применяет простые стратегии партиционирования и кластеризации для типовых паттернов запросов. Строит простые ELT-пайплайны для загрузки сырых данных в staging-зону с базовыми трансформациями.
Проектирует DWH-компоненты: dimensional modeling по Kimball, SCD Types (1, 2, 3), aggregate tables. Настраивает incremental loading. Оптимизирует производительность через distribution keys и sort keys.
Проектирует data warehouse архитектуру: multi-layer (staging → ODS → DWH → marts), Slowly Changing Dimensions, bridge tables для many-to-many. Выбирает cloud DWH (Redshift/BigQuery/Snowflake) по требованиям.
Определяет DWH-стандарты: modeling methodology (Kimball vs Inmon), naming conventions, testing requirements. Координирует между domain teams для conformed dimensions. Проводит архитектурный review.
Git и workflow 1
▼
Работает с Git в data проектах: commit, push, pull, branch для dbt models и Airflow DAGs. Пишет осмысленные commit-сообщения. Разрешает merge-конфликты в SQL-файлах и config files.
Использует Git продвинуто: interactive rebase, cherry-pick для hotfixes в pipelines. Работает с mono-repo (dbt + Airflow + configs). Настраивает .gitignore для data artifacts (parquet, csv).
Определяет branching-стратегию для data projects: trunk-based с feature flags для DAGs, protected branches для production models. Настраивает pre-commit hooks для SQL linting и dbt compile.
Формирует Git-workflow data-команды: branching model, PR-процесс с dbt CI, CODEOWNERS для critical models. Определяет правила для mono/multi-repo data проектов.
gRPC 1
▼
Понимает Protobuf-схемы для data serialization. Использует gRPC для высокопроизводительной передачи данных между сервисами. Работает с .proto файлами для определения data contracts.
Проектирует Protobuf-схемы для data pipelines: schema evolution с backward compatibility, nested messages для complex data. Использует gRPC streaming для real-time data transfer.
Проектирует gRPC-интерфейсы для data services: bidirectional streaming для CDC, server streaming для bulk data delivery. Интегрирует Protobuf с Schema Registry для centralized schema management.
Определяет serialization-стратегию: Protobuf vs Avro vs JSON для разных сценариев (streaming vs batch, internal vs external). Внедряет стандарты schema management и compatibility checking.
Infrastructure as Code 1
▼
Использует Terraform для создания data-инфраструктуры: S3 buckets, RDS instances, Glue catalogs. Понимает state, plan, apply. Читает существующие модули.
Пишет Terraform-модули для data stack: Redshift/BigQuery clusters, Kafka topics, Airflow MWAA. Управляет environments через workspaces. Настраивает remote state в S3.
Проектирует IaC для data-платформы: переиспользуемые модули для data services (EMR, Glue, Kinesis), environment promotion pipeline. Автоматизирует provisioning data infrastructure.
Определяет IaC-стандарты data-платформы: module library, naming conventions, change management процесс. Внедряет policy-as-code (Sentinel/OPA) для data infrastructure.
NoSQL базы данных 2
▼
Пишет базовые CQL-запросы для чтения и вставки данных в таблицы Cassandra. Понимает ключи партиционирования и кластерные колонки в существующих схемах. Следует принципам моделирования данных, установленным командой.
Проектирует модели данных Cassandra, оптимизированные под query-driven паттерны доступа. Реализует эффективные batch-операции и управляет жизненным циклом данных через TTL. Настраивает уровни консистентности чтения/записи для баланса задержки и надёжности.
Архитектурирует мультидатацентровые развёртывания Cassandra для real-time пайплайнов данных. Оптимизирует топологию кластера, стратегии компакции и распределение партиций для петабайтных нагрузок. Проектирует стратегии миграции между версиями схем.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Apache Cassandra. Проводит review схем данных и стратегий масштабирования.
Пишет аналитические запросы в ClickHouse: SELECT с GROUP BY, ORDER BY, LIMIT. Понимает MergeTree engine и партиционирование. Вставляет данные через INSERT и использует tabular форматы.
Проектирует таблицы ClickHouse для аналитических pipeline-ов: выбор engine (MergeTree, AggregatingMergeTree, ReplacingMergeTree), partitioning by date, materialized views для pre-aggregation. Оптимизирует вставку через batch inserts.
Проектирует ClickHouse-архитектуру для data warehouse: distributed таблицы, sharding strategy, dictionary tables для joins. Оптимизирует запросы: projection, skip indexes, query pipeline tuning. Настраивает Kafka engine для streaming ingestion.
Определяет ClickHouse-стандарты: schema design guidelines, naming conventions, monitoring через system tables. Выбирает ClickHouse vs другие OLAP (Druid, Pinot, DuckDB) по сценарию использования.
Stream-обработка 1
▼
Понимает основы Kafka Streams, включая двойственность KStream/KTable. Пишет простые потоковые consumers и producers для этапов загрузки данных в pipeline.
Строит ETL-пайплайны реального времени с Kafka Streams для трансформации и обогащения данных. Реализует семантику exactly-once и мониторит consumer lag на этапах обработки.
Проектирует сквозные архитектуры потоковых данных с Kafka Streams для высоконагруженных pipeline. Оркестрирует сложную обработку событий, реализует стратегии эволюции схем и оптимизирует обработку backpressure.
Определяет streaming-стандарты: Kafka Streams vs Flink, windowing policies, state management. Внедряет мониторинг consumer lag и processing latency. Выбирает between exactly-once и at-least-once.
Администрирование БД 2
▼
Понимает важность backup в data pipelines: checkpoint файлы, intermediate results. Использует snapshot перед destructive операциями. Знает как восстановить данные из staging-таблиц.
Настраивает backup для data pipeline артефактов: версионирование промежуточных данных в S3, point-in-time recovery в PostgreSQL. Реализует rollback-механизмы для ETL-процессов.
Проектирует disaster recovery для data-платформы: backup стратегии для разных storage (HDFS snapshots, S3 versioning, DB dumps). Реализует time-travel в Delta Lake/Iceberg для data recovery.
Определяет DR-стандарты data-платформы: RPO/RTO по tier-ам данных, retention policies, automated backup verification. Проводит DR-drills и recovery testing.
Понимает базовые концепции репликации БД: primary-replica топология, синхронная и асинхронная репликация, replication lag. Мониторит здоровье реплик через стандартные инструменты. Следует runbook команды для failover-процедур и настройки connection string.
Настраивает и управляет репликацией БД для data-пайплайнов: read replicas для ETL-разгрузки, schema migrations в реплицированных средах, change data capture (CDC). Понимает trade-offs консистентности, проектирует data flows с учётом replication lag.
Проектирует high-availability data-архитектуры с multi-region репликацией, кросс-базовыми CDC-пайплайнами и event-driven синхронизацией. Оптимизирует репликацию для масштабных аналитических нагрузок с минимальным влиянием на production. DR-стратегии с RPO/RTO.
Определяет стратегию работы с данными на уровне продукта. Формирует стандарты Репликация и High Availability. Проводит review схем данных и стратегий масштабирования.
Алгоритмы и структуры данных 1
▼
Понимает базовые алгоритмические концепции для дата-пайплайнов: простые стратегии join, базовые концепции партиционирования, алгоритмы сортировки для упорядочения данных. Следует руководству команды по выбору алгоритмов для ETL-операций.
Самостоятельно применяет алгоритмическое мышление в data engineering: выбирает подходящие алгоритмы join для распределённой обработки, понимает влияние операций shuffle на производительность Spark, оценивает стратегии партиционирования для распределения данных. Анализирует сложность операций ETL-пайплайнов в масштабе.
Применяет алгоритмическую экспертизу к дата-платформе: выбор алгоритмов join для распределённой обработки данных (broadcast vs sort-merge vs hash), алгоритмы оптимизации shuffle для Spark, алгоритмы инкрементальных вычислений для потокового ETL. Проектирует эффективные алгоритмы дедупликации и качества данных в масштабе.
Устанавливает performance-бюджеты для data pipelines. Проводит review алгоритмов сортировки и агрегации в ETL-процессах. Внедряет профилирование Spark jobs и оптимизацию shuffle-операций.
Качество данных 1
▼
Пишет базовые data quality checks: NOT NULL, unique constraints, value ranges. Использует dbt tests или Great Expectations для валидации. Понимает метрики: completeness, accuracy, timeliness.
Настраивает data quality framework: Great Expectations/Soda для automated checks, custom expectations, alerting при failures. Мониторит data freshness и volume anomalies.
Проектирует data quality систему: multi-layer validation (source → staging → mart), anomaly detection (statistical), automated remediation. Интегрирует quality metrics в data catalog.
Определяет data quality стандарты: SLA per dataset, quality dimensions (accuracy, completeness, consistency, timeliness), ownership model. Внедряет data quality scorecard.
Контейнеризация 1
▼
Запускает data pipeline компоненты в Docker: Airflow, Spark, PostgreSQL для локальной разработки. Понимает Dockerfile, docker-compose. Собирает образы с Python-зависимостями для ETL-задач.
Создаёт production-ready контейнеры для data tools: multi-stage builds для Spark jobs, оптимизация размера образов с Python-пакетами (numpy, pandas). Настраивает docker-compose для полного data stack.
Проектирует контейнеризацию data-платформы: образы для Airflow workers, Spark executors, dbt. Оптимизирует build pipeline: кеширование pip-зависимостей, slim-образы. Настраивает local development environment.
Определяет Docker-стандарты data-команды: base images, security scanning, registry management. Внедряет container-based testing для data pipelines.
Кэширование 1
▼
Использует Redis на базовом уровне в Airflow/dbt. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Redis в Airflow/dbt. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью great_expectations.
Использует Redis для data pipeline оптимизации: кеширование lookup-таблиц, deduplication через Redis Sets, rate limiting для API-источников. Реализует Redis Streams для lightweight event processing.
Определяет caching-стратегию в data pipelines: Redis для горячих reference data, TTL-политики для свежести кеша. Устанавливает метрики и SLA для cache-зависимых pipelines.
Метрики и мониторинг 1
▼
Просматривает дашборды в Grafana. Понимает, что такое метрики (CPU, memory, latency). Может найти нужный дашборд и проанализировать простой график.
Добавляет custom metrics в приложение (counter, gauge, histogram). Пишет PromQL-запросы для дашбордов. Создаёт Grafana dashboards. Настраивает базовые алерты (high error rate, high latency).
Проектирует observability stack для сервиса. Создаёт SLI/SLO дашборды. Пишет сложные PromQL (rate, histogram_quantile, recording rules). Настраивает Alertmanager с routing и silencing. Оптимизирует cardinality метрик. Интегрирует с PagerDuty/OpsGenie.
Многопоточность и конкурентность 1
▼
Понимает основы Асинхронное программирование на базовом уровне. Применяет простые концепции в рабочих задачах с использованием Python/SQL. Следует рекомендациям senior-разработчиков при решении задач.
Самостоятельно применяет асинхронное программирование в дата-пайплайнах: конкурентное получение данных из источников, async-оркестрация этапов ETL, неблокирующие проверки валидации данных. Понимает компромиссы между синхронными и асинхронными паттернами пайплайнов в Spark/Airflow.
Проектирует async-архитектуры для дата-пайплайнов: конкурентное получение данных из источников в масштабе, async-оркестрация ETL с backpressure, неблокирующая валидация качества данных. Менторит команду по async-паттернам для пропускной способности дата-пайплайнов.
Определяет стратегию асинхронной обработки: asyncio для API-вызовов в ETL, aiohttp для bulk-загрузки, async generators для streaming. Внедряет стандарты обработки backpressure в data pipelines.
Моделирование данных 2
▼
Выполняет миграции схем data warehouse: CREATE/ALTER TABLE через SQL-скрипты. Понимает идемпотентность DDL. Тестирует миграции на dev-среде перед production.
Проектирует schema evolution для data pipelines: backward-compatible миграции, expand-contract для zero-downtime, версионирование через Flyway/Alembic. Обрабатывает schema drift в источниках.
Проектирует migration стратегию: zero-downtime миграции для data warehouse, schema evolution в Parquet/Avro, backward compatibility в data contracts. Автоматизирует через CI/CD.
Определяет migration-стандарты: review процесс для schema changes, rollback стратегии, compatibility matrix. Координирует миграции между upstream producers и downstream consumers.
Проектирует таблицы data warehouse: star schema (fact + dimension), типы SCD (Type 1, 2). Создаёт staging, intermediate и mart слои. Понимает нормализацию и денормализацию для аналитики.
Проектирует dimensional модели: Kimball methodology (conformed dimensions, bus matrix), Data Vault (hubs, links, satellites). Применяет SCD Type 2 с effective dates. Моделирует semi-structured данные.
Проектирует enterprise data модели: Data Vault 2.0 для гибкости, Anchor Modeling для high-change environments, wide tables для ClickHouse. Определяет layered architecture: raw → staging → curated → mart.
Определяет стандарты data modeling: naming conventions, documentation requirements, review процесс. Выбирает подход (Kimball vs Inmon vs Data Vault) по контексту. Обучает команду modeling best practices.
ООП и паттерны проектирования 1
▼
Понимает основы Принципы ООП и SOLID на базовом уровне. Применяет простые концепции в рабочих задачах с использованием Python/SQL. Следует рекомендациям senior-разработчиков при решении задач.
Самостоятельно применяет ООП/SOLID в коде дата-пайплайнов: правильная абстракция для ETL-этапов, интерфейсный дизайн коннекторов для источников данных, единственная ответственность в модулях трансформаций. Понимает компромиссы между ООП-паттернами и декларативными подходами в кодовых базах Spark/Airflow.
Применяет ООП/SOLID в архитектуре дата-платформы: абстрактные интерфейсы для коннекторов к источникам данных, strategy pattern для выбора движка трансформаций, template method для стандартизированных стадий пайплайна. Проектирует расширяемые дата-фреймворки, поддерживающие добавление новых источников данных и трансформаций без модификации ядра логики пайплайна.
Определяет стандарты структуры pipeline-кода: абстрактные классы для ETL-компонентов, Strategy pattern для разных источников данных, Factory для reader/writer. Обучает команду применению SOLID в data engineering.
Оптимизация БД 2
▼
Создаёт индексы для ускорения extraction-запросов: B-tree для равенств, composite для multi-column WHERE. Использует EXPLAIN для проверки использования индексов в ETL-запросах.
Проектирует стратегию индексирования для ETL-источников: partial indexes для active records, covering indexes для частых extractions. Понимает trade-off между скоростью чтения и записи в OLTP-источниках.
Оптимизирует индексирование для data pipelines: GIN для JSONB, BRIN для time-series, bloom filters в ClickHouse. Проектирует indexing стратегию учитывая batch vs streaming access patterns.
Определяет стандарты индексирования: обязательный EXPLAIN review для extraction-запросов, автоматическое обнаружение missing indexes в slow query log. Балансирует read/write performance.
Оптимизирует SQL-запросы для ETL: избегает SELECT *, использует WHERE для фильтрации на стороне источника. Понимает pushdown predicates. Анализирует EXPLAIN для поиска full table scans.
Оптимизирует extraction и transformation: predicate pushdown, partition pruning, выбор между JOIN и subquery. Профилирует SQL-запросы в Airflow через query tags. Оптимизирует Spark SQL execution plans.
Проектирует оптимальные data access patterns: incremental extraction через watermarks, micro-batch vs full-load trade-offs. Оптимизирует Spark query plans: broadcast joins, AQE, partition coalescing.
Определяет стандарты производительности запросов: SLA на extraction time, бюджеты на ресурсы. Внедряет автоматический мониторинг slow queries и regression detection.
Оркестрация данных 2
▼
Создаёт Airflow DAGs: PythonOperator, BashOperator, task dependencies. Понимает execution date, catchup, schedule interval. Мониторит runs в Airflow UI. Дебажит failed tasks через логи.
Проектирует Airflow DAGs: dynamic task generation, XCom для передачи данных, TaskGroups для организации. Использует sensors, hooks для интеграции с external systems. Настраивает connections и variables.
Проектирует Airflow-архитектуру: KubernetesExecutor для dynamic scaling, custom operators/hooks, DAG factory pattern для генерации. Оптимизирует performance: pool management, priority weight, concurrency.
Определяет Airflow-стандарты: DAG structure, naming conventions, testing requirements, deployment workflow. Выбирает между Airflow и альтернативами (Dagster, Prefect) по сценарию.
Использует Dagster или Prefect для построения и планирования базовых ETL-пайплайнов. Понимает концепции assets, tasks и flow. Мониторит выполнение пайплайнов и обрабатывает повторные запуски при временных сбоях.
Самостоятельно реализует data pipelines с Dagster / Prefect. Оптимизирует производительность. Обеспечивает data quality.
Проектирует data-архитектуру с Dagster / Prefect. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Определяет orchestration-стандарты: Dagster vs Prefect vs Airflow выбор по проекту, migration стратегия. Оценивает software-defined assets (Dagster) vs task-based (Airflow) подходы.
Реляционные БД 1
▼
Пишет SQL-запросы для извлечения данных: SELECT с JOIN, GROUP BY, оконные функции. Работает с psycopg2/SQLAlchemy. Понимает типы PostgreSQL: JSONB, arrays, timestamps with timezone.
Оптимизирует extraction из PostgreSQL: COPY для bulk export, cursor-based pagination, partitioned tables. Настраивает logical replication для CDC. Проектирует staging-таблицы для ETL.
Проектирует PostgreSQL как источник/приёмник data pipelines: CDC через Debezium, materialized views для агрегатов, FDW для federation. Оптимизирует VACUUM для high-write staging tables.
Определяет PostgreSQL-стандарты в data-платформе: когда PostgreSQL vs аналитические БД (ClickHouse/Redshift), connection pooling через PgBouncer для ETL-нагрузки. Проводит review extraction-паттернов.
Сети 1
▼
Понимает сетевые основы для data pipelines: TCP/IP для database connections, DNS для service discovery. Настраивает connectivity между ETL и источниками данных через VPN/VPC peering.
Настраивает сетевую связность для data infrastructure: VPC peering для cross-account access, PrivateLink для managed services, security groups для data pipeline компонентов. Диагностирует connection issues.
Проектирует сетевую архитектуру data-платформы: private connectivity к data sources, Transit Gateway для multi-VPC, Direct Connect для on-prem data centers. Оптимизирует сетевую производительность для bulk data transfer.
Управление данными 3
▼
Использует data catalog для поиска датасетов: просматривает описания таблиц, владельцев, lineage. Документирует свои таблицы: описания полей, business glossary terms.
Настраивает data catalog: интеграция с metadata sources (Hive, Glue, dbt), автоматический harvesting. Создаёт business glossary. Тегирует данные для классификации (PII, financial).
Проектирует metadata management: DataHub/OpenMetadata/Amundsen setup, custom connectors для internal systems, automated lineage extraction из Spark/Airflow. Интегрирует catalog с data quality.
Определяет стандарты data cataloging: обязательные метаданные, ownership policy, data stewardship процесс. Внедряет data discovery workflow для self-service analytics.
Понимает data contracts: schema definition, SLA (freshness, completeness). Следует установленным контрактам при создании таблиц. Документирует schema своих data products.
Создаёт data contracts: YAML/JSON schema definitions, quality checks, SLA metrics. Интегрирует contract validation в CI/CD. Настраивает alerting при нарушении контрактов.
Проектирует data contract framework: schema registry integration, automated validation pipeline, versioning strategy. Реализует contract testing между producers и consumers.
Определяет стандарты data contracts: template, review процесс, enforcement policy. Координирует между producer и consumer командами. Внедряет культуру data-as-a-product.
Читает data lineage графы: понимает откуда данные приходят и куда уходят. Использует lineage для impact analysis при изменении источников. Документирует зависимости своих моделей.
Настраивает автоматический сбор lineage: интеграция Airflow/dbt/Spark с lineage-системой. Использует lineage для debugging data quality issues. Визуализирует зависимости в DataHub/OpenMetadata.
Проектирует lineage-инфраструктуру: column-level lineage, cross-system tracking (operational → analytical), custom extractors для internal tools. Интегрирует lineage с data catalog и quality monitoring.
Определяет lineage-стандарты: покрытие, granularity (table vs column level), freshness. Использует lineage для impact analysis при schema changes. Внедряет lineage-based alerting.
Файловое и объектное хранилище 1
▼
Использует S3 / Object Storage на базовом уровне в Airflow/dbt. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с S3 / Object Storage в Airflow/dbt. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью great_expectations.
Проектирует data lake на S3: partitioning strategy (year/month/day), Parquet/ORC для аналитики, lifecycle policies для архивации. Оптимизирует costs через Intelligent-Tiering и Glacier.
Определяет S3-стратегию data lake: naming conventions, access patterns, versioning policy. Внедряет bucket policies и cross-account access для multi-team data sharing.
Чистый код и рефакторинг 1
▼
Понимает базовые принципы качества кода для кода дата-пайплайнов. Следует командным конвенциям структуры ETL-скриптов и форматирования SQL. Пишет простые, чистые функции трансформации данных с правильным логированием. Принимает обратную связь на код-ревью по организации кода пайплайнов.
Самостоятельно применяет практики качества кода в разработке дата-пайплайнов. Пишет чистый ETL/ELT-код с правильной обработкой ошибок, идемпотентностью и логированием. Понимает компромиссы между сложностью пайплайна и сопровождаемостью. Ревьюит код пайплайнов на проверки качества данных, обработку эволюции схемы и эффективность использования ресурсов.
Проектирует стандарты качества кода для дата-пайплайнов: структура DAG в Airflow, организация Spark-джобов, паттерны тестирования ETL. Рефакторит монолитные трансформации данных в модульные, идемпотентные стадии пайплайна. Внедряет quality gates для контроля data contracts и надёжности пайплайнов.
Формирует стандарты качества pipeline-кода: ruff/black для форматирования, mypy для типизации, pytest для unit-тестов transformations. Внедряет data contracts и schema validation в CI.