Определяет стратегию оптимизации производительности аналитической платформы. Проектирует подходы к обработке петабайтных датасетов: incremental-модели, approximate-алгоритмы (HyperLogLog для distinct count), materialized views для тяжёлых агрегаций.
Роли · Analytics Engineer · Principal
Что должен уметь Principal }
37 ключевых навыков, всего 52. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Principal }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Principal
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 3
Определяет стратегию технического качества аналитической платформы. Устанавливает метрики надёжности: data freshness SLA, test coverage для критических моделей, automated data quality checks. Планирует миграции между версиями dbt и warehouse.
Проектирует архитектуру хранения данных платформы: columnar-форматы для OLAP, semi-structured JSON для event-данных, graph-структуры для data lineage. Определяет стратегию сериализации для interoperability между Snowflake, BigQuery и Spark.
Backend Development · 4
Проектирует архитектуру real-time аналитики: streaming ingestion в data warehouse, Kafka-based change data capture, event-driven обновление материализованных представлений. Определяет governance для событийных данных и их трансформации.
Проектирует платформу data discovery на базе Elasticsearch: semantic search по метаданным, рекомендации связанных моделей, full-text поиск по SQL-определениям и документации. Интегрирует с dbt docs и BI-каталогами.
Проектирует API-слой аналитической платформы: metrics store API, semantic layer endpoints, data marketplace. Определяет стратегию API для self-service доступа бизнес-пользователей к данным через query engines.
Проектирует caching-инфраструктуру для аналитики: multi-tier кеширование (warehouse result cache, application cache, CDN для embedded-дашбордов). Определяет стратегию согласованности кеша при инкрементальных обновлениях данных.
Базы данных · 6
Проектирует стратегию оптимизации доступа к данным на уровне платформы: automatic clustering, search optimization в Snowflake, BI Engine в BigQuery. Определяет подходы к cost-based оптимизации аналитических запросов.
Определяет стратегию эволюции аналитических моделей: версионирование schema changes через dbt, backward-compatible миграции для BI-дашбордов. Проектирует процессы zero-downtime миграций между warehouse-платформами (Redshift→Snowflake, BigQuery).
Проектирует стратегию оптимизации затрат на аналитический warehouse: multi-cluster конфигурации, auto-suspend политики, query routing. Определяет архитектурные решения для баланса между стоимостью и производительностью аналитики.
Проектирует архитектуру моделирования данных предприятия: единый semantic layer через dbt metrics/MetricFlow, data vault для исторического хранения, domain-driven модели. Определяет баланс между нормализацией и денормализацией для разных потребителей.
Проектирует архитектуру real-time аналитики на ClickHouse: кластерная конфигурация, репликация, distributed-таблицы для масштабирования. Определяет когда использовать ClickHouse vs warehouse (Snowflake/BigQuery) для разных аналитических задач.
Проектирует роль PostgreSQL в архитектуре аналитической платформы: как operational datastore, как metadata backend для инструментов (Airflow, dbt). Определяет стратегию миграции данных из PostgreSQL в аналитический warehouse.
API и интеграции · 2
Проектирует единую платформу документирования данных: интеграция dbt docs, API-каталога и BI-словаря в единый data portal. Определяет стратегию data literacy и self-service доступа к документации для бизнес-пользователей.
Проектирует стратегию интеграции внешних данных в аналитическую платформу: managed vs self-hosted connectors, API gateway для rate management, schema evolution для third-party API. Определяет governance для внешних источников данных.
Облако и инфраструктура · 2
Проектирует multi-cloud аналитическую платформу: AWS data lake + Snowflake/BigQuery для compute, cross-cloud data sharing. Определяет стратегию vendor lock-in mitigation и портируемости аналитических моделей между облаками.
Проектирует container-стратегию аналитической платформы: Kubernetes-оркестрация для dbt jobs и data pipelines, auto-scaling для batch-обработки, resource management для разных типов workloads (ELT, BI, ML).
DevOps и CI/CD · 1
Проектирует платформу continuous delivery для аналитики: multi-project CI с shared dbt packages, cross-team dependency management, automated rollback при data quality failures. Определяет стратегию deployment для критических бизнес-моделей.
Тестирование и QA · 2
Проектирует платформу сквозного тестирования данных: automated data observability, anomaly detection на каждом слое, reconciliation с source of truth. Определяет SLA для обнаружения и устранения data quality issues.
Проектирует стратегию обеспечения качества аналитической платформы: multi-layer testing (unit → integration → acceptance), automated KPI reconciliation с source systems, chaos testing для data pipelines.
Data Engineering · 12
Проектирует lakehouse-архитектуру предприятия: Delta Lake/Iceberg как open table format, integration с dbt для трансформаций, unified governance. Определяет стратегию совмещения data lake и warehouse для разных аналитических workloads.
Проектирует оркестрацию аналитической платформы предприятия: Airflow/Dagster для multi-project dbt, event-driven triggers, cross-team dependency management. Определяет стратегию миграции на managed orchestration (dbt Cloud, Dagster Cloud).
Проектирует BI-архитектуру предприятия: multi-tool стратегия для разных аудиторий, embedded analytics для продуктов, real-time дашборды. Определяет roadmap развития от traditional BI к self-service analytics и metrics layer.
Проектирует архитектуру next-gen оркестрации: asset-based подход Dagster для unified аналитической платформы, интеграция с dbt mesh, declarative scheduling. Определяет стратегию миграции с Airflow на asset-centric orchestration.
Проектирует единую платформу data discovery предприятия: автоматический lineage от источников до BI, semantic search по бизнес-терминам, data marketplace для self-service. Определяет governance-процессы для каталогизации и data stewardship.
Проектирует систему data contracts предприятия: стандарты формата контрактов, automated enforcement через CI/CD, интеграция с data mesh. Определяет governance для эволюции контрактов и breaking changes в аналитических моделях.
Проектирует enterprise data lineage: автоматическое отслеживание от source systems через ETL/ELT до BI-дашбордов, cross-tool lineage (Airflow → dbt → Tableau). Определяет стратегию lineage для compliance (GDPR, SOX) и data governance.
Проектирует enterprise data quality стратегию: unified quality framework для всех источников и трансформаций, ML-driven anomaly detection, automated root cause analysis. Определяет quality-as-code подход с version-controlled правилами.
Проектирует enterprise data warehouse стратегию: multi-warehouse для разных workloads (analytics, ML, reporting), cost governance через resource monitors. Определяет архитектуру data sharing между бизнес-юнитами и внешними партнёрами.
Проектирует стратегию развития dbt-платформы предприятия: multi-project mono-repo vs multi-repo, dbt mesh для cross-team зависимостей, миграция на dbt Cloud. Определяет roadmap внедрения MetricFlow/Semantic Layer для унификации бизнес-метрик.
Проектирует стратегию выбора инструментов трансформации: dbt (SQL) как primary, Python-модели для ML feature engineering и сложной логики. Определяет архитектуру интеграции pandas/polars/PySpark с dbt для гибридных pipeline-ов.
Проектирует стратегию трансформационного слоя предприятия: унификация SQL-диалектов через dbt adapters, portable бизнес-логика между warehouse-ами. Определяет архитектуру для поддержки real-time и batch трансформаций в единой платформе.
AI-ассистированная разработка · 1
Проектирует AI-augmented analytics engineering workflow: автогенерация dbt-моделей из data contracts, AI-powered data quality monitoring, natural language to SQL для self-service аналитики. Определяет стратегию внедрения LLM в аналитическую платформу.
Observability и мониторинг · 1
Проектирует enterprise data observability: unified мониторинг всех аналитических pipeline-ов, ML-driven anomaly detection, automated incident response. Определяет метрики SLO/SLI для аналитической платформы и процессы постмортемов.
Контроль версий и коллаборация · 3
Проектирует enterprise data documentation платформу: единый портал с dbt docs, BI glossary и data contracts. Определяет стратегию data literacy: onboarding для новых аналитиков, self-service data discovery, automated documentation через AI.
Проектирует review-процессы для enterprise аналитики: cross-team review для shared models, architectural decision records для data modeling choices. Определяет governance для production-ready моделей и процессы certification данных.
Проектирует стратегию version control для enterprise аналитики: dbt mesh с cross-project dependencies, Git-based data contracts, automated release pipelines. Определяет подходы к управлению сотнями dbt-моделей в распределённых командах.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
} в открытой матрице компетенций: 52 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.