Применяет алгоритмическое мышление для оптимизации аналитических пайплайнов: анализ планов выполнения запросов для сложных агрегаций, алгоритмы инкрементальных вычислений для обработки больших датасетов, стратегии партиционирования на основе паттернов распределения данных. Проектирует эффективные алгоритмы трансформации данных для нагрузок хранилища.
Роли · Analytics Engineer · Senior
Что должен уметь Senior }
37 ключевых навыков, всего 53. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 3
Проектирует стандарты качества кода для аналитических кодовых баз: организация dbt-моделей, SQL style guides, паттерны тестирования трансформаций данных. Рефакторит сложные SQL-пайплайны для читаемости и производительности. Внедряет автоматический линтинг для dbt-проектов и SQL-диалектов конкретных хранилищ.
Выбирает оптимальные структуры данных для аналитических платформ: материализованные представления, таблицы пре-агрегации, стратегии колоночного партиционирования для запросов к хранилищу. Оптимизирует структуру DAG dbt-моделей для инкрементальной обработки. Проектирует схемы таблиц измерений/фактов для производительности запросов на больших аналитических нагрузках.
Backend Development · 4
Интегрирует Kafka-потоки как источники данных для аналитических моделей. Настраивает consumer-приложения для захвата событий в staging-слой warehouse. Работает со Schema Registry для обеспечения совместимости схем в downstream-моделях.
Настраивает Elasticsearch как поисковый движок для data catalog и discovery-платформы. Индексирует метаданные dbt-моделей, описания таблиц и колонок для полнотекстового поиска аналитиками.
Разрабатывает внутренние data API на FastAPI для доступа к метрикам и метаданным аналитической платформы. Создаёт эндпоинты для programmatic-доступа к dbt artifacts, результатам data quality checks и каталогу моделей.
Использует Redis для кеширования результатов тяжёлых аналитических запросов и lookup-таблиц. Реализует TTL-стратегии для обеспечения свежести кешированных метрик в BI-дашбордах. Настраивает invalidation при обновлении dbt-моделей.
Базы данных · 6
Оптимизирует индексирование на уровне аналитического warehouse: clustering keys в Snowflake, partition pruning в BigQuery, sort keys в Redshift. Проектирует стратегию индексирования для ускорения типичных BI-запросов.
Проектирует database-архитектуру с Миграции БД для высоконагруженных систем. Оптимизирует производительность, настраивает репликацию и шардирование.
Проводит глубокую оптимизацию аналитических запросов: рефакторинг dbt DAG для уменьшения compute costs, настройка warehouse-специфичных оптимизаций (Snowflake warehouse sizing, BigQuery slot allocation). Внедряет query tagging для cost attribution.
Проектирует сложные аналитические модели: wide tables для BI-инструментов, activity schema для event-аналитики, bridge-таблицы для many-to-many связей. Оптимизирует dbt DAG: устраняет circular dependencies, минимизирует compute через правильную слоёность.
Проектирует аналитические таблицы в ClickHouse: выбор движков (MergeTree, AggregatingMergeTree), partition key для time-series данных. Настраивает материализованные представления для real-time агрегаций метрик.
Оптимизирует PostgreSQL как источник данных для аналитической платформы: настраивает logical replication для CDC, партиционирование для исторических данных. Проектирует схемы для эффективного извлечения данных в dbt-модели.
API и интеграции · 2
Проектирует систему документирования data API аналитической платформы: OpenAPI-спецификации для internal endpoints, автогенерация документации из dbt artifacts. Внедряет стандарты описания семантики данных в API.
Разрабатывает reusable-фреймворк для API-интеграций аналитической платформы: generic extractors с конфигурацией через YAML, schema inference, automatic data type mapping. Проектирует error handling и alerting для API-источников.
Облако и инфраструктура · 2
Проектирует AWS-архитектуру аналитической платформы: Redshift Serverless для cost-оптимизации, Lake Formation для data governance, Step Functions для оркестрации ELT. Настраивает cross-account доступ к данным для разных команд.
Проектирует containerized-среду для аналитической платформы: multi-stage builds для dbt-проектов, оптимизация образов для CI/CD, кеширование dbt packages. Настраивает контейнеризацию custom data connectors и quality tools.
DevOps и CI/CD · 1
Проектирует полный CI/CD pipeline для аналитической платформы: staging deploy на PR, production deploy на merge, automated regression tests. Настраивает dbt Cloud integration или custom GitHub Actions для blue-green deployment моделей.
Тестирование и QA · 2
Проектирует интеграционные тесты аналитической платформы: end-to-end проверка от источников до BI-дашбордов, data reconciliation между слоями warehouse. Автоматизирует тестирование dbt с реальными данными в staging-среде.
Проектирует стратегию unit-тестирования dbt-проектов: dbt unit tests для критических трансформаций, pytest для custom Python extractors. Внедряет test fixtures и factories для генерации тестовых данных, покрывающих реальные аналитические сценарии.
Data Engineering · 12
Проектирует data-архитектуру с Архитектура Data Lake. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует data-архитектуру с Apache Airflow. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Определяет стандарты BI-разработки: semantic layer / LookML / Tableau data models для consistency метрик, шаблоны дашбордов для типовых бизнес-задач. Оптимизирует взаимодействие dbt-моделей и BI через extract-based или live connection подходы.
Проектирует data-архитектуру с Dagster / Prefect. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует data-архитектуру с Data Catalog. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует data-архитектуру с Data Contracts. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует data-архитектуру с Data Lineage. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует стратегию data quality для аналитической платформы: multi-layer testing (source → staging → marts), anomaly detection через dbt + elementary, automated alerting. Интегрирует quality checks в CI/CD pipeline.
Проектирует data-архитектуру с Data Warehouse Design. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует data-архитектуру с dbt. Оптимизирует для big data. Внедряет data governance и quality frameworks.
Проектирует Python-pipeline для данных, которые сложно обработать чистым SQL: NLP-обработка текстов, геокодирование, complex regex parsing. Оптимизирует pandas/polars для обработки миллионов строк: chunked reading, lazy evaluation в polars.
Проектирует оптимальные SQL-трансформации для аналитического warehouse: декомпозиция сложной логики в промежуточные модели, warehouse-специфичные оптимизации (Snowflake QUALIFY, BigQuery STRUCT). Создаёт reusable dbt macros для типовых паттернов.
AI-ассистированная разработка · 1
Оптимизирует workflow с Copilot для аналитических задач: генерация complex SQL transformations, dbt macros, Jinja templates. Настраивает Copilot workspace с контекстом dbt-проекта для более точных suggestions. Комбинирует с ChatGPT для проектирования моделей.
Observability и мониторинг · 1
Проектирует observability для аналитической платформы: dbt Cloud/Elementary для мониторинга моделей, structured logging для custom extractors, alerting на anomalies в данных. Интегрирует dbt run metadata с Datadog/Grafana.
Контроль версий и коллаборация · 3
Проектирует систему документирования аналитической платформы: integration dbt docs с data catalog, automated freshness и lineage documentation, glossary бизнес-терминов. Внедряет documentation-as-code с CI-валидацией полноты описаний.
Проводит архитектурные review dbt-проектов: оценивает дизайн моделей, правильность слоёности (staging/intermediate/marts), реusability. Ревьюит impact analysis для изменений в shared моделях. Менторит через review с подробными объяснениями.
Проектирует Git-workflow для аналитической команды: branching strategy для dbt (trunk-based vs gitflow), protected branches с required CI checks. Настраивает Git hooks для sqlfluff linting и dbt compile validation перед коммитом.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
53 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Алгоритмы и сложность: Продвинутый → Эксперт
- Архитектура Data Lake: Продвинутый → Эксперт
- Документация как код: Продвинутый → Эксперт
- Документирование API: Продвинутый → Эксперт
- Индексирование БД: Продвинутый → Эксперт
- Интеграционное тестирование: Продвинутый → Эксперт
- Качество кода и рефакторинг: Продвинутый → Эксперт
- Миграции БД: Продвинутый → Эксперт
- Оптимизация запросов: Продвинутый → Эксперт
- Проектирование схем данных: Продвинутый → Эксперт
} в открытой матрице компетенций: 53 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.