Роли · Data Engineer · Junior

Что должен уметь Junior }

24 ключевых навыков, всего 64. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Junior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Базы данных, Облако и инфраструктура, Data Engineering.

24ключевых навыков
40дополнительных навыков
3областей
0%на уровне Продвинутый или Эксперт
Оценить себя как Junior Полная матрица роли

Ключевые навыки для Junior

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Базы данных · 9

Индексирование БД Осведомлённость

Создаёт индексы для ускорения extraction-запросов: B-tree для равенств, composite для multi-column WHERE. Использует EXPLAIN для проверки использования индексов в ETL-запросах.

Миграции БД Осведомлённость

Выполняет миграции схем data warehouse: CREATE/ALTER TABLE через SQL-скрипты. Понимает идемпотентность DDL. Тестирует миграции на dev-среде перед production.

Оптимизация запросов Осведомлённость

Оптимизирует SQL-запросы для ETL: избегает SELECT *, использует WHERE для фильтрации на стороне источника. Понимает pushdown predicates. Анализирует EXPLAIN для поиска full table scans.

Проектирует таблицы data warehouse: star schema (fact + dimension), типы SCD (Type 1, 2). Создаёт staging, intermediate и mart слои. Понимает нормализацию и денормализацию для аналитики.

Репликация и High Availability Осведомлённость

Понимает базовые концепции репликации БД: primary-replica топология, синхронная и асинхронная репликация, replication lag. Мониторит здоровье реплик через стандартные инструменты. Следует runbook команды для failover-процедур и настройки connection string.

Apache Cassandra Осведомлённость

Пишет базовые CQL-запросы для чтения и вставки данных в таблицы Cassandra. Понимает ключи партиционирования и кластерные колонки в существующих схемах. Следует принципам моделирования данных, установленным командой.

Backup и Disaster Recovery Осведомлённость

Понимает важность backup в data pipelines: checkpoint файлы, intermediate results. Использует snapshot перед destructive операциями. Знает как восстановить данные из staging-таблиц.

ClickHouse Осведомлённость

Пишет аналитические запросы в ClickHouse: SELECT с GROUP BY, ORDER BY, LIMIT. Понимает MergeTree engine и партиционирование. Вставляет данные через INSERT и использует tabular форматы.

PostgreSQL Осведомлённость

Пишет SQL-запросы для извлечения данных: SELECT с JOIN, GROUP BY, оконные функции. Работает с psycopg2/SQLAlchemy. Понимает типы PostgreSQL: JSONB, arrays, timestamps with timezone.

Облако и инфраструктура · 1

Основы сетей Осведомлённость

Понимает сетевые основы для data pipelines: TCP/IP для database connections, DNS для service discovery. Настраивает connectivity между ETL и источниками данных через VPN/VPC peering.

Data Engineering · 14

Архитектура Data Lake Осведомлённость

Понимает принципы медальонной архитектуры (bronze/silver/gold). Загружает данные в raw-зоны с помощью пакетных загрузчиков и реестров схем. Следует установленным паттернам для размещения Parquet/ORC файлов и метаданных каталога.

Apache Airflow Осведомлённость

Создаёт Airflow DAGs: PythonOperator, BashOperator, task dependencies. Понимает execution date, catchup, schedule interval. Мониторит runs в Airflow UI. Дебажит failed tasks через логи.

Apache Spark Осведомлённость

Понимает основы Apache Spark для дата-инженерии: API RDD/DataFrame, базовые трансформации и действия, чтение/запись Parquet/CSV/JSON. Следует командным паттернам для структуры PySpark-задач, конфигурации SparkSession и выделения ресурсов кластера.

Dagster / Prefect Осведомлённость

Использует Dagster или Prefect для построения и планирования базовых ETL-пайплайнов. Понимает концепции assets, tasks и flow. Мониторит выполнение пайплайнов и обрабатывает повторные запуски при временных сбоях.

Data Catalog Осведомлённость

Использует data catalog для поиска датасетов: просматривает описания таблиц, владельцев, lineage. Документирует свои таблицы: описания полей, business glossary terms.

Data Contracts Осведомлённость

Понимает data contracts: schema definition, SLA (freshness, completeness). Следует установленным контрактам при создании таблиц. Документирует schema своих data products.

Data Lineage Осведомлённость

Читает data lineage графы: понимает откуда данные приходят и куда уходят. Использует lineage для impact analysis при изменении источников. Документирует зависимости своих моделей.

Data Quality Осведомлённость

Пишет базовые data quality checks: NOT NULL, unique constraints, value ranges. Использует dbt tests или Great Expectations для валидации. Понимает метрики: completeness, accuracy, timeliness.

Data Warehouse Design Осведомлённость

Создаёт базовые таблицы хранилища в Snowflake, BigQuery или Redshift, следуя командным конвенциям. Применяет простые стратегии партиционирования и кластеризации для типовых паттернов запросов. Строит простые ELT-пайплайны для загрузки сырых данных в staging-зону с базовыми трансформациями.

dbt Осведомлённость

Создаёт dbt-модели: SELECT-запросы с ref() и source(), staging и mart модели. Пишет generic tests (unique, not_null). Понимает DAG и зависимости между моделями.

Delta Lake / Apache Iceberg Осведомлённость

Понимает основы Delta Lake / Apache Iceberg. Работает с простыми ETL-задачами. Использует SQL для базовой обработки данных.

Pandas / Polars Осведомлённость

Обрабатывает данные через pandas: read_csv/read_parquet, фильтрация, группировка, merge. Понимает DataFrame API. Работает с типами данных и missing values (fillna, dropna).

SQL-based ETL Осведомлённость

Пишет SQL для ETL: INSERT INTO SELECT, MERGE для upserts, CTE для readable transformations. Использует оконные функции (ROW_NUMBER, LAG, LEAD) для data processing.

Stream Processing Осведомлённость

Понимает основы Kafka Streams, включая двойственность KStream/KTable. Пишет простые потоковые consumers и producers для этапов загрузки данных в pipeline.

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Алгоритмы и сложностьАсинхронное программированиеДокументирование APIИнтеграционное тестированиеКачество кода и рефакторингМногопоточное программированиеОсновы System DesignПаттерны проектированияПрактики безопасного кодаПринципы ООП и SOLIDСтруктурированное логированиеСтруктуры данныхТипобезопасность и системы типовApache KafkaAWSChatGPT / ClaudeCode ReviewCursor IDEDockerE2E тестированиеElasticsearch / OpenSearchGit AdvancedGitHub Actions / GitLab CIGitHub CopilotGraphQL DesigngRPC и Protocol BuffersJWT / OAuth2 / OIDCKubernetes CoreOpenTelemetryOWASP и безопасность приложенийPrometheus и GrafanaPrompt Engineering для кодаPython Web FrameworksRedisREST API DesignS3 / Object StorageSLI / SLO / SLATask QueuesTerraformUnit-тестирование

Что меняется на Middle

64 навыков получают более высокое ожидание или становятся ключевыми при переходе с Junior на Middle. Сначала самые большие скачки.

Страница Middle →
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 64 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.