Понимает, как индексы влияют на время выполнения запросов к аналитическим датасетам. Знает разницу между кластерными и некластерными индексами. Умеет проверить, покрывают ли существующие индексы часто используемые колонки WHERE и JOIN в аналитических запросах.
Роли · Data Analyst · Junior
Что должен уметь Junior }
16 ключевых навыков, всего 48. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Junior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Базы данных, Data Engineering.
Ключевые навыки для Junior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Базы данных · 6
Понимает основы оптимизации запросов для анализа данных: интерпретация планов выполнения, типичные паттерны медленных запросов и влияние объёма данных на производительность запросов. Следует командным практикам написания производительных аналитических запросов и использования инструментов профилирования запросов.
Понимает основы реляционного моделирования данных: нормализация, первичные/внешние ключи и связи сущностей. Следует командным паттернам для структурирования аналитических таблиц. Использует ER-диаграммы для понимания зависимостей данных для точного анализа.
Выполняет аналитические SELECT-запросы в ClickHouse с фильтрацией, сортировкой и базовыми агрегациями. Понимает отличия ClickHouse от строковых СУБД для аналитических задач. Выполняет простые когортные запросы с использованием функций дат и GROUP BY для анализа поведения пользователей во времени.
Извлекает наборы данных из MySQL с помощью фильтрованных запросов SELECT с WHERE, JOIN и базовой агрегацией. Создаёт временные таблицы для промежуточных результатов анализа. Пишет исследовательские SQL-запросы для проверки качества данных и выявления закономерностей в аналитических процессах.
Понимает базовый PostgreSQL для анализа данных: написание аналитических запросов с оконными функциями, понимание структур таблиц для исследовательского анализа, базовые CTE для сложного извлечения данных. Следует командным конвенциям организации аналитических запросов и паттернов доступа к данным.
Data Engineering · 10
Понимает базовые концепции Airflow и планирование DAG. Отслеживает запуски пайплайнов, наполняющих аналитические датасеты. Следует документации команды для запуска ad-hoc DAG для обновления и извлечения данных.
Создаёт исследовательские дашборды с базовыми фильтрами и детализацией. Понимает стандартные типы графиков для статистической визуализации. Строит простые когортные представления и следует соглашениям команды по компоновке и именованию.
Понимает основы каталога данных и возможности поиска метаданных. Использует каталог для нахождения релевантных датасетов для аналитических запросов. Документирует описания датасетов и метаданные на уровне колонок по стандартам команды.
Понимает основы контрактов данных и их роль в обеспечении надёжности данных. Следует схемам контрактов при написании аналитических запросов. Выявляет и эскалирует проблемы качества данных, нарушающие установленные контракты.
Понимает основы lineage данных и их важность для доверия к данным. Использует визуализацию lineage для понимания, как аналитические таблицы строятся из сырых источников. Документирует зависимости запросов для воспроизводимого анализа.
Применяет проверки качества данных с помощью pandas и SQL перед анализом. Валидирует датасеты на полноту в Jupyter notebooks. Использует инструменты профилирования для обнаружения пропусков и выбросов. Следует стандартам команды по очистке данных в отчётах Superset.
Выполняет запросы к таблицам хранилища, корректно соединяя факты и измерения. Понимает назначение аналитических схем и ориентируется в star schema для извлечения значимых наборов данных. Пишет эффективные SELECT-запросы с использованием партиционирования и преагрегированных таблиц для типовых аналитических задач.
Понимает основы dbt: модели, тесты и документация. Следует командным паттернам для построения аналитических трансформаций от staging до mart-слоёв. Использует документацию dbt для обнаружения доступных датасетов для анализа.
Понимает основы Pandas для аналитических воркфлоу: загрузка данных из множества источников, разведочный анализ данных через describe/info/value_counts и базовая визуализация данных с интеграцией matplotlib. Очищает датасеты обработкой пропущенных значений и конвертацией типов. Следует командным стандартам кодирования для Jupyter notebooks.
Понимает основы SQL-based ETL для аналитических датасетов. Пишет базовые запросы для извлечения и очистки данных. Следует установленным паттернам пайплайнов для подготовки отфильтрованных данных для ad-hoc анализа.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Middle
48 навыков получают более высокое ожидание или становятся ключевыми при переходе с Junior на Middle. Сначала самые большие скачки.
- Индексирование БД: Осведомлённость → Применение
- Оптимизация запросов: Осведомлённость → Применение
- Проектирование схем данных: Осведомлённость → Применение
- Apache Airflow: Осведомлённость → Применение
- BI-дашборды: Осведомлённость → Применение
- ClickHouse: Осведомлённость → Применение
- Data Catalog: Осведомлённость → Применение
- Data Contracts: Осведомлённость → Применение
- Data Lineage: Осведомлённость → Применение
- Data Quality: Осведомлённость → Применение
} в открытой матрице компетенций: 48 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.