Применяет алгоритмическое мышление к анализу данных: эффективные алгоритмы агрегации для больших датасетов, алгоритмы семплирования для выбора репрезентативных подмножеств, алгоритмы ранжирования для сравнительного анализа. Проектирует эффективные пайплайны обработки данных с учётом вычислительной сложности статистических операций.
Роли · Data Analyst · Senior
Что должен уметь Senior }
33 ключевых навыков, всего 48. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 3
Проектирует стандарты качества кода для аналитических кодовых баз: SQL style guides, паттерны организации ноутбуков, фреймворки воспроизводимого анализа. Рефакторит ad-hoc-запросы в модульные, задокументированные, версионированные аналитические пайплайны. Устанавливает практики ревью для статистической методологии и кода визуализации данных.
Выбирает оптимальные структуры данных для аналитических нагрузок: pandas DataFrame с подходящими dtypes для эффективности использования памяти, иерархические индексы для многомерного анализа, структуры сводных таблиц для перекрёстной табуляции. Оптимизирует операции с DataFrame через векторизацию и чанковую обработку. Проектирует эффективные схемы данных для воспроизводимых аналитических рабочих процессов.
Backend Development · 3
Проектирует решения Elasticsearch/OpenSearch для аналитических нагрузок: сложные aggregation-запросы, cross-cluster search для распределённых датасетов и кастомные анализаторы для text mining. Оптимизирует для паттернов аналитических запросов и исследования больших данных.
Создаёт бэкенды для исследования и визуализации данных на Flask и Streamlit. Оптимизирует API-эндпоинты, отдающие агрегированные метрики для управленческих дашбордов. Выбирает фреймворки для интерактивных приложений со встроенными графиками. Менторит аналитиков по созданию веб-отчётности.
Проектирует архитектуры кэширования Redis для аналитических платформ — кэширование результатов запросов для ускорения дашбордов, кэширование материализованных агрегаций для сложных отчётов и управление состоянием фильтров на основе сессий. Оптимизирует память Redis для больших аналитических наборов результатов. Менторит команду по стратегиям кэширования, балансируя свежесть данных с производительностью дашбордов.
Базы данных · 6
Проектирует архитектуру индексирования для enterprise аналитических платформ: индексы секционированных таблиц, стратегии индексирования материализованных представлений и управление индексами для query engines data lake (Presto, Trino). Внедряет автоматические системы рекомендации индексов на основе анализа нагрузки запросов. Оптимизирует стратегии индексирования для смешанных OLTP/OLAP нагрузок.
Проектирует архитектуру запросов для аналитических платформ: федерация запросов между гетерогенными источниками данных, адаптивное выполнение запросов для различных объёмов данных и автоматизированные системы рекомендаций оптимизации запросов. Внедряет governance производительности запросов с SLA-целями. Создаёт библиотеку аналитических паттернов запросов и обучающие материалы по оптимизации. Менторит команду по продвинутому query engineering.
Проектирует сложные аналитические модели данных для кросс-доменного анализа с оптимизированными паттернами запросов. Внедряет продвинутые техники моделирования: bridge-таблицы, безфактовые факты и накопительные снэпшоты. Менторит аналитиков по лучшим практикам моделирования и эволюции схем.
Проектирует оптимальные схемы таблиц и стратегии запросов для сложных аналитических нагрузок в ClickHouse. Владеет продвинутыми оконными функциями с пользовательскими фреймами для сложного анализа временных рядов. Реализует эффективные пайплайны когортного анализа на больших масштабах, используя материализованные представления, проекции и bitmap-функции для таблиц с миллиардами строк.
Проектирует переиспользуемые аналитические SQL-фреймворки с параметризованными CTE, рекурсивными запросами и продвинутыми оконными функциями для сложного статистического анализа в MySQL. Создаёт слои самообслуживания для извлечения данных с документированными представлениями и хранимыми процедурами для нетехнических пользователей. Оптимизирует MySQL для аналитических нагрузок настройкой буферных пулов, буферов сортировки и параметров временных таблиц.
Проектирует архитектуру PostgreSQL для аналитических команд: оптимизирует производительность запросов для сложного многомерного анализа, внедряет продвинутые стратегии индексирования для аналитических нагрузок, настраивает стратегии обновления материализованных представлений для отчётности близкой к реальному времени. Менторит аналитиков по оптимизации производительности SQL и лучшим практикам моделирования данных.
API и интеграции · 2
Проектирует комплексную архитектуру API-документации для аналитических платформ данных и self-service доступа к данным. Определяет стандарты документирования для API запросов данных, включая руководства по производительности, аннотации data governance и аналитику использования. Формирует автоматическую генерацию документации для API каталога данных и аналитических пайплайнов.
Проектирует архитектуру API для доступа к аналитическим данным: эффективные паттерны data API для дашбордов, оптимизация пагинации для больших наборов результатов, стратегии кэширования API для часто запрашиваемых данных. Определяет API-контракты для аналитических пайплайнов. Менторит команду по паттернам доступа к данным через API.
Data Engineering · 10
Проектирует архитектуру пайплайнов Airflow для сложных аналитических workflow с кросс-датасетными зависимостями. Внедряет отслеживание lineage данных и аудит-логирование. Оптимизирует производительность DAG для обработки больших аналитических данных.
Проектирует масштабируемую архитектуру дашбордов для продвинутой статистической визуализации и кросс-функционального когортного анализа. Оптимизирует работу с большими данными через инкрементальное обновление и материализованные представления. Внедряет governance метрик в дашбордах A/B-тестов и аналитики.
Проектирует стратегию каталога данных для аналитического домена. Внедряет автоматическое профилирование данных и обнаружение аномалий для записей каталога. Строит workflow обнаружения, ускоряющие онбординг аналитиков и кросс-командное сотрудничество.
Проектирует фреймворк контрактов данных для аналитического домена, обеспечивая кросс-командную консистентность данных. Внедряет автоматизацию тестирования контрактов и обнаружение дрифта. Менторит аналитиков по contract-driven разработке и владению качеством данных.
Проектирует стратегию lineage данных для аналитического домена с отслеживанием на уровне колонок и автоматической документацией. Внедряет мониторинг качества данных на основе lineage и workflow root cause анализа. Менторит аналитиков по lineage-first практикам разработки.
Проектирует архитектуру качества данных на базе Great Expectations, dbt и кастомных фреймворков. Внедряет observability с обнаружением аномалий и анализом первопричин. Устанавливает data contracts между командами. Продвигает governance и SLA для аналитических датасетов.
Ведёт проектирование аналитических схем по бизнес-доменам, устанавливая паттерны построения таблиц фактов и измерений. Оптимизирует сложные запросы к хранилищу через редизайн схем и рекомендации по стратегиям партиционирования. Выступает связующим звеном между инженерами данных и бизнесом, переводя аналитические потребности в требования к архитектуре хранилища.
Проектирует архитектуру dbt-трансформаций для сложных аналитических доменов. Внедряет продвинутые паттерны: юнит-тестирование, contract enforcement и версионированную эволюцию схем. Менторит аналитиков по лучшим практикам dbt и эффективному проектированию SQL-трансформаций.
Проектирует архитектуру обработки данных для аналитических платформ: распределённые пайплайны данных, интегрирующие Pandas/Polars со Spark/Dask, автоматический мониторинг качества данных и подготовка данных для self-service аналитики. Реализует data governance с эволюцией схем и обратной совместимостью. Создаёт организационные стандарты трансформации данных и переиспользуемую библиотеку. Менторит команду по оптимизации производительности.
Проектирует комплексные ETL-воркфлоу для кросс-функциональных аналитических датасетов. Разрабатывает фреймворки когортного извлечения, строит self-service пайплайны очистки данных и оптимизирует трансформации для масштабного ad-hoc анализа.
Machine Learning и AI · 2
Проектирует стандарты трекинга экспериментов для аналитических команд: создаёт переиспользуемые шаблоны для A/B-тестов и каузальных анализов, интегрирует трекинг с BI-дашбордами для прозрачности перед стейкхолдерами, менторит аналитиков по ведению аудируемых историй экспериментов
Обладает глубокой экспертизой в интерпретируемости моделей scikit-learn через permutation_importance и интеграцию SHAP для отчётности руководству. Проектирует автоматизированные аналитические pipelines для регулярных BI-задач. Менторит аналитиков по предотвращению data leakage и стратегиям holdout.
AI-ассистированная разработка · 3
Обладает глубокой экспертизой применения ChatGPT/Claude для продвинутых аналитических процессов. Проектирует AI-ассистированные пайплайны для автоматизированного EDA, генерации гипотез и отчётности на естественном языке. Оптимизирует prompt engineering для сложных задач статистического анализа и менторит команду по критической оценке сгенерированных AI аналитических инсайтов.
Проектирует стратегии внедрения GitHub Copilot для аналитических команд: оптимизирует prompt engineering для кода анализа данных и визуализации, внедряет валидацию для AI-сгенерированных статистических вычислений, измеряет влияние на эффективность аналитического воркфлоу. Менторит аналитиков по критической оценке AI-ассистированного аналитического кода.
Создаёт production-grade системы промптов для автоматизированных пайплайнов данных с обработкой ошибок и циклами валидации. Проектирует бенчмарки оценки промптов на доменных датасетах и экспертных аннотациях. Менторит аналитиков по продвинутым техникам: chain-of-thought для сложных расчётов, RAG для контексто-ёмкого анализа.
Observability и мониторинг · 2
Проектирует стратегию наблюдаемости для инфраструктуры аналитики данных: внедряет трассировку для пайплайнов трансформации данных, определяет SLI/SLO для качества и задержки аналитических данных, проводит post-mortem по сбоям обработки данных. Менторит команду по анализу логов для сложных расследований качества данных.
Проектирует стратегию наблюдаемости для аналитической инфраструктуры с Prometheus & Grafana: внедряет мониторинг для пайплайнов трансформации данных, определяет SLI/SLO для качества аналитических данных и производительности запросов, проводит post-mortem по сбоям обработки. Менторит команду по мониторингу аналитической инфраструктуры на основе метрик.
Контроль версий и коллаборация · 2
Проектирует процессы код-ревью для аналитики: стандарты ревью SQL с фокусом на производительность, чек-листы ревью статистической методологии, gates ревью дата-пайплайнов. Менторит команду по ревью аналитического кода на воспроизводимость и корректность.
Проектирует Git-воркфлоу для аналитических команд: внедряет стратегии ветвления для совместной разработки ноутбуков, оптимизирует разрешение конфликтов для общих аналитических активов, настраивает автоматизированную валидацию для скриптов трансформации данных. Менторит аналитиков по продвинутым Git-практикам для воспроизводимых пайплайнов анализа.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
48 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Алгоритмы и сложность: Продвинутый → Эксперт
- Документирование API: Продвинутый → Эксперт
- Индексирование БД: Продвинутый → Эксперт
- Качество кода и рефакторинг: Продвинутый → Эксперт
- Оптимизация запросов: Продвинутый → Эксперт
- Проектирование схем данных: Продвинутый → Эксперт
- Структурированное логирование: Продвинутый → Эксперт
- Структуры данных: Продвинутый → Эксперт
- Трекинг экспериментов: Продвинутый → Эксперт
- Apache Airflow: Продвинутый → Эксперт
} в открытой матрице компетенций: 48 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.