Роли · Site Reliability Engineer (SRE) · Senior

Что должен уметь Senior }

46 ключевых навыков, всего 61. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.

46ключевых навыков
15дополнительных навыков
13областей
100%на уровне Продвинутый или Эксперт
Оценить себя как Senior Полная матрица роли

Ключевые навыки для Senior

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Основы программирования · 6

Применяет алгоритмическое мышление к SRE: алгоритмы обнаружения аномалий для проактивного предотвращения инцидентов, алгоритмы load shedding для graceful degradation, алгоритмы предсказания ёмкости на основе исторических трендов. Проектирует эффективные алгоритмы алертинга, минимизирующие шум при сохранении чувствительности детекции.

Проектирует async-архитектуры для SRE-систем: конкурентный мониторинг в масштабе, async-оркестрация реагирования на инциденты, неблокирующая корреляция и маршрутизация алертов. Менторит команду по async-паттернам для надёжности операционных систем.

Проектирует стандарты качества кода для SRE-инструментария: структура автоматизации runbook, код пайплайнов observability, скрипты chaos engineering. Рефакторит автоматизацию управления инцидентами для надёжности и аудируемости. Устанавливает практики ревью для операционного кода: error budgets, мониторинг SLO, инструменты дежурств.

Обладает глубокой экспертизой в диагностике проблем многопоточности: анализирует contention потоков и deadlock в продакшен-системах в масштабе, внедряет мониторинг индикаторов здоровья конкурентных систем, оптимизирует конфигурации потоков по флотам сервисов. Менторит команду по отладке продакшен конкурентных систем и тюнингу производительности.

Принципы ООП и SOLID Продвинутый

Применяет ООП/SOLID в архитектуре SRE-инструментов: абстрактные интерфейсы для бэкендов мониторинга, strategy pattern для маршрутизации алертов, template method для стандартизированной автоматизации runbook. Проектирует расширяемые фреймворки observability с чистым разделением между слоями сбора данных, обработки и алертинга.

Структуры данных Продвинутый

Выбирает оптимальные структуры данных для SRE-инструментов: базы данных временных рядов для хранения метрик, структуры данных с эффективной кардинальностью для многомерного мониторинга, кольцевые буферы для окон последних событий. Оптимизирует структуры данных оценки алертов для минимальной задержки обработки правил. Проектирует эффективные модели данных для реконструкции таймлайна инцидентов и post-mortem анализа.

Backend Development · 3

Apache Kafka Продвинутый

Использует Kafka для SRE-задач: streaming metrics processing, alert aggregation, audit log collection. Настраивает consumer groups для distributed alert processing. Мониторит Kafka cluster health.

Python Web Frameworks Продвинутый

Разрабатывает SRE-сервисы на Flask/FastAPI: status pages, runbook automation API, custom webhook receivers для alerting integration. Реализует health-check endpoints для internal tooling.

Redis Продвинутый

Использует Redis для SRE-инструментов: rate limiting для alert deduplication, distributed locks для deployments, caching для status page. Мониторит Redis performance и memory usage.

Базы данных · 1

PostgreSQL Продвинутый

Проектирует PostgreSQL reliability: streaming replication setup, automated failover (Patroni), point-in-time recovery. Оптимизирует для operational workloads: vacuum tuning, index maintenance, connection pooling.

API и интеграции · 1

REST API Design Продвинутый

Проектирует API для SRE-платформы: self-service infrastructure provisioning, SLO management API, incident orchestration. Реализует idempotency для critical operations (rollback, scaling).

Облако и инфраструктура · 9

Проектирует load balancing архитектуру: global load balancing (Route53, Cloudflare), internal LB для microservices, gRPC balancing. Оптимизирует connection draining, session affinity, retry policies.

Основы сетей Продвинутый

Проектирует network reliability: multi-AZ networking, failover strategies, BGP для multi-homing. Оптимизирует network performance: connection pooling, keep-alive tuning, TCP optimization.

AWS Продвинутый

Проектирует AWS-платформу для reliability: multi-AZ architecture, cross-region DR, AWS Organizations для multi-account. Настраивает GuardDuty, Config Rules для security. Автоматизирует через AWS CDK/Lambda.

Docker Продвинутый

Проектирует container runtime standards: image security pipeline, registry management, runtime security (seccomp, AppArmor). Оптимизирует container performance: cgroup limits, OOM handling, filesystem layers.

Helm Продвинутый

Проектирует Helm-стратегию: library charts для shared components, umbrella charts для full stack deployment. Автоматизирует chart testing (helm unittest, ct lint). Внедряет GitOps workflow для Helm releases.

Kubernetes Advanced Продвинутый

Проектирует Kubernetes reliability: pod disruption budgets, topology spread constraints, custom operators для automation. Настраивает multi-zone deployment, graceful shutdown. Оптимизирует cluster performance.

Kubernetes Core Продвинутый

Проектирует K8s-инфраструктуру для reliability: StatefulSets для stateful workloads, DaemonSets для node-level monitoring, Jobs/CronJobs для maintenance. Настраивает service mesh (Istio/Linkerd).

Terraform Продвинутый

Проектирует IaC для platform: reusable модули, composition patterns, Terragrunt для DRY конфигурации. Автоматизирует infrastructure drift detection. Реализует blast radius reduction через workspace isolation.

Проектирует VPN-архитектуру: hub-and-spoke vs mesh, Transit Gateway VPN attachments, automated tunnel management. Оптимизирует throughput. Планирует migration на zero-trust (BeyondCorp).

DevOps и CI/CD · 3

ArgoCD Продвинутый

Проектирует архитектуру ArgoCD для высокодоступной доставки сервисов с мультикластерным failover и паттернами disaster recovery. Внедряет GitOps-управляемые практики надёжности, включая автоматизированный canary-анализ, гейты деплоя на основе SLO и интеграцию chaos engineering для валидации деплоев. Оптимизирует ArgoCD для продакшн-надёжности с HA контроллеров, webhook-управляемой reconciliation и пайплайнами алертинга дрифта.

GitHub Actions / GitLab CI Продвинутый

Проектирует CI/CD для platform: multi-stage deployments, canary/blue-green, rollback automation. Внедряет progressive delivery (Argo Rollouts, Flagger). Оптимизирует pipeline performance.

GitOps практики Продвинутый

Проектирует GitOps для reliability: настраивает progressive delivery с SLO-based analysis gates (canary + SLI check → promote/rollback), реализует automated rollback при SLO violation. Проектирует GitOps disaster recovery: быстрое восстановление cluster state из Git.

Тестирование и QA · 1

Chaos Engineering Продвинутый

Проектирует chaos программу linked с SRE practices: интегрирует chaos experiments в post-mortem follow-ups, создаёт continuous verification для critical paths. Реализует sophisticated experiments: clock skew, DNS failures, TLS certificate expiry, cascading failure scenarios.

Безопасность · 3

Проектирует infrastructure security: network segmentation, runtime protection (Falco), vulnerability management pipeline. Реализует security-as-code: policy enforcement, compliance scanning.

Secrets Management Продвинутый

Проектирует secrets management: Vault HA cluster (Raft), dynamic secrets для databases, PKI infrastructure. Автоматизирует certificate rotation. Реализует audit logging и compliance monitoring.

AI-ассистированная разработка · 1

GitHub Copilot Продвинутый

Максимизирует продуктивность: генерация сложных Terraform modules, K8s operators, monitoring dashboards-as-code. Workflow: AI для boilerplate, инженер для architecture и security review.

Архитектура и проектирование · 4

Основы System Design Продвинутый

Проектирует distributed systems: CAP theorem trade-offs, consensus protocols, eventual consistency patterns. Определяет data replication strategy. Проектирует cross-service communication (mesh, events).

Capacity Planning Продвинутый

Проектирует capacity management: predictive scaling, load testing для capacity validation, cost-aware autoscaling. Реализует automated right-sizing рекомендации. Моделирует growth scenarios.

Disaster Recovery Design Продвинутый

Проектирует DR-архитектуру: active-passive vs active-active, pilot light, warm standby. Реализует automated failover. Проводит chaos engineering для DR validation. Определяет RTO/RPO по tier-ам.

Highload архитектура Продвинутый

Проектирует high-load архитектуру: sharding strategies, CQRS для read-heavy workloads, queue-based decoupling. Оптимизирует: connection pooling, batch processing, async communication.

Observability и мониторинг · 11

Бизнес-метрики Продвинутый

Определяет metrics framework: standard instrumentation library, metric naming conventions, cardinality management. Реализует derived metrics через recording rules. Интегрирует с SLO tooling.

Проектирует logging-архитектуру: unified log format для всех сервисов, sampling strategy для high-volume, log-based metrics extraction. Интегрирует с OpenTelemetry logs API.

Оптимизирует on-call: alert tuning для снижения noise, automated remediation для типичных проблем. Проектирует runbook automation. Анализирует on-call metrics и формирует improvement plan.

APM-инструменты Продвинутый

Проектирует платформу наблюдаемости, интегрирующую APM, логирование и трассировку. Определяет SLI/SLO для критичных сервисов и автоматизирует отслеживание error budget. Ведёт процессы post-mortem и инициирует улучшения надёжности на основе данных APM.

Continuous Profiling Продвинутый

Проектирует observability стратегию с Continuous Profiling. Внедряет distributed tracing. Определяет SLI/SLO. Проводит post-mortems.

ELK Stack Продвинутый

Проектирует ELK-архитектуру: cluster sizing, ILM для retention management, cross-cluster search. Оптимизирует: index templates, mapping, ingest pipelines. Настраивает alerting через ElastAlert.

Grafana Loki Продвинутый

Проектирует организационную стратегию логирования с Loki в качестве централизованной лог-платформы. Определяет SLI/SLO на основе метрик из логов и автоматизирует алертинг по error budget. Ведёт post-mortem, используя корреляцию Loki с распределёнными трассировками и данными APM.

Jaeger / Grafana Tempo Продвинутый

Проектирует observability стратегию с Jaeger / Grafana Tempo. Внедряет distributed tracing. Определяет SLI/SLO. Проводит post-mortems.

OpenTelemetry Продвинутый

Проектирует OTel-архитектуру: collector fleet management, sampling strategies, tail-based sampling. Оптимизирует overhead и storage costs. Реализует custom processors для enrichment.

Prometheus и Grafana Продвинутый

Проектирует Prometheus-архитектуру: federation, Thanos/Mimir для long-term storage и global view. Оптимизирует cardinality, retention. Внедряет multi-cluster monitoring.

SLI / SLO / SLA Продвинутый

Проектирует SLO framework: multi-window burn rate alerting, SLO-based pages, error budget policies. Реализует automated SLO reporting. Интегрирует SLO с deployment decisions.

Контроль версий и коллаборация · 2

Code Review Продвинутый

Проводит архитектурный review: оценивает infrastructure design, blast radius, failure modes. Ревьюит capacity planning, security implications, cost impact изменений.

Git Advanced Продвинутый

Определяет Git-стратегию для infrastructure: trunk-based для configs, release branches для infrastructure versions. Настраивает branch protection, CODEOWNERS для critical infrastructure.

Performance Engineering · 1

Latency Optimization Продвинутый

Проектирует low-latency архитектуру: CDN placement, edge caching, connection pooling optimization, tail-latency management. Реализует latency budgets per service. Внедряет automated regression detection.

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Документирование APIИндексирование БДИнтеграционное тестированиеОптимизация запросовПаттерны проектированияПрактики безопасного кодаТипобезопасность и системы типовУправление памятьюChatGPT / ClaudeCursor IDEE2E тестированиеGraphQL DesignJWT / OAuth2 / OIDCPrompt Engineering для кодаUnit-тестирование

Что меняется на Lead

61 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.

Страница Lead →
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 61 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.