Применяет алгоритмическое мышление к SRE: алгоритмы обнаружения аномалий для проактивного предотвращения инцидентов, алгоритмы load shedding для graceful degradation, алгоритмы предсказания ёмкости на основе исторических трендов. Проектирует эффективные алгоритмы алертинга, минимизирующие шум при сохранении чувствительности детекции.
Роли · Site Reliability Engineer (SRE) · Senior
Что должен уметь Senior }
46 ключевых навыков, всего 61. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 6
Проектирует async-архитектуры для SRE-систем: конкурентный мониторинг в масштабе, async-оркестрация реагирования на инциденты, неблокирующая корреляция и маршрутизация алертов. Менторит команду по async-паттернам для надёжности операционных систем.
Проектирует стандарты качества кода для SRE-инструментария: структура автоматизации runbook, код пайплайнов observability, скрипты chaos engineering. Рефакторит автоматизацию управления инцидентами для надёжности и аудируемости. Устанавливает практики ревью для операционного кода: error budgets, мониторинг SLO, инструменты дежурств.
Обладает глубокой экспертизой в диагностике проблем многопоточности: анализирует contention потоков и deadlock в продакшен-системах в масштабе, внедряет мониторинг индикаторов здоровья конкурентных систем, оптимизирует конфигурации потоков по флотам сервисов. Менторит команду по отладке продакшен конкурентных систем и тюнингу производительности.
Применяет ООП/SOLID в архитектуре SRE-инструментов: абстрактные интерфейсы для бэкендов мониторинга, strategy pattern для маршрутизации алертов, template method для стандартизированной автоматизации runbook. Проектирует расширяемые фреймворки observability с чистым разделением между слоями сбора данных, обработки и алертинга.
Выбирает оптимальные структуры данных для SRE-инструментов: базы данных временных рядов для хранения метрик, структуры данных с эффективной кардинальностью для многомерного мониторинга, кольцевые буферы для окон последних событий. Оптимизирует структуры данных оценки алертов для минимальной задержки обработки правил. Проектирует эффективные модели данных для реконструкции таймлайна инцидентов и post-mortem анализа.
Backend Development · 3
Использует Kafka для SRE-задач: streaming metrics processing, alert aggregation, audit log collection. Настраивает consumer groups для distributed alert processing. Мониторит Kafka cluster health.
Разрабатывает SRE-сервисы на Flask/FastAPI: status pages, runbook automation API, custom webhook receivers для alerting integration. Реализует health-check endpoints для internal tooling.
Использует Redis для SRE-инструментов: rate limiting для alert deduplication, distributed locks для deployments, caching для status page. Мониторит Redis performance и memory usage.
Базы данных · 1
Проектирует PostgreSQL reliability: streaming replication setup, automated failover (Patroni), point-in-time recovery. Оптимизирует для operational workloads: vacuum tuning, index maintenance, connection pooling.
API и интеграции · 1
Проектирует API для SRE-платформы: self-service infrastructure provisioning, SLO management API, incident orchestration. Реализует idempotency для critical operations (rollback, scaling).
Облако и инфраструктура · 9
Проектирует load balancing архитектуру: global load balancing (Route53, Cloudflare), internal LB для microservices, gRPC balancing. Оптимизирует connection draining, session affinity, retry policies.
Проектирует network reliability: multi-AZ networking, failover strategies, BGP для multi-homing. Оптимизирует network performance: connection pooling, keep-alive tuning, TCP optimization.
Проектирует AWS-платформу для reliability: multi-AZ architecture, cross-region DR, AWS Organizations для multi-account. Настраивает GuardDuty, Config Rules для security. Автоматизирует через AWS CDK/Lambda.
Проектирует container runtime standards: image security pipeline, registry management, runtime security (seccomp, AppArmor). Оптимизирует container performance: cgroup limits, OOM handling, filesystem layers.
Проектирует Helm-стратегию: library charts для shared components, umbrella charts для full stack deployment. Автоматизирует chart testing (helm unittest, ct lint). Внедряет GitOps workflow для Helm releases.
Проектирует Kubernetes reliability: pod disruption budgets, topology spread constraints, custom operators для automation. Настраивает multi-zone deployment, graceful shutdown. Оптимизирует cluster performance.
Проектирует K8s-инфраструктуру для reliability: StatefulSets для stateful workloads, DaemonSets для node-level monitoring, Jobs/CronJobs для maintenance. Настраивает service mesh (Istio/Linkerd).
Проектирует IaC для platform: reusable модули, composition patterns, Terragrunt для DRY конфигурации. Автоматизирует infrastructure drift detection. Реализует blast radius reduction через workspace isolation.
Проектирует VPN-архитектуру: hub-and-spoke vs mesh, Transit Gateway VPN attachments, automated tunnel management. Оптимизирует throughput. Планирует migration на zero-trust (BeyondCorp).
DevOps и CI/CD · 3
Проектирует архитектуру ArgoCD для высокодоступной доставки сервисов с мультикластерным failover и паттернами disaster recovery. Внедряет GitOps-управляемые практики надёжности, включая автоматизированный canary-анализ, гейты деплоя на основе SLO и интеграцию chaos engineering для валидации деплоев. Оптимизирует ArgoCD для продакшн-надёжности с HA контроллеров, webhook-управляемой reconciliation и пайплайнами алертинга дрифта.
Проектирует CI/CD для platform: multi-stage deployments, canary/blue-green, rollback automation. Внедряет progressive delivery (Argo Rollouts, Flagger). Оптимизирует pipeline performance.
Проектирует GitOps для reliability: настраивает progressive delivery с SLO-based analysis gates (canary + SLI check → promote/rollback), реализует automated rollback при SLO violation. Проектирует GitOps disaster recovery: быстрое восстановление cluster state из Git.
Тестирование и QA · 1
Проектирует chaos программу linked с SRE practices: интегрирует chaos experiments в post-mortem follow-ups, создаёт continuous verification для critical paths. Реализует sophisticated experiments: clock skew, DNS failures, TLS certificate expiry, cascading failure scenarios.
Безопасность · 3
Проектирует incident response процесс: automated severity detection, runbook automation, war room orchestration. Реализует SLO-based alerting для proactive incident detection.
Проектирует infrastructure security: network segmentation, runtime protection (Falco), vulnerability management pipeline. Реализует security-as-code: policy enforcement, compliance scanning.
Проектирует secrets management: Vault HA cluster (Raft), dynamic secrets для databases, PKI infrastructure. Автоматизирует certificate rotation. Реализует audit logging и compliance monitoring.
AI-ассистированная разработка · 1
Максимизирует продуктивность: генерация сложных Terraform modules, K8s operators, monitoring dashboards-as-code. Workflow: AI для boilerplate, инженер для architecture и security review.
Архитектура и проектирование · 4
Проектирует distributed systems: CAP theorem trade-offs, consensus protocols, eventual consistency patterns. Определяет data replication strategy. Проектирует cross-service communication (mesh, events).
Проектирует capacity management: predictive scaling, load testing для capacity validation, cost-aware autoscaling. Реализует automated right-sizing рекомендации. Моделирует growth scenarios.
Проектирует DR-архитектуру: active-passive vs active-active, pilot light, warm standby. Реализует automated failover. Проводит chaos engineering для DR validation. Определяет RTO/RPO по tier-ам.
Проектирует high-load архитектуру: sharding strategies, CQRS для read-heavy workloads, queue-based decoupling. Оптимизирует: connection pooling, batch processing, async communication.
Observability и мониторинг · 11
Определяет metrics framework: standard instrumentation library, metric naming conventions, cardinality management. Реализует derived metrics через recording rules. Интегрирует с SLO tooling.
Проектирует logging-архитектуру: unified log format для всех сервисов, sampling strategy для high-volume, log-based metrics extraction. Интегрирует с OpenTelemetry logs API.
Оптимизирует on-call: alert tuning для снижения noise, automated remediation для типичных проблем. Проектирует runbook automation. Анализирует on-call metrics и формирует improvement plan.
Проектирует платформу наблюдаемости, интегрирующую APM, логирование и трассировку. Определяет SLI/SLO для критичных сервисов и автоматизирует отслеживание error budget. Ведёт процессы post-mortem и инициирует улучшения надёжности на основе данных APM.
Проектирует observability стратегию с Continuous Profiling. Внедряет distributed tracing. Определяет SLI/SLO. Проводит post-mortems.
Проектирует ELK-архитектуру: cluster sizing, ILM для retention management, cross-cluster search. Оптимизирует: index templates, mapping, ingest pipelines. Настраивает alerting через ElastAlert.
Проектирует организационную стратегию логирования с Loki в качестве централизованной лог-платформы. Определяет SLI/SLO на основе метрик из логов и автоматизирует алертинг по error budget. Ведёт post-mortem, используя корреляцию Loki с распределёнными трассировками и данными APM.
Проектирует observability стратегию с Jaeger / Grafana Tempo. Внедряет distributed tracing. Определяет SLI/SLO. Проводит post-mortems.
Проектирует OTel-архитектуру: collector fleet management, sampling strategies, tail-based sampling. Оптимизирует overhead и storage costs. Реализует custom processors для enrichment.
Проектирует Prometheus-архитектуру: federation, Thanos/Mimir для long-term storage и global view. Оптимизирует cardinality, retention. Внедряет multi-cluster monitoring.
Проектирует SLO framework: multi-window burn rate alerting, SLO-based pages, error budget policies. Реализует automated SLO reporting. Интегрирует SLO с deployment decisions.
Контроль версий и коллаборация · 2
Проводит архитектурный review: оценивает infrastructure design, blast radius, failure modes. Ревьюит capacity planning, security implications, cost impact изменений.
Определяет Git-стратегию для infrastructure: trunk-based для configs, release branches для infrastructure versions. Настраивает branch protection, CODEOWNERS для critical infrastructure.
Performance Engineering · 1
Проектирует low-latency архитектуру: CDN placement, edge caching, connection pooling optimization, tail-latency management. Реализует latency budgets per service. Внедряет automated regression detection.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
61 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Алгоритмы и сложность: Продвинутый → Эксперт
- Асинхронное программирование: Продвинутый → Эксперт
- Балансировка нагрузки: Продвинутый → Эксперт
- Бизнес-метрики: Продвинутый → Эксперт
- Качество кода и рефакторинг: Продвинутый → Эксперт
- Многопоточное программирование: Продвинутый → Эксперт
- Основы сетей: Продвинутый → Эксперт
- Основы System Design: Продвинутый → Эксперт
- Принципы ООП и SOLID: Продвинутый → Эксперт
- Процесс реагирования на инциденты: Продвинутый → Эксперт
} в открытой матрице компетенций: 61 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.