Устанавливает performance-бюджеты для критических сервисов. Проводит review с фокусом на latency-чувствительные алгоритмы. Внедряет benchmarking и capacity testing в CI для обнаружения регрессий.
Роли · Site Reliability Engineer (SRE) · Lead
Что должен уметь Lead }
46 ключевых навыков, всего 61. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Lead }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Lead
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 6
Определяет стандарты async для SRE-tooling: asyncio для массового опроса endpoint-ов, concurrent health checks, parallel remediation scripts. Внедряет таймауты и circuit breakers в automation.
Формирует стандарты качества SRE-кода: linting для Terraform/HCL, policy testing (OPA), unit-тесты для automation scripts. Внедряет code review для infrastructure changes.
Определяет concurrency-стандарты для SRE-инструментов: thread pools для parallel deployments, lock-free metrics collection, concurrent log processing. Внедряет практики safe concurrency в automation scripts.
Определяет стандарты кода SRE-инструментария: модульные health checks, abstract provider interfaces для multi-cloud. Обучает команду паттернам для infrastructure automation (Strategy для разных облаков, Template для runbooks).
Определяет стандарты моделирования конфигов и состояний: structured configs (YAML/JSON schemas), typed metrics labels. Ревьюит data models для monitoring и alerting систем на предмет cardinality.
Backend Development · 3
Определяет Kafka-стратегию для observability: metrics streaming pipeline, log aggregation, event-driven incident management. Внедряет мониторинг Kafka infrastructure как критического компонента.
Определяет стандарты SRE-сервисов: FastAPI для automation API, internal dashboards, incident bot backends. Выбирает между Python и Go для SRE tooling по performance и maintainability.
Определяет caching-стратегию SRE-платформы: Redis для alert state management, distributed locking, session cache для internal tools. Устанавливает SLA и monitoring для Redis infrastructure.
Базы данных · 1
Определяет PostgreSQL-стандарты: HA-конфигурации, backup/recovery SLA, monitoring checklist. Проводит capacity planning и failure mode analysis. Планирует PostgreSQL upgrades с zero-downtime.
API и интеграции · 1
Определяет API-стандарты SRE-платформы: OpenAPI для internal tools, versioning strategy, rate limiting. Внедряет API-first approach для SRE automation.
Облако и инфраструктура · 9
Определяет LB-стандарты: health check requirements, failover procedures, capacity planning. Внедряет automated traffic management. Проводит load testing и failure mode analysis.
Определяет network-стандарты: security baselines, network segmentation policy, monitoring requirements. Внедряет network performance budgets и automated testing.
Определяет AWS-стратегию: Landing Zone, account structure, cost management. Внедряет Well-Architected Framework review. Координирует cloud operations между SRE и product teams.
Определяет container-стандарты организации: base image policy, vulnerability management SLA, runtime configuration guidelines. Внедряет container observability и security scanning в CI.
Определяет Helm-стандарты: chart structure, templating best practices, review process. Координирует chart development между SRE и product teams. Внедряет automated chart upgrades.
Определяет K8s-стандарты: cluster configuration baselines, security hardening, upgrade procedures. Внедряет policy engines (Kyverno/OPA Gatekeeper). Координирует cluster lifecycle management.
Определяет K8s core стандарты: namespace strategy, label/annotation conventions, resource limits guidelines. Внедряет admission webhooks для policy enforcement. Проводит capacity planning.
Определяет IaC-стандарты: module registry, review процесс, change management. Внедряет policy-as-code (Sentinel/OPA). Координирует Terraform adoption между командами.
Определяет VPN-стандарты: encryption requirements, tunnel monitoring SLA, access policies. Координирует VPN infrastructure между cloud и on-premise. Внедряет automated provisioning.
DevOps и CI/CD · 3
Определяет стандарты надёжности деплоев на базе ArgoCD для флота сервисов организации. Формирует governance для безопасности деплоев, включая политики прогрессивного раскатки, контроль радиуса поражения и процессы согласования деплоев, интегрированные с SLO. Проводит архитектурные ревью конфигураций ArgoCD с перспективы надёжности и продвигает внедрение паттернов GitOps-ремедиации инцидентов.
Определяет CI/CD-стандарты: deployment policies, approval workflows, rollback procedures. Внедряет deployment metrics (DORA). Координирует deployment practices между командами.
Определяет GitOps стратегию для SRE: стандартизирует deployment safety через GitOps gates (SLO check, chaos test, security scan), проектирует change management through Git. Создаёт GitOps runbook automation для common incident response actions.
Тестирование и QA · 1
Определяет chaos engineering стратегию для SRE-организации: создаёт chaos maturity assessment, проектирует automated resilience scoring per service. Внедряет chaos experiments как prerequisite для production readiness review и определяет escalation procedures.
Безопасность · 3
Определяет incident management стандарты: severity matrix, communication templates, post-mortem requirements. Внедряет incident metrics (MTTD, MTTR). Обучает команды incident response.
Определяет security-стандарты инфраструктуры: hardening baselines, vulnerability SLA, security monitoring requirements. Координирует с security-командой. Проводит threat modeling для infrastructure.
Определяет secrets management стандарты: Vault architecture, access policies, rotation schedule. Внедряет secret scanning в CI. Координирует secrets infrastructure между командами.
AI-ассистированная разработка · 1
Внедряет Copilot в SRE-команде: границы использования (configs да, security policies — review), best practices для infrastructure code generation. Оценивает ROI и security risks.
Архитектура и проектирование · 4
Определяет архитектурные стандарты reliability: mandatory design reviews, failure budget, architecture templates. Проводит architecture review с фокусом на failure modes и scalability.
Определяет capacity planning процесс: periodic reviews, headroom policy, growth budgets. Координирует capacity requests между командами. Внедряет automated capacity reporting.
Определяет DR-стандарты организации: tiered recovery model, mandatory DR-testing schedule, communication plan. Координирует cross-team DR drills. Внедряет DR metrics.
Определяет scalability-стандарты: performance budgets, mandatory load testing, architecture review для high-load. Координирует capacity planning. Формирует best practices для scaling.
Observability и мониторинг · 11
Определяет metrics-стандарты для SRE: mandatory SLI metrics, dashboard templates, alerting best practices. Внедряет metric catalogs и automated cardinality monitoring.
Определяет logging-стандарты организации: mandatory fields, format specification, privacy compliance. Внедряет automated log quality checks. Формирует logging best practices.
Определяет on-call стандарты: rotation policies, compensation, workload balance. Внедряет on-call metrics (interruptions, sleep impact). Формирует sustainable on-call culture.
Определяет APM-стратегию: Datadog vs New Relic vs open-source (OTel + backends), feature comparison, cost analysis. Внедряет APM для critical services. Определяет instrumentation requirements.
Определяет profiling-стандарты: always-on profiling (Pyroscope/Parca), CPU/memory flame graphs, production profiling safety. Внедряет profiling-driven optimization workflow.
Определяет ELK-стандарты: log format requirements, retention policies, access control. Внедряет cost management (hot/warm/cold nodes). Координирует централизованное логирование.
Определяет Loki-стандарты: label strategy (low cardinality), retention policies, query patterns. Внедряет Loki для cost-effective log aggregation. Сравнивает Loki vs ELK по сценариям.
Определяет tracing-стандарты: mandatory spans, sampling rates, retention policies. Внедряет Tempo/Jaeger для distributed tracing. Использует traces для dependency mapping и bottleneck analysis.
Определяет OTel-стандарты: collector configuration, resource attributes policy, instrumentation requirements per service. Внедряет observability-as-code подход.
Определяет metrics-стандарты: mandatory metrics per service, naming conventions, dashboard templates. Управляет Prometheus infrastructure costs. Координирует monitoring adoption.
Определяет SLO-стандарты организации: SLO requirements per tier, error budget governance, SLO review cadence. Обучает команды SRE-practices. Координирует SLO adoption.
Контроль версий и коллаборация · 2
Формирует review-культуру: определяет checklist для infra review (security, reliability, cost), SLA на review time. Автоматизирует checks (tfsec, conftest, kube-linter).
Формирует Git-workflow для SRE: GitOps standards, PR review requirements для infra changes, automated checks. Определяет mono vs multi-repo strategy для infrastructure.
Performance Engineering · 1
Определяет latency-стандарты: performance budgets per endpoint, mandatory profiling, latency regression policy. Внедряет SLO-based latency tracking и automated alerting.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Principal
0 навыков получают более высокое ожидание или становятся ключевыми при переходе с Lead на Principal. Сначала самые большие скачки.
} в открытой матрице компетенций: 61 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.