Роли · Site Reliability Engineer (SRE) · Lead

Что должен уметь Lead }

46 ключевых навыков, всего 61. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Lead }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.

46ключевых навыков
15дополнительных навыков
13областей
100%на уровне Продвинутый или Эксперт
Оценить себя как Lead Полная матрица роли

Ключевые навыки для Lead

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Основы программирования · 6

Устанавливает performance-бюджеты для критических сервисов. Проводит review с фокусом на latency-чувствительные алгоритмы. Внедряет benchmarking и capacity testing в CI для обнаружения регрессий.

Определяет стандарты async для SRE-tooling: asyncio для массового опроса endpoint-ов, concurrent health checks, parallel remediation scripts. Внедряет таймауты и circuit breakers в automation.

Формирует стандарты качества SRE-кода: linting для Terraform/HCL, policy testing (OPA), unit-тесты для automation scripts. Внедряет code review для infrastructure changes.

Определяет concurrency-стандарты для SRE-инструментов: thread pools для parallel deployments, lock-free metrics collection, concurrent log processing. Внедряет практики safe concurrency в automation scripts.

Определяет стандарты кода SRE-инструментария: модульные health checks, abstract provider interfaces для multi-cloud. Обучает команду паттернам для infrastructure automation (Strategy для разных облаков, Template для runbooks).

Определяет стандарты моделирования конфигов и состояний: structured configs (YAML/JSON schemas), typed metrics labels. Ревьюит data models для monitoring и alerting систем на предмет cardinality.

Backend Development · 3

Apache Kafka Эксперт

Определяет Kafka-стратегию для observability: metrics streaming pipeline, log aggregation, event-driven incident management. Внедряет мониторинг Kafka infrastructure как критического компонента.

Python Web Frameworks Эксперт

Определяет стандарты SRE-сервисов: FastAPI для automation API, internal dashboards, incident bot backends. Выбирает между Python и Go для SRE tooling по performance и maintainability.

Redis Эксперт

Определяет caching-стратегию SRE-платформы: Redis для alert state management, distributed locking, session cache для internal tools. Устанавливает SLA и monitoring для Redis infrastructure.

Базы данных · 1

PostgreSQL Эксперт

Определяет PostgreSQL-стандарты: HA-конфигурации, backup/recovery SLA, monitoring checklist. Проводит capacity planning и failure mode analysis. Планирует PostgreSQL upgrades с zero-downtime.

API и интеграции · 1

REST API Design Эксперт

Определяет API-стандарты SRE-платформы: OpenAPI для internal tools, versioning strategy, rate limiting. Внедряет API-first approach для SRE automation.

Облако и инфраструктура · 9

Определяет LB-стандарты: health check requirements, failover procedures, capacity planning. Внедряет automated traffic management. Проводит load testing и failure mode analysis.

Основы сетей Эксперт

Определяет network-стандарты: security baselines, network segmentation policy, monitoring requirements. Внедряет network performance budgets и automated testing.

AWS Эксперт

Определяет AWS-стратегию: Landing Zone, account structure, cost management. Внедряет Well-Architected Framework review. Координирует cloud operations между SRE и product teams.

Docker Эксперт

Определяет container-стандарты организации: base image policy, vulnerability management SLA, runtime configuration guidelines. Внедряет container observability и security scanning в CI.

Helm Эксперт

Определяет Helm-стандарты: chart structure, templating best practices, review process. Координирует chart development между SRE и product teams. Внедряет automated chart upgrades.

Kubernetes Advanced Эксперт

Определяет K8s-стандарты: cluster configuration baselines, security hardening, upgrade procedures. Внедряет policy engines (Kyverno/OPA Gatekeeper). Координирует cluster lifecycle management.

Kubernetes Core Эксперт

Определяет K8s core стандарты: namespace strategy, label/annotation conventions, resource limits guidelines. Внедряет admission webhooks для policy enforcement. Проводит capacity planning.

Terraform Эксперт

Определяет IaC-стандарты: module registry, review процесс, change management. Внедряет policy-as-code (Sentinel/OPA). Координирует Terraform adoption между командами.

Определяет VPN-стандарты: encryption requirements, tunnel monitoring SLA, access policies. Координирует VPN infrastructure между cloud и on-premise. Внедряет automated provisioning.

DevOps и CI/CD · 3

ArgoCD Эксперт

Определяет стандарты надёжности деплоев на базе ArgoCD для флота сервисов организации. Формирует governance для безопасности деплоев, включая политики прогрессивного раскатки, контроль радиуса поражения и процессы согласования деплоев, интегрированные с SLO. Проводит архитектурные ревью конфигураций ArgoCD с перспективы надёжности и продвигает внедрение паттернов GitOps-ремедиации инцидентов.

Определяет CI/CD-стандарты: deployment policies, approval workflows, rollback procedures. Внедряет deployment metrics (DORA). Координирует deployment practices между командами.

GitOps практики Эксперт

Определяет GitOps стратегию для SRE: стандартизирует deployment safety через GitOps gates (SLO check, chaos test, security scan), проектирует change management through Git. Создаёт GitOps runbook automation для common incident response actions.

Тестирование и QA · 1

Chaos Engineering Эксперт

Определяет chaos engineering стратегию для SRE-организации: создаёт chaos maturity assessment, проектирует automated resilience scoring per service. Внедряет chaos experiments как prerequisite для production readiness review и определяет escalation procedures.

Безопасность · 3

Определяет security-стандарты инфраструктуры: hardening baselines, vulnerability SLA, security monitoring requirements. Координирует с security-командой. Проводит threat modeling для infrastructure.

Secrets Management Эксперт

Определяет secrets management стандарты: Vault architecture, access policies, rotation schedule. Внедряет secret scanning в CI. Координирует secrets infrastructure между командами.

AI-ассистированная разработка · 1

GitHub Copilot Эксперт

Внедряет Copilot в SRE-команде: границы использования (configs да, security policies — review), best practices для infrastructure code generation. Оценивает ROI и security risks.

Архитектура и проектирование · 4

Определяет архитектурные стандарты reliability: mandatory design reviews, failure budget, architecture templates. Проводит architecture review с фокусом на failure modes и scalability.

Capacity Planning Эксперт

Определяет capacity planning процесс: periodic reviews, headroom policy, growth budgets. Координирует capacity requests между командами. Внедряет automated capacity reporting.

Disaster Recovery Design Эксперт

Определяет DR-стандарты организации: tiered recovery model, mandatory DR-testing schedule, communication plan. Координирует cross-team DR drills. Внедряет DR metrics.

Определяет scalability-стандарты: performance budgets, mandatory load testing, architecture review для high-load. Координирует capacity planning. Формирует best practices для scaling.

Observability и мониторинг · 11

Определяет metrics-стандарты для SRE: mandatory SLI metrics, dashboard templates, alerting best practices. Внедряет metric catalogs и automated cardinality monitoring.

Определяет logging-стандарты организации: mandatory fields, format specification, privacy compliance. Внедряет automated log quality checks. Формирует logging best practices.

Определяет on-call стандарты: rotation policies, compensation, workload balance. Внедряет on-call metrics (interruptions, sleep impact). Формирует sustainable on-call culture.

Определяет APM-стратегию: Datadog vs New Relic vs open-source (OTel + backends), feature comparison, cost analysis. Внедряет APM для critical services. Определяет instrumentation requirements.

Continuous Profiling Эксперт

Определяет profiling-стандарты: always-on profiling (Pyroscope/Parca), CPU/memory flame graphs, production profiling safety. Внедряет profiling-driven optimization workflow.

ELK Stack Эксперт

Определяет ELK-стандарты: log format requirements, retention policies, access control. Внедряет cost management (hot/warm/cold nodes). Координирует централизованное логирование.

Grafana Loki Эксперт

Определяет Loki-стандарты: label strategy (low cardinality), retention policies, query patterns. Внедряет Loki для cost-effective log aggregation. Сравнивает Loki vs ELK по сценариям.

Jaeger / Grafana Tempo Эксперт

Определяет tracing-стандарты: mandatory spans, sampling rates, retention policies. Внедряет Tempo/Jaeger для distributed tracing. Использует traces для dependency mapping и bottleneck analysis.

OpenTelemetry Эксперт

Определяет OTel-стандарты: collector configuration, resource attributes policy, instrumentation requirements per service. Внедряет observability-as-code подход.

Prometheus и Grafana Эксперт

Определяет metrics-стандарты: mandatory metrics per service, naming conventions, dashboard templates. Управляет Prometheus infrastructure costs. Координирует monitoring adoption.

SLI / SLO / SLA Эксперт

Определяет SLO-стандарты организации: SLO requirements per tier, error budget governance, SLO review cadence. Обучает команды SRE-practices. Координирует SLO adoption.

Контроль версий и коллаборация · 2

Code Review Эксперт

Формирует review-культуру: определяет checklist для infra review (security, reliability, cost), SLA на review time. Автоматизирует checks (tfsec, conftest, kube-linter).

Git Advanced Эксперт

Формирует Git-workflow для SRE: GitOps standards, PR review requirements для infra changes, automated checks. Определяет mono vs multi-repo strategy для infrastructure.

Performance Engineering · 1

Latency Optimization Эксперт

Определяет latency-стандарты: performance budgets per endpoint, mandatory profiling, latency regression policy. Внедряет SLO-based latency tracking и automated alerting.

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Документирование APIИндексирование БДИнтеграционное тестированиеОптимизация запросовПаттерны проектированияПрактики безопасного кодаТипобезопасность и системы типовУправление памятьюChatGPT / ClaudeCursor IDEE2E тестированиеGraphQL DesignJWT / OAuth2 / OIDCPrompt Engineering для кодаUnit-тестирование

Что меняется на Principal

0 навыков получают более высокое ожидание или становятся ключевыми при переходе с Lead на Principal. Сначала самые большие скачки.

Страница Principal →
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 61 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.