Роли · Site Reliability Engineer (SRE) · Principal

Что должен уметь Principal }

45 ключевых навыков, всего 61. Ожидания по каждому навыку и что меняется на следующем уровне.

На этой странице — что ожидается от Principal }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.

45ключевых навыков
16дополнительных навыков
13областей
100%на уровне Продвинутый или Эксперт
Оценить себя как Principal Полная матрица роли

Ключевые навыки для Principal

Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.

Основы программирования · 6

Определяет performance-стратегию платформы. Проектирует алгоритмы для систем мониторинга: downsampling time-series (LTTB), probabilistic data structures для cardinality estimation. Балансирует accuracy vs cost.

Проектирует event-driven SRE-автоматизацию: async event processing для alert routing, webhook-based incident orchestration, streaming metrics processing. Определяет архитектуру real-time anomaly detection.

Определяет стратегию качества SRE-платформы: testing pyramid для infrastructure (unit → integration → e2e), chaos engineering, automated compliance checking. Устанавливает reliability engineering culture.

Проектирует high-concurrency SRE-системы: parallel fleet management, concurrent configuration rollouts, lock-free metrics aggregation pipelines. Определяет concurrency models для platform tooling.

Проектирует архитектуру SRE-платформы: plugin-система для monitoring backends, абстракции для incident management. Определяет где код оправдан vs declarative configs (Terraform, K8s manifests).

Проектирует data models для observability платформы: time-series storage schemes, log structured data, trace span trees. Определяет стратегию хранения метрик с учётом retention и query performance.

Backend Development · 3

Apache Kafka Эксперт

Проектирует messaging-платформу для observability: Kafka для metrics/logs/traces pipeline, retention policies, multi-DC replication для DR. Определяет SLA для messaging infrastructure.

Python Web Frameworks Эксперт

Проектирует SRE-platform API: self-service reliability tools, SLO management interface, incident orchestration. Определяет tech stack для SRE-платформы: Python для automation, Go для performance-critical.

Redis Эксперт

Проектирует caching-инфраструктуру: Redis Sentinel/Cluster для HA, failure modes analysis, capacity planning. Определяет when Redis vs in-memory vs distributed cache для SRE tooling.

Базы данных · 1

PostgreSQL Эксперт

Проектирует database reliability стратегию: PostgreSQL HA patterns (Patroni/Stolon), cross-region replication, RTO/RPO по tier-ам. Определяет DB platform standards для организации.

API и интеграции · 1

REST API Design Эксперт

Проектирует SRE Platform API стратегию: unified API для infrastructure operations, GitOps integration, self-service portal. Определяет API governance для cross-team automation.

Облако и инфраструктура · 9

Проектирует traffic management стратегию: global server load balancing, multi-CDN, anycast. Определяет traffic engineering patterns для multi-region availability и disaster recovery.

Основы сетей Эксперт

Проектирует network-архитектуру: service mesh, zero-trust networking, global load balancing. Определяет network strategy для multi-region и multi-cloud deployment.

AWS Эксперт

Проектирует cloud-стратегию организации: multi-cloud vs all-in-AWS, cloud native vs portable, cost optimization at scale. Определяет cloud governance и architectural patterns.

Docker Эксперт

Проектирует container-стратегию: OCI standards, runtime selection (containerd vs CRI-O), rootless containers. Определяет container security framework и compliance requirements.

Helm Эксперт

Проектирует package management стратегию: Helm vs Kustomize vs Carvel, chart governance, multi-cluster distribution. Определяет deployment standards для всей организации.

Kubernetes Advanced Эксперт

Проектирует Kubernetes-платформу: multi-cluster management (fleet), federation, cluster-as-a-service. Определяет K8s evolution strategy: version upgrades, feature adoption, vendor evaluation.

Kubernetes Core Эксперт

Проектирует Kubernetes strategy организации: managed vs self-hosted, multi-tenancy model, cost allocation. Определяет platform abstractions над K8s для product teams.

Terraform Эксперт

Проектирует IaC-стратегию организации: Terraform vs Pulumi vs Crossplane, self-service infrastructure, multi-cloud abstractions. Определяет governance для infrastructure changes.

Проектирует connectivity-стратегию: VPN vs Direct Connect vs SD-WAN, zero-trust network access. Определяет remote access architecture для организации.

DevOps и CI/CD · 2

ArgoCD Эксперт

Формирует стратегию надёжности деплоев корпоративного масштаба с ArgoCD как основой декларативной доставки инфраструктуры. Двигает архитектурные инновации в паттернах устойчивости на базе GitOps, включая мультирегиональные active-active деплои, автоматический откат при инцидентах и self-healing reconciliation инфраструктуры. Влияет на практики SRE-сообщества по внедрению GitOps и вносит вклад в стандарты инженерии надёжности проекта Argo.

Проектирует CI/CD-стратегию организации: unified deployment platform, GitOps adoption, progressive delivery framework. Определяет deployment governance и compliance requirements.

Тестирование и QA · 1

Chaos Engineering Эксперт

Формирует enterprise resilience strategy через chaos: проектирует organization-wide chaos framework, определяет compliance requirements для chaos testing (financial services, healthcare). Влияет на industry practices через публикации и выступления о chaos engineering ROI.

Безопасность · 3

Проектирует security-стратегию платформы: zero-trust architecture, supply chain security, platform security controls. Определяет security governance для cloud infrastructure.

Secrets Management Эксперт

Проектирует secrets management стратегию: multi-cluster Vault, cross-cloud secrets, zero-trust credential issuance. Определяет organizational secrets governance и compliance framework.

AI-ассистированная разработка · 1

GitHub Copilot Эксперт

Определяет AI-стратегию для SRE: AIOps для anomaly detection, AI-assisted incident response, LLM для log analysis. Формирует governance для AI в production operations.

Архитектура и проектирование · 4

Определяет архитектурную стратегию организации: reference architecture для reliable systems, platform abstractions, cross-team design patterns. Формирует reliability engineering culture.

Capacity Planning Эксперт

Проектирует capacity management платформу: ML-based demand forecasting, automated provisioning, cost optimization at scale. Определяет organizational capacity governance.

Disaster Recovery Design Эксперт

Проектирует organizational DR стратегию: multi-region architecture, data sovereignty compliance, full-stack failover automation. Определяет business continuity framework.

Проектирует high-load платформу: global traffic distribution, multi-region data consistency, edge computing. Определяет scalability architecture patterns для организации.

Observability и мониторинг · 11

Проектирует метрический фреймворк организации: unified instrumentation SDK, metrics taxonomy, automated SLI generation. Определяет observability cost management strategy.

Проектирует observability logging стратегию: logs-traces-metrics correlation, cost-effective retention, ML-based anomaly detection on logs. Определяет organizational logging framework.

Проектирует on-call модель организации: follow-the-sun, tiered support, shared on-call между SRE и dev teams. Определяет on-call governance и toil elimination strategy.

Проектирует APM-платформу: unified APM для всех сервисов, custom dashboards, automated alerting. Определяет vendor selection criteria, negotiation strategy, multi-year roadmap.

Continuous Profiling Эксперт

Проектирует continuous profiling платформу: fleet-wide profiling, automated regression detection, cost/performance correlation. Определяет profiling strategy для production reliability.

ELK Stack Эксперт

Проектирует log management платформу: ELK vs Loki vs Datadog, multi-tenant architecture, compliance logging. Определяет organizational logging standards и cost optimization.

Grafana Loki Эксперт

Проектирует log aggregation стратегию: Loki для Kubernetes-native logging, multi-tenant setup, long-term storage. Определяет когда Loki vs ELK vs managed (Datadog/Splunk).

Jaeger / Grafana Tempo Эксперт

Проектирует distributed tracing платформу: Tempo vs Jaeger vs managed, sampling strategy (head vs tail-based), traces-to-metrics conversion. Определяет tracing governance.

OpenTelemetry Эксперт

Проектирует OpenTelemetry платформу: vendor-neutral observability, multi-signal correlation, OTel Collector scalability. Определяет observability strategy и vendor evaluation.

Prometheus и Grafana Эксперт

Проектирует metrics-платформу организации: Prometheus/Mimir vs Datadog vs VictoriaMetrics, multi-tenant architecture, cost management. Определяет metrics governance.

SLI / SLO / SLA Эксперт

Проектирует SLO-платформу: organizational SLO framework, automated SLO management, SLO-driven architecture decisions. Определяет reliability culture и error budget policy.

Контроль версий и коллаборация · 2

Code Review Эксперт

Определяет review-стандарты организации: architectural review board для infrastructure changes, cross-team review для shared platforms. Формирует engineering excellence.

Git Advanced Эксперт

Определяет version control стратегию организации: GitOps adoption framework, infrastructure versioning, cross-team collaboration model. Координирует infrastructure code standards.

Performance Engineering · 1

Latency Optimization Эксперт

Проектирует latency optimization стратегию: global edge deployment, predictive caching, network optimization. Определяет organizational performance culture и latency governance.

Дополнительные навыки

Команда их не оценивает, но они входят в самооценку и план развития.

Документирование APIИндексирование БДИнтеграционное тестированиеОптимизация запросовПаттерны проектированияПрактики безопасного кодаТипобезопасность и системы типовУправление памятьюChatGPT / ClaudeCursor IDEE2E тестированиеGitOps практикиGraphQL DesignJWT / OAuth2 / OIDCPrompt Engineering для кодаUnit-тестирование
Прогоните это со всей командой
Самооценка плюс оценка руководителя и коллег по одной матрице, зоны роста и готовность к следующему уровню для каждого инженера. Team Pro бесплатно 14 дней; личные инструменты бесплатны всегда.
Попробовать с командой (14 дней бесплатно) Отправить тимлиду

} в открытой матрице компетенций: 61 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.