Определяет performance-стратегию платформы. Проектирует алгоритмы для систем мониторинга: downsampling time-series (LTTB), probabilistic data structures для cardinality estimation. Балансирует accuracy vs cost.
Роли · Site Reliability Engineer (SRE) · Principal
Что должен уметь Principal }
45 ключевых навыков, всего 61. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Principal }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Principal
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 6
Проектирует event-driven SRE-автоматизацию: async event processing для alert routing, webhook-based incident orchestration, streaming metrics processing. Определяет архитектуру real-time anomaly detection.
Определяет стратегию качества SRE-платформы: testing pyramid для infrastructure (unit → integration → e2e), chaos engineering, automated compliance checking. Устанавливает reliability engineering culture.
Проектирует high-concurrency SRE-системы: parallel fleet management, concurrent configuration rollouts, lock-free metrics aggregation pipelines. Определяет concurrency models для platform tooling.
Проектирует архитектуру SRE-платформы: plugin-система для monitoring backends, абстракции для incident management. Определяет где код оправдан vs declarative configs (Terraform, K8s manifests).
Проектирует data models для observability платформы: time-series storage schemes, log structured data, trace span trees. Определяет стратегию хранения метрик с учётом retention и query performance.
Backend Development · 3
Проектирует messaging-платформу для observability: Kafka для metrics/logs/traces pipeline, retention policies, multi-DC replication для DR. Определяет SLA для messaging infrastructure.
Проектирует SRE-platform API: self-service reliability tools, SLO management interface, incident orchestration. Определяет tech stack для SRE-платформы: Python для automation, Go для performance-critical.
Проектирует caching-инфраструктуру: Redis Sentinel/Cluster для HA, failure modes analysis, capacity planning. Определяет when Redis vs in-memory vs distributed cache для SRE tooling.
Базы данных · 1
Проектирует database reliability стратегию: PostgreSQL HA patterns (Patroni/Stolon), cross-region replication, RTO/RPO по tier-ам. Определяет DB platform standards для организации.
API и интеграции · 1
Проектирует SRE Platform API стратегию: unified API для infrastructure operations, GitOps integration, self-service portal. Определяет API governance для cross-team automation.
Облако и инфраструктура · 9
Проектирует traffic management стратегию: global server load balancing, multi-CDN, anycast. Определяет traffic engineering patterns для multi-region availability и disaster recovery.
Проектирует network-архитектуру: service mesh, zero-trust networking, global load balancing. Определяет network strategy для multi-region и multi-cloud deployment.
Проектирует cloud-стратегию организации: multi-cloud vs all-in-AWS, cloud native vs portable, cost optimization at scale. Определяет cloud governance и architectural patterns.
Проектирует container-стратегию: OCI standards, runtime selection (containerd vs CRI-O), rootless containers. Определяет container security framework и compliance requirements.
Проектирует package management стратегию: Helm vs Kustomize vs Carvel, chart governance, multi-cluster distribution. Определяет deployment standards для всей организации.
Проектирует Kubernetes-платформу: multi-cluster management (fleet), federation, cluster-as-a-service. Определяет K8s evolution strategy: version upgrades, feature adoption, vendor evaluation.
Проектирует Kubernetes strategy организации: managed vs self-hosted, multi-tenancy model, cost allocation. Определяет platform abstractions над K8s для product teams.
Проектирует IaC-стратегию организации: Terraform vs Pulumi vs Crossplane, self-service infrastructure, multi-cloud abstractions. Определяет governance для infrastructure changes.
Проектирует connectivity-стратегию: VPN vs Direct Connect vs SD-WAN, zero-trust network access. Определяет remote access architecture для организации.
DevOps и CI/CD · 2
Формирует стратегию надёжности деплоев корпоративного масштаба с ArgoCD как основой декларативной доставки инфраструктуры. Двигает архитектурные инновации в паттернах устойчивости на базе GitOps, включая мультирегиональные active-active деплои, автоматический откат при инцидентах и self-healing reconciliation инфраструктуры. Влияет на практики SRE-сообщества по внедрению GitOps и вносит вклад в стандарты инженерии надёжности проекта Argo.
Проектирует CI/CD-стратегию организации: unified deployment platform, GitOps adoption, progressive delivery framework. Определяет deployment governance и compliance requirements.
Тестирование и QA · 1
Формирует enterprise resilience strategy через chaos: проектирует organization-wide chaos framework, определяет compliance requirements для chaos testing (financial services, healthcare). Влияет на industry practices через публикации и выступления о chaos engineering ROI.
Безопасность · 3
Проектирует incident management платформу: automated triage, cross-team coordination, incident learning system. Определяет organizational incident culture и continuous improvement process.
Проектирует security-стратегию платформы: zero-trust architecture, supply chain security, platform security controls. Определяет security governance для cloud infrastructure.
Проектирует secrets management стратегию: multi-cluster Vault, cross-cloud secrets, zero-trust credential issuance. Определяет organizational secrets governance и compliance framework.
AI-ассистированная разработка · 1
Определяет AI-стратегию для SRE: AIOps для anomaly detection, AI-assisted incident response, LLM для log analysis. Формирует governance для AI в production operations.
Архитектура и проектирование · 4
Определяет архитектурную стратегию организации: reference architecture для reliable systems, platform abstractions, cross-team design patterns. Формирует reliability engineering culture.
Проектирует capacity management платформу: ML-based demand forecasting, automated provisioning, cost optimization at scale. Определяет organizational capacity governance.
Проектирует organizational DR стратегию: multi-region architecture, data sovereignty compliance, full-stack failover automation. Определяет business continuity framework.
Проектирует high-load платформу: global traffic distribution, multi-region data consistency, edge computing. Определяет scalability architecture patterns для организации.
Observability и мониторинг · 11
Проектирует метрический фреймворк организации: unified instrumentation SDK, metrics taxonomy, automated SLI generation. Определяет observability cost management strategy.
Проектирует observability logging стратегию: logs-traces-metrics correlation, cost-effective retention, ML-based anomaly detection on logs. Определяет organizational logging framework.
Проектирует on-call модель организации: follow-the-sun, tiered support, shared on-call между SRE и dev teams. Определяет on-call governance и toil elimination strategy.
Проектирует APM-платформу: unified APM для всех сервисов, custom dashboards, automated alerting. Определяет vendor selection criteria, negotiation strategy, multi-year roadmap.
Проектирует continuous profiling платформу: fleet-wide profiling, automated regression detection, cost/performance correlation. Определяет profiling strategy для production reliability.
Проектирует log management платформу: ELK vs Loki vs Datadog, multi-tenant architecture, compliance logging. Определяет organizational logging standards и cost optimization.
Проектирует log aggregation стратегию: Loki для Kubernetes-native logging, multi-tenant setup, long-term storage. Определяет когда Loki vs ELK vs managed (Datadog/Splunk).
Проектирует distributed tracing платформу: Tempo vs Jaeger vs managed, sampling strategy (head vs tail-based), traces-to-metrics conversion. Определяет tracing governance.
Проектирует OpenTelemetry платформу: vendor-neutral observability, multi-signal correlation, OTel Collector scalability. Определяет observability strategy и vendor evaluation.
Проектирует metrics-платформу организации: Prometheus/Mimir vs Datadog vs VictoriaMetrics, multi-tenant architecture, cost management. Определяет metrics governance.
Проектирует SLO-платформу: organizational SLO framework, automated SLO management, SLO-driven architecture decisions. Определяет reliability culture и error budget policy.
Контроль версий и коллаборация · 2
Определяет review-стандарты организации: architectural review board для infrastructure changes, cross-team review для shared platforms. Формирует engineering excellence.
Определяет version control стратегию организации: GitOps adoption framework, infrastructure versioning, cross-team collaboration model. Координирует infrastructure code standards.
Performance Engineering · 1
Проектирует latency optimization стратегию: global edge deployment, predictive caching, network optimization. Определяет organizational performance culture и latency governance.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
} в открытой матрице компетенций: 61 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.