Эти навыки не влияют на основной грейд, но покажут полноту вашего профиля.
3D-графика и вычисления
▼
Знает основы GPU-вычислений: CUDA cores, memory hierarchy, kernel execution. Понимает как PyTorch использует GPU для tensor operations и запускает простые LLM inference на GPU.
Самостоятельно оптимизирует GPU utilization для LLM: mixed precision (FP16/BF16), memory management, CUDA stream optimization. Профилирует GPU-нагрузку через nvidia-smi и PyTorch profiler.
Проектирует custom CUDA kernels для оптимизации LLM inference: fused attention, quantized matmul, custom activation functions. Применяет Triton для написания высокопроизводительных GPU-операций.
Определяет GPU programming стандарты для LLM-команды. Формирует best practices по CUDA optimization, memory management, multi-GPU coordination. Проводит review GPU-intensive кода.
AI-ассистенты кодирования
▼
Использует Cursor для LLM development: AI-assisted prompt engineering, code generation.
Настраивает Cursor: custom rules для LLM patterns, RAG code generation, evaluation helpers.
Оптимизирует Cursor: LLM-specific workflows, prompt optimization, architecture suggestions.
Определяет AI IDE стандарты: approved configs, security policies.
Знает основы GitHub Copilot: автодополнение кода, генерация функций по комментариям. Использует Copilot для ускорения написания boilerplate кода в ML-проектах и LLM-скриптах.
Эффективно использует Copilot Chat и inline suggestions для ML-задач: генерация data preprocessing, prompt templates, API-интеграции. Понимает ограничения Copilot для специализированного ML-кода.
Применяет Copilot для ускорения разработки LLM-систем: генерация training скриптов, inference pipeline, evaluation harness. Настраивает custom instructions для ML-контекста и review AI-предложений.
Определяет стратегию использования AI-assistants в LLM-команде. Формирует guidelines по эффективному prompt engineering для Copilot, обучает команду best practices и review AI-кода.
Batch-обработка данных
▼
Понимает основы Pandas для подготовки данных LLM: загрузка и предобработка текстовых датасетов, анализ статистик тренировочного корпуса и управление парами prompt/completion. Очищает и форматирует текстовые данные для датасетов файн-тюнинга. Следует командным практикам версионирования данных и проверок качества.
Реализует пайплайны обработки данных LLM с Pandas/Polars: очистка и дедупликация текстового корпуса в масштабе, вычисление метрик качества тренировочных данных и управление датасетами оценки. Использует Polars для высокопроизводительной предобработки текста на больших корпусах. Создаёт воспроизводимые воркфлоу подготовки данных для файн-тюнинга и оценки.
Проектирует архитектуру данных LLM с Pandas/Polars: инфраструктура пайплайнов тренировочных данных, управление бенчмарками оценки и версионирование датасетов для воспроизводимости моделей. Реализует фреймворки качества данных для детекции контаминации, bias и distribution shift. Создаёт организационные стандарты подготовки данных для файн-тюнинга LLM. Менторит команду по масштабируемой обработке текста.
Определяет data engineering стратегию. Формирует data platform. Координирует data teams. Оптимизирует data mesh/data fabric подходы.
CI/CD
▼
Использует GitHub Actions для LLM: automated evaluation runs, prompt testing. Понимает CI для ML.
Проектирует CI для LLM: automated benchmarks, regression testing, model deployment pipelines.
Определяет CI/CD architecture: model evaluation pipelines, A/B deployment, safety testing.
Определяет CI/CD стандарты: mandatory evaluation, safety gates, deployment governance.
Code Review
▼
Участвует в code review ML-кода как reviewer: проверяет читаемость, именование переменных, базовую корректность. Учится находить типичные ошибки в скриптах обработки данных для LLM.
Самостоятельно проводит code review LLM-pipeline: проверяет корректность tokenization, embedding-логики, prompt templates. Выявляет утечки данных между train/test и проблемы воспроизводимости.
Проводит глубокий review архитектуры LLM-систем: inference pipeline, RAG-компоненты, fine-tuning скрипты. Проверяет корректность distributed training, gradient accumulation, mixed precision.
Определяет стандарты code review для LLM-команды. Формирует чеклисты для review ML-кода, обучает инженеров специфике review LLM-проектов и распространённым антипаттернам.
Deep Learning
▼
Знает основы deep learning: backpropagation, loss functions, optimizers (SGD, Adam). Понимает архитектуру нейронных сетей и обучает простые модели на PyTorch под руководством наставника.
Самостоятельно обучает и fine-tuneит модели на PyTorch: настраивает learning rate schedules, регуляризацию, data augmentation. Понимает gradient flow в transformer-архитектурах.
Проектирует custom training loops для LLM: mixed precision, gradient accumulation, distributed training. Диагностирует проблемы обучения: gradient vanishing/exploding, loss spikes, training instability.
Определяет deep learning best practices для LLM-команды. Формирует стандарты обучения моделей, проводит review training конфигураций, внедряет системы мониторинга training runs.
Понимает тензорные операции и autograd PyTorch для трансформерных моделей. Использует HuggingFace Transformers с бэкендом PyTorch для инференса. Загружает предобученные LLM, выполняет токенизацию и генерацию текста. Понимает основы механизма внимания в PyTorch.
Дообучает трансформеры с PyTorch используя PEFT: LoRA, QLoRA, prefix tuning. Реализует кастомные циклы обучения для causal LM и seq2seq задач. Работает с токенизаторами, масками внимания и стратегиями паддинга. Интегрирует HuggingFace Trainer с DeepSpeed для эффективного дообучения.
Архитектурирует инфраструктуру обучения LLM в PyTorch. Реализует кастомные механизмы внимания, позиционные кодировки и model parallelism. Оптимизирует память с gradient checkpointing, mixed precision и Flash Attention. Проектирует фреймворки оценки качества LM. Менторит команду по трансформерам.
Определяет стандарты обучения LLM на PyTorch: выбор PEFT-стратегий, конфигурации распределённого обучения, бенчмарки оценки. Оценивает инструменты (vLLM, TensorRT-LLM) для продакшн-инференса. Ревьюит архитектуры дообучения. Устанавливает best practices для воспроизводимых LLM-экспериментов.
Знает основы PyTorch: tensors, autograd, nn.Module, DataLoader. Использует PyTorch для обучения простых моделей и inference pre-trained LLM через Hugging Face Transformers.
Самостоятельно разрабатывает на PyTorch для LLM: custom datasets, training loops, mixed precision (torch.amp). Использует Hugging Face Accelerate для multi-GPU training и inference.
Проектирует advanced PyTorch компоненты для LLM: custom attention layers, efficient inference через torch.compile, CUDA graphs. Оптимизирует training и inference performance на уровне framework.
Определяет PyTorch best practices для LLM-команды. Формирует guidelines по использованию framework, custom extensions, performance optimization. Проводит review PyTorch-кода.
Знает основы transfer learning: pre-training, fine-tuning, feature extraction. Понимает как pre-trained LLM используются для downstream задач и применяет базовый transfer learning подход.
Применяет техники transfer learning для адаптации LLM: LoRA, QLoRA и prompt tuning. Дообучает фундаментальные модели на доменно-специфичных корпусах. Оценивает катастрофическое забывание и оптимизирует эффективность обучения.
Проектирует advanced transfer learning стратегии: continual pre-training, multi-task transfer, cross-lingual transfer. Оптимизирует trade-off между forgetting и adaptation для domain-specific моделей.
Определяет transfer learning стандарты для LLM-команды. Формирует guidelines по выбору base модели, transfer стратегии, evaluation. Координирует transfer learning experiments и model selection.
Знает основные архитектуры нейронных сетей: MLP, CNN, RNN, Transformer. Понимает особенности Transformer architecture для языковых моделей: self-attention, positional encoding, feed-forward layers.
Самостоятельно анализирует и модифицирует neural network архитектуры для LLM-задач: adapter layers, custom attention patterns, mixture of experts. Реализует архитектурные модификации в PyTorch.
Проектирует custom neural network архитектуры для LLM: efficient attention mechanisms, sparse transformers, multi-modal architectures. Проводит ablation studies для оптимизации архитектурных решений.
Определяет архитектурные стандарты для LLM-команды. Формирует guidelines по выбору архитектур, проводит review архитектурных решений, координирует R&D по новым архитектурам.
Distributed Tracing
▼
Понимает OpenTelemetry для LLM: tracing inference requests, token usage metrics.
Инструментирует LLM: distributed tracing, prompt chain tracing, custom metrics.
Проектирует LLM observability: end-to-end tracing, quality metrics, cost tracking.
Определяет стандарты observability для платформ сервинга LLM — формирует обязательную трассировку для потоков запросов инференса, требования к метрикам пропускной способности токенов и утилизации GPU, структурированное логирование для обработки промптов и мониторинга производительности моделей.
Git и workflow
▼
Знает основы Git: commit, branch, merge, pull request. Использует Git для версионирования кода ML-экспериментов и LLM-скриптов, следует базовым conventions при работе в команде.
Самостоятельно управляет сложными Git-workflow для ML-проектов: feature branches, rebasing, cherry-pick. Использует git-lfs для хранения model checkpoints и больших dataset файлов.
Проектирует Git-стратегию для LLM-проектов: branching model для ML-экспериментов, интеграция с DVC для версионирования данных, автоматизация через git hooks для проверки ML-артефактов.
Определяет Git best practices для LLM-команды. Формирует стандарты branching, commit conventions для ML-экспериментов, интеграцию с experiment tracking и model registry.
GraphQL
▼
Понимает GraphQL для LLM: query API для prompt management, metadata access.
Проектирует GraphQL для LLM: prompt template API, evaluation results queries, model metadata.
Проектирует LLM API architecture: unified prompt management, real-time evaluation, caching.
Определяет GraphQL стандарты: schema design, access patterns.
gRPC
▼
Понимает основы gRPC и Protocol Buffers для коммуникации сервисов инференса LLM. Читает proto-определения для схем запрос/ответ сервинга моделей и стриминга генерации токенов. Следует принятым в команде соглашениям по определению контрактов inference-эндпоинтов и сообщений метаданных моделей.
Самостоятельно проектирует gRPC-сервисы для платформ инференса LLM — стриминг генерации токенов через server-side streaming, эффективные proto-схемы для сообщений prompt/completion с метаданными, маршрутизацию запросов инференса с балансировкой нагрузки. Пишет комплексную документацию proto и тесты для контрактов сервинга моделей.
Проектирует архитектуру gRPC API для продакшн-платформ сервинга LLM — стриминг токенов с управлением backpressure, эффективные proto-схемы для мультимодального инференса с эмбеддингами и версионированные контракты сервинга моделей с поддержкой A/B-тестирования. Определяет обработку ошибок для сценариев таймаута инференса и rate limiting и оптимизирует сериализацию для высокопроизводительной генерации токенов.
Определяет API-стратегию на уровне продукта. Формирует стандарты проектирования. Проводит API design review. Координирует межкомандное API-взаимодействие.
Infrastructure as Code
▼
Описывает LLM infrastructure в Terraform: GPU instances, vector DB provisioning.
Проектирует Terraform для LLM: model serving infrastructure, vector DB clusters, monitoring.
Проектирует LLM infrastructure: multi-model deployment, auto-scaling, cost optimization.
Определяет IaC стандарты: LLM infrastructure patterns, GPU management.
Kubernetes и оркестрация
▼
Понимает базовые концепции Kubernetes Core. Использует готовые конфигурации. Выполняет простые операции под руководством senior.
Самостоятельно настраивает Kubernetes-деплои для inference-сервисов LLM с GPU-планированием и управлением памятью. Пишет IaC для нагрузок сервинга моделей с vLLM или TGI на Kubernetes с квотами ресурсов. Понимает сетевое взаимодействие Kubernetes для балансировки inference-трафика и масштабирования на основе метрик пропускной способности токенов.
Проектирует инфраструктуру Kubernetes для продакшн-сервинга LLM в масштабе с мульти-GPU планированием и параллелизмом моделей. Внедряет оптимизированное по стоимости управление GPU-кластерами с гетерогенными пулами нод и интеллектуальным размещением нагрузок. Применяет security hardening для эндпоинтов сервинга моделей и реализует эффективное распространение артефактов моделей между кластерами.
Определяет инфраструктурную стратегию с Kubernetes Core. Формирует стандарты IaC. Проводит architecture review. Оптимизирует FinOps.
Знает основы Kubernetes: pods, services, deployments. Понимает как деплоить LLM inference сервер в K8s и базовые концепции resource requests для GPU workloads.
Самостоятельно деплоит LLM-сервисы в Kubernetes: настраивает GPU resource limits, node affinity для GPU-нод, HPA для автоскейлинга inference. Использует Helm charts для ML-workloads.
Проектирует Kubernetes-инфраструктуру для LLM-платформы: multi-GPU scheduling, model serving с KServe/Triton, distributed training jobs с Kubeflow. Оптимизирует GPU utilization на кластере.
Определяет Kubernetes-стратегию для LLM-инфраструктуры команды. Формирует стандарты деплоя ML-workloads, GPU scheduling policies, мониторинг и автоскейлинг inference сервисов.
LLM и генеративный AI
▼
Понимает базовые концепции агентных фреймворков — паттерны использования инструментов, композицию цепочек и типы памяти в LangChain и LlamaIndex. Следует примерам команды для создания простых агентов с предопределёнными инструментами, парсингом структурированного вывода и базовой конверсационной памятью. Использует инструменты отладки фреймворков для трассировки шагов рассуждений агента и выявления проблем в выборе инструментов и генерации ответов.
Самостоятельно создаёт агентные системы с использованием LangChain, LangGraph и кастомного кода оркестрации с продвинутой интеграцией инструментов и управлением состоянием. Реализует агентные архитектуры — ReAct, plan-and-execute и паттерны рефлексии с настраиваемой логикой повторов и восстановлением после ошибок. Оценивает и бенчмаркит производительность фреймворков для конкретных задач — сравнивая стратегии агентов по точности, использованию токенов, задержке и надёжности при различных распределениях входных данных.
Проектирует продакшн-готовые агентные архитектуры с фреймворк-агностичными паттернами — подключаемыми LLM-бэкендами, реестрами инструментов и интеграцией observability. Внедряет продвинутые мультиагентные системы с агентами-супервизорами, специализированными агентами-воркерами и общими хранилищами памяти на LangGraph или кастомных конечных автоматах. Оптимизирует агентные системы для продакшн-масштаба через интеллектуальное кэширование, стриминг-выполнение, параллельные вызовы инструментов и стратегии cost-aware маршрутизации моделей.
Определяет архитектурные стандарты агентных фреймворков и методологии оценки для команд LLM-инженерии организации. Формирует лучшие практики тестирования агентов, safety guardrails, управления затратами и продакшн-мониторинга для агентных систем. Принимает архитектурные решения по выбору фреймворков, кастомной versus готовой агентной инфраструктуре и паттернам интеграции с существующими сервисами ML-платформы.
Знает основы text embeddings и vector databases. Генерирует embedding через sentence-transformers, сохраняет и ищет в ChromaDB. Понимает cosine similarity и базовый semantic search.
Самостоятельно проектирует embedding pipeline: выбор модели (OpenAI, Cohere, BGE), chunking стратегии, metadata filtering. Настраивает Pinecone/Weaviate для production-нагрузок с оптимизацией recall.
Проектирует масштабируемую embedding-инфраструктуру: hybrid search (dense + sparse), re-ranking, multi-vector retrieval. Оптимизирует latency и recall через fine-tuning embedding модели и index tuning.
Определяет embedding и vector DB стратегию для LLM-платформы. Формирует guidelines по выбору embedding моделей, vector DB, шардированию индексов и мониторингу качества retrieval.
Знает основы alignment: что такое helpful, harmless, honest (HHH). Понимает зачем нужен alignment для LLM и как он влияет на поведение модели. Изучает базовые подходы под руководством наставника.
Самостоятельно реализует alignment pipeline: подготовка preference datasets, Constitutional AI prompts, DPO training. Оценивает alignment quality через human evaluation и automated benchmarks.
Проектирует комплексные alignment стратегии: multi-objective alignment, iterative RLHF, debate-based alignment. Разрабатывает custom evaluation frameworks для измерения alignment quality на масштабе.
Определяет alignment стандарты для LLM-команды. Формирует guidelines по alignment methodology, quality metrics, red-teaming процессы. Координирует alignment R&D и интеграцию с production.
Разворачивает эндпоинты инференса LLM через управляемые сервисы, мониторит латентность и ошибки. Пишет структурированные промпты с few-shot примерами по командным гайдлайнам. Отслеживает расход токенов и применяет базовые техники оптимизации длины промптов.
Строит пайплайны файн-тюнинга с курированием датасетов, оркестрацией обучения и автоматической оценкой. Реализует системы шаблонов промптов с версионированием и откатом. Проектирует фреймворки оценки LLM с автоскорингом и human-in-the-loop ревью.
Проектирует масштабируемую инфраструктуру LLM-сервинга с маршрутизацией моделей, адаптивным батчингом и мультирегиональным деплоем. Формирует организационные практики промпт-инжиниринга с аудитом. Оптимизирует бюджеты токенов через семантическое кэширование и дистилляцию моделей.
Руководит командой LLM-платформы, определяя архитектурные стандарты для инференса, файн-тюнинга и инфраструктуры оценки. Координирует кросс-командное управление промпт-инжинирингом и распределение бюджетов токенов. Ведёт оценку вендоров фундаментальных моделей по критериям возможностей, стоимости и комплаенса.
Знает базовые техники prompt engineering: zero-shot, few-shot, chain-of-thought. Создаёт простые промпты для задач классификации и генерации текста, тестирует вариации под руководством наставника.
Самостоятельно разрабатывает сложные prompt templates: structured output, tool use, multi-step reasoning. Проводит systematic prompt optimization с A/B testing и метриками качества.
Проектирует production prompt engineering системы: prompt versioning, automated optimization, meta-prompting. Реализует dynamic prompt construction на основе контекста и user intent.
Определяет prompt engineering стандарты для LLM-команды. Формирует prompt libraries, guidelines по prompt testing, review процессы. Координирует prompt optimization для production систем.
Знает основы RAG: retrieval + generation, базовый pipeline с embedding и vector search. Собирает простой RAG-pipeline на LangChain с ChromaDB для QA-задачи под руководством наставника.
Самостоятельно проектирует production RAG: advanced chunking, hybrid retrieval, re-ranking. Настраивает metadata filtering, conversation history, source attribution. Оценивает quality через RAGAS.
Проектирует enterprise RAG-системы: multi-source retrieval, agentic RAG, query routing. Оптимизирует retrieval quality через fine-tuning retriever, custom re-rankers и adaptive chunking стратегии.
Определяет RAG-стратегию для LLM-команды. Формирует best practices по RAG architecture, data ingestion, quality monitoring. Координирует RAG-систему как платформу для нескольких продуктов.
Понимает компоненты RAG-пайплайна: модели эмбеддингов, векторные базы данных и стратегии поиска. Реализует базовое индексирование документов и семантический поиск с FAISS или Pinecone для аугментации LLM.
Реализует продвинутые паттерны RAG: декомпозицию запросов, гипотетические эмбеддинги документов (HyDE) и мульти-индексный поиск. Оптимизирует размер чанков и перекрытие для доменных корпусов и оценивает качество поиска с метриками RAGAS.
Проектирует масштабируемые RAG-платформы с графовым поиском, контекстным сжатием и адаптивными стратегиями чанкинга. Реализует интеграцию knowledge graph для структурированного рассуждения и менторит команду по методологии оценки RAG и снижению галлюцинаций.
Определяет стратегию RAG-архитектура на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
Знает основы RLHF: reward model, PPO, preference learning. Понимает зачем RLHF используется для alignment LLM и изучает базовые концепции под руководством наставника.
Самостоятельно реализует RLHF pipeline: сбор preference данных, обучение reward model, PPO training с trl library. Применяет DPO как альтернативу PPO для более стабильного обучения.
Проектирует advanced RLHF системы: iterative RLHF, Constitutional AI, reward model ensembles. Оптимизирует RLHF pipeline для стабильности обучения и alignment quality.
Определяет RLHF стратегию для LLM-команды. Формирует best practices по data collection, reward modeling, training stability. Координирует RLHF experiments и production integration.
Знает основы vLLM: что такое PagedAttention, continuous batching, inference serving. Запускает vLLM сервер для inference pre-trained модели с базовой конфигурацией под руководством наставника.
Самостоятельно настраивает vLLM для production: tensor parallelism, quantization (AWQ/GPTQ), GPU memory management. Оптимизирует throughput через настройку batch size и scheduling параметров.
Проектирует production vLLM infrastructure: multi-model serving, speculative decoding, custom sampling strategies. Оптимизирует latency и throughput через advanced configuration и hardware-specific tuning.
Определяет vLLM deployment стандарты для LLM-команды. Формирует guidelines по конфигурации, мониторингу, capacity planning. Координирует upgrades и migration между версиями vLLM.
Знает основы Transformer: self-attention, multi-head attention, positional encoding, feed-forward layers. Понимает encoder-decoder и decoder-only архитектуры и их применение в LLM.
Самостоятельно анализирует и модифицирует Transformer-архитектуры: RoPE, ALiBi, GQA, SwiGLU. Понимает архитектурные различия между GPT, LLaMA, Mistral и их влияние на производительность.
Проектирует custom Transformer-модификации: efficient attention (FlashAttention, sliding window), custom positional encoding, architectural search. Реализует и оценивает novel архитектурные решения.
Определяет Transformer architecture стандарты для LLM-команды. Формирует guidelines по выбору архитектуры, оценке новых подходов, R&D направлениям. Координирует architectural experiments.
Знает основы LLM safety: jailbreaking, prompt injection, harmful content. Понимает базовые подходы к content filtering и safety classifiers для LLM-приложений.
Самостоятельно реализует safety pipeline: input/output filtering, guardrails (NeMo Guardrails, Guardrails AI), red-teaming. Настраивает content moderation и PII detection для production LLM.
Проектирует комплексные safety системы: multi-layer defense, adversarial robustness testing, dynamic safety policies. Разрабатывает custom safety classifiers и automated red-teaming frameworks.
Определяет LLM safety стандарты для команды. Формирует safety testing protocols, incident response для safety events, governance процессы. Координирует safety R&D и compliance.
Знает основы деплоя LLM: REST API endpoint, model loading, basic serving. Деплоит простой inference сервер на vLLM или text-generation-inference под руководством наставника.
Самостоятельно деплоит LLM в production: настраивает vLLM с continuous batching, quantization (GPTQ/AWQ), health checks. Реализует мониторинг latency, throughput и error rates.
Проектирует production LLM serving инфраструктуру: multi-model serving, A/B testing, canary deployments, auto-scaling. Оптимизирует latency (p50/p95/p99) и throughput при высоких нагрузках.
Определяет LLM deployment стратегию для команды. Формирует SLA для inference сервисов, стандарты мониторинга, процессы rollback и incident response для LLM production систем.
Знает базовые концепции scaling LLM: scaling laws, compute-optimal training, emergent abilities. Понимает trade-offs между размером модели и вычислительными ресурсами для разных задач.
Самостоятельно планирует scaling стратегии: расчёт compute budget по scaling laws, выбор model size vs data size. Оптимизирует training и inference costs для моделей 7B-13B параметров.
Проектирует scaling strategy для больших LLM: multi-stage scaling plan, Chinchilla-optimal training, progressive training. Оптимизирует balance между model quality, training cost и inference latency.
Определяет scaling стандарты для LLM-команды. Формирует guidelines по compute budgeting, model size selection, cost-benefit analysis. Координирует scaling decisions для нескольких продуктов.
Знает основы distributed training: DataParallel, model parallelism. Понимает концепции gradient synchronization и запускает простые multi-GPU training под руководством наставника на PyTorch.
Самостоятельно настраивает distributed training с DeepSpeed ZeRO и FSDP. Конфигурирует data parallel, pipeline parallel, tensor parallel для моделей до 7B параметров на кластере GPU.
Проектирует distributed training стратегии для больших LLM: 3D parallelism, ZeRO-3 offloading, activation checkpointing. Оптимизирует communication overhead и GPU utilization на 100+ GPU.
Определяет distributed training инфраструктуру для LLM-команды. Формирует best practices по конфигурации multi-node training, мониторингу и отладке distributed jobs на GPU-кластерах.
MCP и AI-инструменты
▼
Понимает базовые концепции разработки AI-агентов — агентный цикл (observe-think-act), схемы определения инструментов и дизайн промптов для инструкций агентов. Следует паттернам команды для реализации простых агентов с function calling, структурированными выходами и базовой обработкой ошибок. Тестирует поведение агентов по предопределённым сценариям и оценивает точность выбора инструментов и качество ответов под руководством.
Самостоятельно разрабатывает системы AI-агентов с кастомными реализациями инструментов, управлением состоянием диалога и возможностями мультитурнового рассуждения. Реализует паттерны надёжности агентов — retry с backoff, валидацию вызовов инструментов, циклы верификации выходов и graceful fallback к более простым стратегиям. Создаёт harness-ы для оценки агентных систем, измеряя completion задач, эффективность инструментов, стоимость за взаимодействие и соответствие safety boundaries по разнообразным входным сценариям.
Проектирует продакшн-архитектуры AI-агентов с sophisticated возможностями рассуждений — tree-of-thought планирование, саморефлексия и коррекция, динамическая адаптация стратегии на основе анализа сложности задачи. Внедряет мультиагентные системы со специализацией агентов, протоколами коммуникации и механизмами консенсуса для декомпозиции сложных задач. Архитектурирует агентную инфраструктуру для масштаба — распределённое выполнение инструментов, персистентную память агентов с vector stores и real-time observability цепочек рассуждений и метрик стоимости агентов.
Определяет стандарты разработки AI-агентов, фреймворки безопасности и архитектуру инфраструктуры для практики LLM-инженерии организации. Формирует методологии оценки агентов, требования продакшн-деплоя и стратегии оптимизации затрат для агентных систем. Принимает архитектурные решения по агентной инфраструктуре — runtime-окружения, governance маркетплейса инструментов и паттерны межкомандного переиспользования возможностей агентов.
Понимает архитектуру MCP: клиент-серверную коммуникацию, согласование возможностей и транспортные уровни. Настраивает MCP-соединения для LLM-приложений и тестирует базовые вызовы инструментов.
Реализует MCP-серверы с динамической регистрацией инструментов, потоковыми ответами и управлением контекстом. Оптимизирует описания инструментов для понимания LLM и обрабатывает многоходовые диалоги с использованием инструментов.
Проектирует масштабируемую MCP-инфраструктуру с композицией серверов, оркестрацией инструментов и стратегиями fallback. Реализует расширения протокола для кастомных возможностей и менторит команду по оптимизации контекстного окна с MCP-инструментами.
Определяет стратегию Model Context Protocol на уровне команды/продукта. Формирует стандарты и best practices. Проводит review.
MLOps
▼
Знает основы деплоя ML-моделей: REST API, model serialization, inference server. Деплоит простые ML-модели через веб-фреймворк с базовым error handling под руководством наставника.
Самостоятельно деплоит ML-модели в production: TorchServe, BentoML, model optimization (ONNX, TensorRT). Настраивает мониторинг predictions, data drift detection и A/B testing.
Проектирует ML serving инфраструктуру для LLM-экосистемы: unified serving layer для ML и LLM моделей, feature stores, online/offline prediction pipeline с low latency requirements.
Определяет ML deployment стандарты для LLM-команды. Формирует guidelines по model serving, versioning, rollback стратегии. Координирует инфраструктуру для различных типов ML-моделей.
Знает основы ML-pipeline: data loading, preprocessing, training, evaluation. Собирает простые pipeline для подготовки данных LLM fine-tuning с использованием Hugging Face Datasets.
Самостоятельно строит production ML-pipeline для LLM: data ingestion, cleaning, tokenization, training, evaluation. Использует Airflow или Prefect для оркестрации, обеспечивает idempotency.
Проектирует сложные ML-pipeline для LLM-платформы: multi-stage data processing, continuous training, automated retraining triggers. Оптимизирует пропускную способность и reliability pipeline.
Определяет ML pipeline стандарты для LLM-команды. Формирует guidelines по pipeline architecture, monitoring, error handling. Координирует pipeline infrastructure для training и inference.
Логирует запуски fine-tuning LLM в MLflow, отслеживая training loss, perplexity и evaluation scores. Записывает prompt-шаблоны, конфиги tokenizer и веса адаптеров (LoRA, QLoRA) как артефакты. Использует MLflow UI для сравнения запусков различных базовых моделей и наборов гиперпараметров.
Структурирует эксперименты MLflow для пайплайнов оценки LLM, логируя BLEU, ROUGE и бенчмарк-скоры по вариациям промптов. Интегрирует с Hugging Face Trainer и DeepSpeed для автоматического захвата метрик. Управляет версиями LLM в Model Registry с метаданными обучения и квантизации.
Архитектурит инфраструктуру MLflow для корпоративной разработки LLM: трекинг итераций RLHF reward-моделей, управление реестрами адаптеров и автоматизация evaluation-наборов (MT-Bench, HumanEval). Создаёт кастомные MLflow flavors для серверирования квантизованных LLM (GPTQ, AWQ) с трекингом latency и throughput.
Задаёт стратегию MLflow для LLM-команд, стандартизируя трекинг для fine-tuning, RLHF и prompt engineering воркфлоу. Устанавливает политики model registry для версионирования LLM с матрицами совместимости адаптеров. Ревьюит практики трекинга для соответствия требованиям data lineage и генерации model cards.
Понимает основы serving LLM: настройка inference API (vLLM, TGI), конфигурация эндпоинтов prompt/completion и соображения биллинга на основе токенов. Следует командным практикам деплоя LLM включая управление контекстным окном и настройку стриминга ответов.
Реализует решения serving LLM: оптимизация KV-cache для пропускной способности, стратегии батчинга (continuous batching, dynamic batching) и квантизация для cost-efficient inference (GPTQ, AWQ, GGUF). Настраивает vLLM/TGI для продуктовых нагрузок. Реализует инфраструктуру стриминга ответов и мониторинг латенси на уровне токенов.
Проектирует архитектуру serving LLM: мульти-модельный gateway с интеллектуальной маршрутизацией, speculative decoding для оптимизации латенси и disaggregated serving (разделение prefill/decode). Реализует оптимизацию затрат: управление бюджетом токенов, слои кеширования для повторяющихся промптов и стратегии каскада моделей. Создаёт бенчмарки LLM serving и модели планирования ёмкости. Менторит команду по инфраструктуре production LLM.
Определяет стратегию LLM serving для организации. Устанавливает политики управления затратами inference, SLA-цели serving и governance GPU-инфраструктуры. Оценивает фреймворки serving (vLLM, TGI, TensorRT-LLM). Проводит архитектурные ревью LLM-инфраструктуры. Продвигает внедрение cost-efficient паттернов LLM serving.
Понимает базовые концепции мониторинга больших языковых моделей в продакшене. Отслеживает качество ответов, расход токенов, латентность и частоту галлюцинаций через инструменты логирования. Следует практикам команды по настройке алертов на производительность LLM-эндпоинтов и обнаружение регрессии промптов.
Самостоятельно строит пайплайны мониторинга для LLM-приложений. Отслеживает семантический дрифт, метрики качества ответов, тренды расхода токенов и эффективность промптов через LangSmith или кастомные evaluation-фреймворки. Настраивает алерты на всплески латентности, срабатывания safety-фильтров и нарушения формата вывода.
Проектирует комплексные платформы мониторинга для LLM-систем в продакшене. Внедряет автоматизированные evaluation-пайплайны с LLM-as-judge, петлями обратной связи и инструментацией A/B-тестов. Строит дашборды оптимизации затрат с трекингом расхода токенов по версиям моделей и вариантам промптов. Менторит команду по паттернам LLMOps observability.
Определяет стратегию мониторинга моделей для LLM-продуктов на уровне команды. Устанавливает evaluation-фреймворки, комбинирующие автоматические метрики, воркфлоу ревью и мониторинг безопасности. Задаёт стандарты отслеживания затрат, бюджетов латентности и quality gates по версиям промптов. Проводит ревью покрытия мониторингом всех LLM-функций.
Знает базовые метрики ML: accuracy, precision, recall, F1. Вычисляет метрики для classification и regression моделей, используемых в preprocessing pipeline LLM-систем.
Самостоятельно проводит комплексную оценку ML-моделей: confusion matrix, ROC-AUC, calibration plots. Оценивает вспомогательные ML-модели в LLM-pipeline: safety classifiers, intent detectors.
Проектирует evaluation frameworks для ML-компонентов LLM-экосистемы: cross-validation стратегии, statistical significance testing, fairness metrics. Автоматизирует regression testing.
Определяет ML evaluation стандарты для LLM-команды. Формирует guidelines по оценке вспомогательных ML-моделей, threshold selection, A/B testing methodology.
Знает основы experiment tracking: логирование метрик, параметров, артефактов. Использует W&B или MLflow для отслеживания LLM training runs и fine-tuning экспериментов.
Самостоятельно организует experiment tracking для LLM-проектов: структурированные projects в W&B, сравнение runs, hyperparameter sweeps. Версионирует datasets и model checkpoints.
Проектирует experiment tracking инфраструктуру для LLM-команды: custom dashboards, automated reporting, integration с CI/CD. Обеспечивает reproducibility для всех training и evaluation экспериментов.
Определяет experiment tracking стандарты для LLM-команды. Формирует guidelines по организации экспериментов, naming conventions, mandatory logging. Интегрирует tracking с model registry.
Логирует шаблоны промптов, версии моделей и оценочные метрики (BLEU, ROUGE, человеческие оценки) в инструментах трекинга экспериментов; следует командным стандартам записи экспериментов по файн-тюнингу и инференсу LLM
Выстраивает комплексный трекинг экспериментов для LLM-воркфлоу: версионирует цепочки промптов и конфигурации RAG, логирует расход токенов и латентность наряду с метриками качества, сравнивает запуски файн-тюнинга на разных базовых моделях в W&B или MLflow
Архитектурит системы трекинга экспериментов для LLM-платформ: проектирует кастомное логирование для многоэтапных пайплайнов (retrieval, generation, ranking), оптимизирует хранение больших артефактов промптов/ответов, менторит команды по отслеживанию дрифта оценок между версиями моделей
Определяет стратегию трекинга экспериментов для продуктовых LLM-команд: стандартизирует трекинг итераций prompt engineering, оценок моделей и компромиссов стоимость/качество; строит командные дашборды, связывающие результаты экспериментов с продуктовыми метриками и решениями о релизах
NLP
▼
Знает основы NLP: tokenization, stemming, NER, sentiment analysis. Понимает как классические NLP-задачи решаются с помощью LLM и применяет базовые техники text preprocessing.
Самостоятельно решает NLP-задачи с использованием LLM: text classification, NER, summarization, translation. Сравнивает LLM-подходы с классическими методами, выбирает оптимальный для задачи.
Проектирует комплексные NLP-системы на базе LLM: multi-task learning, zero-shot transfer, domain adaptation. Оптимизирует качество через prompt engineering, fine-tuning и ensemble подходы.
Определяет NLP-стратегию для LLM-команды. Формирует guidelines по выбору подходов (LLM vs classical NLP), evaluation methodology, domain adaptation стратегии для различных NLP-задач.
Понимает архитектуру Transformer и механизмы attention. Работает с pre-trained LLM через Hugging Face Transformers для inference и базового prompt engineering. Следует установленным паттернам загрузки моделей, токенизации и интеграции через API.
Применяет техники fine-tuning (LoRA, QLoRA, PEFT) для адаптации LLM под конкретные задачи. Реализует RAG-пайплайны, комбинируя retrieval и generation. Понимает trade-offs между квантизацией, размером context window и качеством генерации.
Проектирует production LLM-системы с оптимизированным serving (vLLM, TGI), model parallelism и стратегиями batching. Разрабатывает фреймворки оценки качества, безопасности и bias detection. Внедряет RLHF, constitutional AI и chain-of-thought optimization.
Определяет стратегию LLM-платформы: критерии выбора моделей, пайплайны fine-tuning, стандарты serving-инфраструктуры. Устанавливает бенчмарки, safety guardrails и практики оптимизации затрат. Ревьюит архитектуру RAG-систем и agent-фреймворков.
Знает основы tokenization: BPE, WordPiece, SentencePiece. Понимает как токенизатор влияет на качество и стоимость LLM. Использует pre-trained tokenizers из Hugging Face для базовых задач.
Самостоятельно работает с tokenization для LLM: анализирует token distribution, оптимизирует input length, обрабатывает special tokens. Обучает custom tokenizer на domain-specific корпусе.
Проектирует tokenization стратегии для LLM: multi-language tokenizer training, vocabulary extension, tokenizer-aware data preprocessing. Оптимизирует fertility rate и coverage для target домена.
Определяет tokenization стандарты для LLM-команды. Формирует guidelines по выбору и обучению токенизаторов, оценке качества tokenization, интеграции с training и inference pipeline.
REST API
▼
Понимает базовые концепции REST API для LLM-сервисов: эндпоинты chat completion, обработка потоковых ответов, отслеживание использования токенов в API-ответах. Следует командным конвенциям интеграции LLM API и дизайна эндпоинтов промптов.
Самостоятельно проектирует REST API для LLM-сервисов: эндпоинты chat completion с поддержкой streaming, API управления промптами, эндпоинты трекинга использования и биллинга. Понимает лучшие практики rate limiting LLM API, token-based ценообразования в ответах и управления контекстным окном.
Проектирует архитектуру API для LLM-сервисов: streaming API chat completion, эндпоинты управления и версионирования промптов, API учёта использования и биллинга. Определяет API-контракты для компонентов LLM-платформы. Менторит команду по дизайну масштабируемых API инференса LLM.
Определяет API-стратегию для LLM-сервисов на уровне продукта: стандарты API инференса LLM, governance API управления промптами, политики эндпоинтов учёта использования. Проводит архитектурные ревью API для сервисов LLM-платформы и устанавливает практики дизайна LLM API.
System Design
▼
Знает основы системного проектирования: клиент-сервер, REST API, базы данных. Понимает архитектуру простого LLM-приложения: API gateway, inference server, vector database.
Самостоятельно проектирует LLM-системы средней сложности: RAG-сервис с caching, async processing, message queues. Учитывает scalability, reliability и cost при выборе архитектурных решений.
Проектирует сложные LLM-системы: multi-model inference platform, real-time RAG с streaming, distributed vector search. Обеспечивает high availability, fault tolerance и horizontal scalability.
Определяет архитектурные стандарты для LLM-команды. Формирует guidelines по system design для ML-систем, проводит architecture review, определяет technical debt management стратегию.
Unit-тестирование
▼
Знает основы unit testing с pytest: fixtures, assertions, параметризация. Пишет простые тесты для LLM-утилит: text preprocessing, prompt formatting, response parsing.
Самостоятельно пишет comprehensive тесты для LLM-компонентов: мокирование API calls, тестирование tokenization, embedding pipeline. Использует тестовые инструменты.-asyncio для async-кода и coverage reporting.
Проектирует testing стратегию для LLM-систем: property-based testing для prompt templates, snapshot testing для model outputs, integration tests для RAG-pipeline. Обеспечивает high coverage.
Определяет testing стандарты для LLM-команды. Формирует guidelines по тестированию ML-кода, minimum coverage requirements, CI/CD integration. Обучает команду best practices ML testing.
Понимает основы юнит-тестирования LLM-кода: pytest для функций шаблонов промптов, мокирование ответов LLM API, паттерны assertions для выходов цепочек. Следует командным практикам тестирования компонентов retrieval и generation пайплайна независимо.
Самостоятельно пишет юнит-тесты для LLM-пайплайнов: pytest для логики шаблонов промптов, мокированные LLM-ответы для тестирования цепочек, покрытие граничных случаев переполнения контекстного окна и лимитов токенов. Интегрирует LLM-тесты в CI/CD с детерминированными мок-ответами и валидацией вывода.
Проектирует стратегию тестирования для LLM-систем: пирамида тестирования для компонентов prompt/chain/agent, evaluation-driven тестирование с LLM-as-judge, контрактные тесты для интерфейсов провайдеров моделей. Оптимизирует выполнение тестов с мок-ответами LLM и селективным интеграционным тестированием. Менторит команду по тестированию недетерминированных AI-выходов.
Определяет стратегию тестирования на уровне продукта для LLM-систем: стандарты тестирования оценки промптов, governance тестирования цепочек/агентов, фреймворки тестирования качества выходов LLM. Устанавливает культуру shift-left тестирования с автоматическими quality gates для деплоя LLM-пайплайнов.
Алгоритмы и структуры данных
▼
Знает базовые алгоритмы сортировки и поиска, понимает O-нотацию для оценки сложности. Применяет знания при анализе производительности простых pipeline обработки текстовых данных для LLM.
Самостоятельно анализирует алгоритмическую сложность компонентов LLM-pipeline: токенизация, beam search, top-k sampling. Выбирает оптимальные структуры данных для кэширования embedding-результатов.
Оптимизирует алгоритмы в критических секциях LLM-инференса: KV-cache eviction, attention mechanism, batching strategies. Применяет профилирование для выявления bottleneck в inference pipeline.
Определяет алгоритмические стандарты для LLM-команды. Проводит архитектурные review сложных алгоритмов в inference engine, формирует guidelines по оптимизации вычислительной сложности.
Знает базовые структуры данных: массивы, хеш-таблицы, деревья. Понимает их применение при работе с текстовыми корпусами и словарями токенизатора в контексте LLM.
Самостоятельно выбирает структуры данных для LLM-задач: trie для токенизации, priority queue для beam search, bloom filter для дедупликации корпусов. Оптимизирует memory footprint.
Проектирует специализированные структуры данных для LLM-инфраструктуры: HNSW для vector search, paged KV-cache, custom hash maps для vocabulary lookup в high-throughput inference.
Определяет стандарты использования структур данных в LLM-платформе. Проводит review эффективности data structures в inference engine, формирует guidelines по memory-efficient реализациям.
Безопасность приложений
▼
Понимает security для LLM: prompt injection awareness, data leakage prevention. Применяет basic safety measures.
Реализует LLM security: prompt injection defense, output filtering, PII detection. Внедряет guardrails.
Проектирует LLM security: comprehensive prompt security, adversarial testing, data classification.
Определяет LLM security стандарты: mandatory safety testing, guardrails requirements, security review.
Применяет secure coding для LLM: API key management, input sanitization. Не хардкодит credentials.
Реализует LLM security: prompt sanitization, output filtering, secure API integration. Защищает PII.
Проектирует secure LLM: comprehensive safety pipeline, adversarial defense, compliance.
Определяет security стандарты: LLM safety guidelines, mandatory review, compliance.
Веб-фреймворки
▼
Использует Python Web Frameworks на базовом уровне в transformers/vLLM. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Python Web Frameworks в transformers/vLLM. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью eval harness.
Проектирует решения на основе Python Web Frameworks для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Определяет архитектуру API обслуживания LLM и платформ управления промптами на FastAPI. Устанавливает стандарты для эндпоинтов потоковых ответов, трекинга использования токенов и middleware ограждений. Проводит ревью дизайна и определяет дорожную карту инфраструктуры LLM-шлюзов.
Интеграционное тестирование
▼
Тестирует LLM интеграции: API integration, RAG pipeline testing. Проверяет end-to-end flows.
Проектирует integration тесты: RAG pipeline validation, tool use testing, multi-model integration.
Определяет integration testing: comprehensive LLM system testing, safety validation, regression testing.
Внедряет testing стандарты: mandatory integration tests, safety validation, quality gates.
Классический ML
▼
Знает основы Python: типы данных, функции, классы, модули. Пишет скрипты для работы с LLM API, обработки текстовых данных и базовой автоматизации ML-задач под руководством наставника.
Самостоятельно разрабатывает на Python для LLM-проектов: async/await для API calls, dataclasses для конфигураций, generators для data streaming. Пишет unit tests и использует type hints.
Проектирует Python-приложения для LLM: high-performance async servers, memory-efficient data processing, custom PyTorch extensions. Оптимизирует performance через profiling и concurrency.
Определяет Python-стандарты для LLM-команды. Формирует coding guidelines, project structure templates, CI/CD pipeline. Проводит архитектурные review Python-компонентов ML-системы.
Контейнеризация
▼
Знает основы Docker: Dockerfile, образы, контейнеры. Собирает простые контейнеры для LLM-приложений с Python-зависимостями и CUDA runtime под руководством наставника.
Самостоятельно создаёт оптимизированные Docker-образы для LLM: multi-stage build, CUDA toolkit, PyTorch с GPU-поддержкой. Настраивает docker-compose для dev-окружения с vector DB и inference server.
Проектирует Docker-стратегию для LLM-платформы: оптимизация размера образов с моделями, GPU passthrough, shared memory для multi-GPU inference. Создаёт base images для ML-команды.
Определяет Docker-стандарты для LLM-инфраструктуры команды. Формирует best practices по сборке ML-образов, управлению моделями в контейнерах, GPU-resource allocation и security.
Кэширование
▼
Использует Redis на базовом уровне в transformers/vLLM. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Redis в transformers/vLLM. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью eval harness.
Проектирует решения на основе Redis для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Определяет архитектурные решения по Redis на уровне продукта. Формирует стандарты. Проводит design review и определяет технический roadmap.
Логирование
▼
Использует logging для LLM: logging prompts/completions, token usage tracking.
Реализует LLM logging: structured prompt logging, evaluation metrics, cost tracking, safety logging.
Проектирует LLM observability: prompt analytics, quality tracking, cost dashboards.
Определяет logging стандарты: prompt logging requirements, evaluation metrics, safety monitoring.
Метрики и мониторинг
▼
Мониторит LLM через Prometheus: latency, token usage, error rate. Просматривает dashboards.
Создаёт LLM monitoring: quality metrics, cost dashboards, throughput tracking.
Проектирует LLM monitoring: quality regression detection, cost alerting, usage analytics.
Определяет monitoring стандарты: mandatory LLM metrics, dashboards, alerting.
Многопоточность и конкурентность
▼
Понимает основы асинхронного программирования в Python: asyncio для конкурентных API-вызовов, async-обработка потоковых ответов, базовые паттерны конкурентного выполнения промптов. Следует командным конвенциям async-кода в компонентах LLM-пайплайна.
Самостоятельно применяет асинхронное программирование в LLM-пайплайнах: конкурентные API-вызовы к провайдерам моделей, async-обработка потоковых ответов, неблокирующее выполнение цепочек/агентов. Понимает компромиссы между sync и async паттернами для инференса и retrieval LLM.
Проектирует async-архитектуры для LLM-систем: конкурентный инференс нескольких моделей, async-агрегация потоковых ответов, неблокирующая оркестрация RAG-пайплайна. Менторит команду по async-паттернам для оптимизации латентности LLM и масштабирования пропускной способности.
Определяет стандарты асинхронного программирования для LLM-команды: гайдлайны архитектуры потоковых ответов, ревью дизайна конкурентного инференса, паттерны async RAG-пайплайна. Устанавливает best practices для async-паттернов в системах LLM serving.
Понимает concurrency для LLM: parallel API calls, concurrent prompt processing.
Реализует parallel LLM: batch inference, concurrent RAG retrieval, parallel evaluation.
Проектирует concurrent LLM systems: parallel model inference, distributed RAG, pipeline parallelism.
Определяет concurrency стандарты: parallel processing policies, rate limiting, resource management.
Облачные провайдеры
▼
Понимает базовые концепции AWS для нагрузок LLM — EC2 GPU-инстансы для инференса, S3 для артефактов моделей и Bedrock для управляемого доступа к LLM. Использует существующие конфигурации для провижининга GPU-инстансов и деплоя моделей. Выполняет простые операции — мониторинг здоровья inference-эндпоинтов и проверку утилизации GPU — под руководством.
Самостоятельно настраивает сервисы AWS для нагрузок LLM — EC2 P4/P5 инстансы для инференса, Bedrock для управляемого доступа к LLM и S3 для управления артефактами моделей. Пишет IaC для провижининга GPU-кластеров со стратегиями fallback на spot-инстансы. Понимает VPC-сетевое взаимодействие для безопасных inference-эндпоинтов и политики IAM для контроля доступа к моделям.
Проектирует инфраструктурные решения AWS для продакшн-сервинга LLM — мульти-GPU кластеры EC2 с параллелизмом моделей, интеграцию Bedrock для управляемого инференса и эндпоинты SageMaker для кастомных моделей. Оптимизирует затраты через стратегии резервирования GPU-инстансов, батчинг инференса и квантизацию моделей для снижения вычислительных требований. Внедряет security hardening для LLM-нагрузок с governance доступа к моделям, логированием промптов и изоляцией данных.
Определяет стратегию инфраструктуры AWS для платформ сервинга LLM, охватывающих GPU-кластеры, интеграцию Bedrock и автоматизацию деплоя моделей. Формирует стандарты IaC для управления GPU-инстансами, жизненного цикла артефактов моделей и политик масштабирования инференса. Проводит архитектурные ревью, оптимизируя затраты сервинга LLM, и координирует FinOps для расходов на GPU-вычисления.
ООП и паттерны проектирования
▼
Знает базовые паттерны проектирования: Strategy, Factory, Observer. Применяет их при написании простых компонентов LLM-pipeline: загрузчики данных, форматтеры промптов.
Самостоятельно применяет паттерны проектирования для LLM-приложений: цепочка обязанностей для пайплайнов обработки промптов, стратегия для взаимозаменяемых провайдеров моделей, адаптер для различных бэкендов эмбеддингов, observer для обработки потоковых ответов. Понимает компромиссы между сложностью паттернов и поддерживаемостью LLM-приложений.
Проектирует архитектуру LLM-систем с применением паттернов: Plugin для model backends, Pipeline для inference chain, Registry для model/tokenizer management. Обеспечивает extensibility.
Определяет архитектурные паттерны для LLM-платформы команды. Формирует guidelines по применению паттернов в ML-системах, проводит design review новых компонентов inference pipeline.
Понимает базовые концепции ООП в Python: классы, наследование, протоколы. Применяет простые принципы SOLID при структурировании компонентов LLM-пайплайна. Следует командным паттернам классов шаблонов промптов и дизайна обёрток цепочек/агентов в проектах на LangChain.
Самостоятельно применяет ООП/SOLID в коде LLM-пайплайнов: правильная абстракция для шаблонов промптов и компонентов цепочек, интерфейсные бэкенды провайдеров моделей, единственная ответственность в модулях retrieval/generation/evaluation. Понимает компромиссы между ООП-паттернами и функциональной композицией в кодовых базах LangChain/LlamaIndex.
Применяет ООП/SOLID в архитектуре LLM-приложений: strategy pattern для сменяемых провайдеров моделей, chain of responsibility для пайплайнов обработки промптов, абстрактные интерфейсы для компонентов эмбеддингов и retrieval. Проектирует расширяемые LLM-фреймворки, поддерживающие мульти-модельную оркестрацию.
Определяет стандарты ООП/SOLID для LLM-команды: гайдлайны иерархий классов цепочек/агентов, интерфейсные контракты провайдеров моделей, паттерны архитектуры модулей retrieval. Проводит ревью дизайна абстракций в компонентах LLM-пайплайна.
Оптимизация БД
▼
Понимает indexing для LLM: vector indexes, embedding storage. Работает с vector databases.
Проектирует indexing: vector index optimization (HNSW, IVF), hybrid search, metadata filtering.
Проектирует vector search architecture: multi-index strategies, re-ranking, performance optimization.
Определяет indexing стандарты: vector DB selection, index requirements, performance targets.
Поисковые движки
▼
Использует Elasticsearch / OpenSearch на базовом уровне в transformers/vLLM. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Elasticsearch / OpenSearch в transformers/vLLM. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью eval harness.
Проектирует решения на основе Elasticsearch / OpenSearch для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Определяет архитектурные решения по Elasticsearch / OpenSearch на уровне продукта. Формирует стандарты. Проводит design review и определяет технический roadmap.
Протоколы API
▼
Понимает основы Server-Sent Events и Streaming. Использует существующие API по документации. Может вызывать endpoint и обрабатывать response.
Самостоятельно проектирует и реализует Server-Sent Events и Streaming. Понимает best practices и patterns. Пишет документацию и тесты API.
Проектирует API-архитектуру с Server-Sent Events и Streaming для production-систем. Определяет стандарты versioning, error handling, pagination. Оптимизирует производительность.
Определяет API-стратегию на уровне продукта. Формирует стандарты проектирования. Проводит API design review. Координирует межкомандное API-взаимодействие.
Реляционные БД
▼
Понимает базовый PostgreSQL для работы с LLM: хранение шаблонов промптов и истории диалогов, основы pgvector для хранения эмбеддингов RAG, базовые запросы для управления данными пайплайна retrieval. Следует командным конвенциям схем БД LLM-приложений.
Самостоятельно проектирует схемы для LLM-приложений: оптимизирует запросы pgvector для RAG-retrieval, внедряет эффективное хранение истории диалогов, настраивает стратегии индексирования для поиска по сходству эмбеддингов. Понимает компромиссы между PostgreSQL pgvector и выделенными векторными БД для разных масштабов RAG.
Проектирует архитектуру PostgreSQL для инфраструктуры LLM-приложений: оптимизирует pgvector для продакшен RAG в масштабе, внедряет гибридные стратегии retrieval, комбинирующие семантический и ключевой поиск, настраивает архитектуру БД для управления состоянием диалогов. Менторит команду по паттернам PostgreSQL для продакшен LLM-приложений.
Определяет стратегию данных PostgreSQL для LLM-продуктов: устанавливает стандарты использования pgvector и архитектуры данных RAG, проектирует паттерны БД для управления диалогами в масштабе, обеспечивает внедрение лучших практик PostgreSQL для инфраструктуры данных LLM-приложений.
Сети
▼
Понимает networking для LLM: API endpoint communication, streaming responses, WebSocket.
Реализует LLM networking: streaming API integration, connection pooling, load balancing.
Проектирует LLM network architecture: multi-model routing, failover, edge inference.
Определяет networking стандарты: API integration patterns, failover policies.
Системы типов
▼
Применяет type safety для LLM: typed prompt templates, response schemas. Использует Pydantic.
Обеспечивает type safety: structured output schemas, typed function calling, validation.
Проектирует type-safe LLM: schema-driven output, typed tool interfaces, contract validation.
Определяет type safety стандарты: output schema requirements, validation policies.
Управление API
▼
Документирует LLM API: prompt templates, input/output formats, usage examples.
Создаёт LLM documentation: API reference, prompt engineering guides, evaluation reports.
Проектирует documentation: prompt library, model cards, best practice guides.
Определяет documentation стандарты: mandatory prompt docs, model cards, review process.
Файловое и объектное хранилище
▼
Использует S3 / Object Storage на базовом уровне в transformers/vLLM. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с S3 / Object Storage в transformers/vLLM. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью eval harness.
Проектирует решения на основе S3 / Object Storage для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Определяет архитектурные решения по S3 / Object Storage на уровне продукта. Формирует стандарты. Проводит design review и определяет технический roadmap.
Фоновые задачи
▼
Использует Task Queues на базовом уровне в transformers/vLLM. Выполняет простые задачи по готовым шаблонам. Понимает базовые концепции и следует принятым в команде практикам.
Самостоятельно реализует задачи с Task Queues в transformers/vLLM. Понимает внутреннее устройство и оптимизирует производительность. Пишет тесты с помощью eval harness.
Проектирует решения на основе Task Queues для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Определяет архитектурные решения по Task Queues на уровне продукта. Формирует стандарты. Проводит design review и определяет технический roadmap.
Чистый код и рефакторинг
▼
Знает основы чистого кода и PEP 8 для Python. Пишет читаемый код с type hints при разработке скриптов для обработки данных и вызовов LLM API под руководством наставника.
Самостоятельно применяет практики качества кода в разработке LLM-приложений. Пишет чистый код prompt engineering с правильной композицией цепочек и обработкой fallback. Понимает компромиссы между сложностью промптов и надёжностью ответов. Ревьюит код интеграции с LLM на эффективность токенов, обработку ошибок и покрытие оценкой качества.
Проектирует code quality стандарты для LLM-проектов: структура ML-экспериментов, конфигурации моделей, reproducibility. Внедряет pre-commit hooks и CI/CD проверки для ML-кодовой базы.
Определяет code quality стандарты для LLM-команды. Формирует guidelines по организации ML-экспериментов, версионированию моделей и данных, проводит архитектурные review ML-pipeline.