Проектирует async-архитектуры для LLM-систем: конкурентный инференс нескольких моделей, async-агрегация потоковых ответов, неблокирующая оркестрация RAG-пайплайна. Менторит команду по async-паттернам для оптимизации латентности LLM и масштабирования пропускной способности.
Роли · LLM Engineer · Senior
Что должен уметь Senior }
31 ключевых навыков, всего 80. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Senior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Основы программирования, Backend Development, Базы данных.
Ключевые навыки для Senior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Основы программирования · 2
Применяет ООП/SOLID в архитектуре LLM-приложений: strategy pattern для сменяемых провайдеров моделей, chain of responsibility для пайплайнов обработки промптов, абстрактные интерфейсы для компонентов эмбеддингов и retrieval. Проектирует расширяемые LLM-фреймворки, поддерживающие мульти-модельную оркестрацию.
Backend Development · 5
Проектирует решения на основе Elasticsearch / OpenSearch для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Проектирует решения на основе Python Web Frameworks для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Проектирует решения на основе Redis для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Проектирует решения на основе S3 / Object Storage для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Проектирует решения на основе Task Queues для production-систем. Оптимизирует производительность и масштабируемость. Выбирает между альтернативными подходами. Менторит команду.
Базы данных · 1
Проектирует архитектуру PostgreSQL для инфраструктуры LLM-приложений: оптимизирует pgvector для продакшен RAG в масштабе, внедряет гибридные стратегии retrieval, комбинирующие семантический и ключевой поиск, настраивает архитектуру БД для управления состоянием диалогов. Менторит команду по паттернам PostgreSQL для продакшен LLM-приложений.
API и интеграции · 3
Проектирует архитектуру gRPC API для продакшн-платформ сервинга LLM — стриминг токенов с управлением backpressure, эффективные proto-схемы для мультимодального инференса с эмбеддингами и версионированные контракты сервинга моделей с поддержкой A/B-тестирования. Определяет обработку ошибок для сценариев таймаута инференса и rate limiting и оптимизирует сериализацию для высокопроизводительной генерации токенов.
Проектирует архитектуру API для LLM-сервисов: streaming API chat completion, эндпоинты управления и версионирования промптов, API учёта использования и биллинга. Определяет API-контракты для компонентов LLM-платформы. Менторит команду по дизайну масштабируемых API инференса LLM.
Проектирует API-архитектуру с Server-Sent Events и Streaming для production-систем. Определяет стандарты versioning, error handling, pagination. Оптимизирует производительность.
Облако и инфраструктура · 2
Проектирует инфраструктурные решения AWS для продакшн-сервинга LLM — мульти-GPU кластеры EC2 с параллелизмом моделей, интеграцию Bedrock для управляемого инференса и эндпоинты SageMaker для кастомных моделей. Оптимизирует затраты через стратегии резервирования GPU-инстансов, батчинг инференса и квантизацию моделей для снижения вычислительных требований. Внедряет security hardening для LLM-нагрузок с governance доступа к моделям, логированием промптов и изоляцией данных.
Проектирует инфраструктуру Kubernetes для продакшн-сервинга LLM в масштабе с мульти-GPU планированием и параллелизмом моделей. Внедряет оптимизированное по стоимости управление GPU-кластерами с гетерогенными пулами нод и интеллектуальным размещением нагрузок. Применяет security hardening для эндпоинтов сервинга моделей и реализует эффективное распространение артефактов моделей между кластерами.
Тестирование и QA · 1
Проектирует стратегию тестирования для LLM-систем: пирамида тестирования для компонентов prompt/chain/agent, evaluation-driven тестирование с LLM-as-judge, контрактные тесты для интерфейсов провайдеров моделей. Оптимизирует выполнение тестов с мок-ответами LLM и селективным интеграционным тестированием. Менторит команду по тестированию недетерминированных AI-выходов.
Data Engineering · 1
Проектирует архитектуру данных LLM с Pandas/Polars: инфраструктура пайплайнов тренировочных данных, управление бенчмарками оценки и версионирование датасетов для воспроизводимости моделей. Реализует фреймворки качества данных для детекции контаминации, bias и distribution shift. Создаёт организационные стандарты подготовки данных для файн-тюнинга LLM. Менторит команду по масштабируемой обработке текста.
Machine Learning и AI · 12
Проектирует масштабируемую vector DB инфраструктуру: шардирование, репликация, hybrid search. Оптимизирует index parameters для trade-off между recall, latency и memory при миллионах vectors.
Проектирует комплексные платформы мониторинга для LLM-систем в продакшене. Внедряет автоматизированные evaluation-пайплайны с LLM-as-judge, петлями обратной связи и инструментацией A/B-тестов. Строит дашборды оптимизации затрат с трекингом расхода токенов по версиям моделей и вариантам промптов. Менторит команду по паттернам LLMOps observability.
Проектирует комплексные evaluation frameworks: automated eval с LLM-as-judge, contamination detection, statistical significance testing. Разрабатывает domain-specific benchmarks для production задач.
Архитектурит системы трекинга экспериментов для LLM-платформ: проектирует кастомное логирование для многоэтапных пайплайнов (retrieval, generation, ranking), оптимизирует хранение больших артефактов промптов/ответов, менторит команды по отслеживанию дрифта оценок между версиями моделей
Проектирует продакшн-готовые агентные архитектуры с фреймворк-агностичными паттернами — подключаемыми LLM-бэкендами, реестрами инструментов и интеграцией observability. Внедряет продвинутые мультиагентные системы с агентами-супервизорами, специализированными агентами-воркерами и общими хранилищами памяти на LangGraph или кастомных конечных автоматах. Оптимизирует агентные системы для продакшн-масштаба через интеллектуальное кэширование, стриминг-выполнение, параллельные вызовы инструментов и стратегии cost-aware маршрутизации моделей.
Проектирует масштабируемую инфраструктуру LLM-сервинга с маршрутизацией моделей, адаптивным батчингом и мультирегиональным деплоем. Формирует организационные практики промпт-инжиниринга с аудитом. Оптимизирует бюджеты токенов через семантическое кэширование и дистилляцию моделей.
Проектирует production fine-tuning pipeline: data curation, multi-stage training (SFT -> DPO), distributed fine-tuning. Оптимизирует LoRA rank, learning rate, batch size для максимального качества.
Архитектурит инфраструктуру MLflow для корпоративной разработки LLM: трекинг итераций RLHF reward-моделей, управление реестрами адаптеров и автоматизация evaluation-наборов (MT-Bench, HumanEval). Создаёт кастомные MLflow flavors для серверирования квантизованных LLM (GPTQ, AWQ) с трекингом latency и throughput.
Проектирует архитектуру serving LLM: мульти-модельный gateway с интеллектуальной маршрутизацией, speculative decoding для оптимизации латенси и disaggregated serving (разделение prefill/decode). Реализует оптимизацию затрат: управление бюджетом токенов, слои кеширования для повторяющихся промптов и стратегии каскада моделей. Создаёт бенчмарки LLM serving и модели планирования ёмкости. Менторит команду по инфраструктуре production LLM.
Архитектурирует инфраструктуру обучения LLM в PyTorch. Реализует кастомные механизмы внимания, позиционные кодировки и model parallelism. Оптимизирует память с gradient checkpointing, mixed precision и Flash Attention. Проектирует фреймворки оценки качества LM. Менторит команду по трансформерам.
Проектирует масштабируемые RAG-платформы с графовым поиском, контекстным сжатием и адаптивными стратегиями чанкинга. Реализует интеграцию knowledge graph для структурированного рассуждения и менторит команду по методологии оценки RAG и снижению галлюцинаций.
Проектирует production LLM-системы с оптимизированным serving (vLLM, TGI), model parallelism и стратегиями batching. Разрабатывает фреймворки оценки качества, безопасности и bias detection. Внедряет RLHF, constitutional AI и chain-of-thought optimization.
AI-ассистированная разработка · 4
Проектирует продакшн-архитектуры AI-агентов с sophisticated возможностями рассуждений — tree-of-thought планирование, саморефлексия и коррекция, динамическая адаптация стратегии на основе анализа сложности задачи. Внедряет мультиагентные системы со специализацией агентов, протоколами коммуникации и механизмами консенсуса для декомпозиции сложных задач. Архитектурирует агентную инфраструктуру для масштаба — распределённое выполнение инструментов, персистентную память агентов с vector stores и real-time observability цепочек рассуждений и метрик стоимости агентов.
Проектирует сложные мультимодельные pipeline с использованием ChatGPT и Claude. Реализует fallback-стратегии, A/B-тестирование моделей, оптимизирует затраты через routing запросов между провайдерами.
Проектирует масштабируемую MCP-инфраструктуру с композицией серверов, оркестрацией инструментов и стратегиями fallback. Реализует расширения протокола для кастомных возможностей и менторит команду по оптимизации контекстного окна с MCP-инструментами.
Проектирует advanced prompt engineering systems: automated prompt tuning (DSPy, OPRO), prompt chaining, meta-prompting. Оптимизирует промпты для минимизации latency и стоимости при сохранении качества.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Lead
80 навыков получают более высокое ожидание или становятся ключевыми при переходе с Senior на Lead. Сначала самые большие скачки.
- Асинхронное программирование: Продвинутый → Эксперт
- Векторные базы данных: Продвинутый → Эксперт
- Мониторинг моделей: Продвинутый → Эксперт
- Оценка LLM: Продвинутый → Эксперт
- Принципы ООП и SOLID: Продвинутый → Эксперт
- Трекинг экспериментов: Продвинутый → Эксперт
- AI Agent Frameworks: Продвинутый → Эксперт
- AI Agents для разработки: Продвинутый → Эксперт
- AWS: Продвинутый → Эксперт
- ChatGPT / Claude: Продвинутый → Эксперт
} в открытой матрице компетенций: 80 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.