Знает основы Elasticsearch: индексы, документы, базовые запросы. Выполняет простые полнотекстовые поисковые запросы для NLP-задач. Понимает концепции анализаторов и токенизаторов.
Роли · NLP Engineer · Junior
Что должен уметь Junior }
18 ключевых навыков, всего 52. Ожидания по каждому навыку и что меняется на следующем уровне.
На этой странице — что ожидается от Junior }, навык за навыком. Ключевые навыки оценивают руководитель и коллеги в цикле ревью; остальные учитываются только в самооценке. Основные области: Backend Development, Data Engineering, Machine Learning и AI.
Ключевые навыки для Junior
Сгруппированы по областям. Метка справа — ожидаемая глубина: Осведомлённость, Применение, Продвинутый или Эксперт.
Backend Development · 1
Data Engineering · 1
Знает основы pandas для работы с текстовыми данными: загрузка корпусов, фильтрация, группировка, базовый text preprocessing. Использует str accessor для операций над текстовыми столбцами.
Machine Learning и AI · 14
Знает основы sentiment analysis: полярность, subjectivity, aspect-based подходы. Применяет pre-trained модели для определения тональности: VADER, TextBlob, Hugging Face sentiment pipeline.
Знает основы vector databases: embeddings, similarity search, ANN algorithms. Использует Pinecone/Weaviate/Qdrant для хранения текстовых embeddings и семантического поиска.
Знает основы text classification: bag-of-words, TF-IDF, базовые классификаторы. Обучает простые модели для категоризации текстов, спам-фильтрации. Оценивает через accuracy, F1-score.
Знает основы мониторинга NLP-моделей: метрики качества, data drift, concept drift. Настраивает базовые алерты на деградацию метрик text classification и NER моделей в production.
Знает основы трекинга экспериментов: MLflow, Weights & Biases. Логирует метрики и параметры NLP-экспериментов: F1, precision, recall для NER и text classification моделей.
Знает основы scikit-learn для NLP: TF-IDF vectorizer, text classification через SVM/Naive Bayes, Pipeline. Обучает baseline NLP-модели и оценивает через cross-validation.
Знает основы применения LLM для NLP-задач: text generation, summarization, few-shot classification. Использует Hugging Face transformers для базовых задач обработки текста.
Знает основы ML-pipeline для NLP: сбор данных, preprocessing, feature extraction, обучение, evaluation. Использует scikit-learn Pipeline и spaCy для построения простых NLP-pipeline.
Знает основы MLflow: experiments, runs, metrics, parameters, artifacts. Логирует результаты обучения NLP-моделей: F1-score, accuracy, confusion matrix для text classification и NER.
Знает основы serving NLP-моделей: REST API endpoints, model loading, batching. Разворачивает простые NLP-модели как REST API для text classification и NER задач.
Знает основы Named Entity Recognition: типы сущностей (PER, ORG, LOC), BIO-разметка, базовые подходы. Применяет pre-trained spaCy NER модели и оценивает качество через F1-score.
Знает основы PyTorch для NLP: tensors, autograd, nn.Module. Обучает простые NLP-модели: text classification через LSTM, embedding layers для word representations. Понимает training loop.
Знает основы RAG: retrieval, augmentation, generation. Применяет простые RAG-pipeline для NLP-задач: поиск релевантных документов и генерация ответов на основе контекста.
Знает основы transformer архитектуры для NLP: self-attention, positional encoding, BERT/GPT. Использует Hugging Face transformers для inference: text classification, NER, summarization.
AI-ассистированная разработка · 2
Знает основные возможности ChatGPT и Claude API: форматы запросов, параметры генерации. Использует LLM API для простых NLP-задач: суммаризация, извлечение сущностей из текста.
Знает основы prompt engineering для NLP-задач: role prompting, few-shot examples, chain-of-thought. Составляет промпты для извлечения сущностей, классификации текста и суммаризации.
Дополнительные навыки
Команда их не оценивает, но они входят в самооценку и план развития.
Что меняется на Middle
52 навыков получают более высокое ожидание или становятся ключевыми при переходе с Junior на Middle. Сначала самые большие скачки.
- Анализ тональности: Осведомлённость → Применение
- Векторные базы данных: Осведомлённость → Применение
- Классификация текстов: Осведомлённость → Применение
- Мониторинг моделей: Осведомлённость → Применение
- Трекинг экспериментов: Осведомлённость → Применение
- ChatGPT / Claude: Осведомлённость → Применение
- Classical ML (scikit-learn): Осведомлённость → Применение
- Elasticsearch / OpenSearch: Осведомлённость → Применение
- LLM приложения: Осведомлённость → Применение
- ML-пайплайны: Осведомлённость → Применение
} в открытой матрице компетенций: 52 навыков на 5 уровнях. Матрица бесплатна для специалистов и останется бесплатной.