Речевая аналитика с GenAI в ВКР: от транскрибации к метрикам качества контакт-центра
В марте 2026 года Naumen совместно с «ОТП Банком» запустили речевую аналитику с генеративным ИИ: система не просто распознаёт речь операторов, а автоматически выделяет причины обращений, эмоциональный окрас и точки, где клиент готов уйти. Для выпускников ИТ-специальностей это не «ещё одна новость про ИИ», а готовый референс архитектуры: гибрид ASR + LLM + микросервисов, работающий на реальных нагрузках банковского контакт-центра. Такие кейсы удобно превращать в главы ВКР — они задают требования, метрики и ограничения, которых обычно не хватает в теоретических работах. Ниже — как разложить эту тему на задачи, разделы и защищаемые результаты.
Три темы ВКР, которые вырастают из кейса Naumen × ОТП Банк
Тема 1. Система речевой аналитики контакт-центра на базе ASR и LLM
Актуальность. В статье прямо описан переход от «ручного прослушивания звонков» к автоматической разметке. Это классическая точка роста для банков, телекома и e-commerce — везде, где есть контакт-центр.
Цель: спроектировать сервис, который принимает аудиопоток, транскрибирует его и обогащает результатами GenAI-анализа.
Задачи:
- Сравнить ASR-движки (Whisper, GigaAM, Vosk) по WER на русскоязычных звонках.
- Спроектировать пайплайн: загрузка → нормализация → транскрибация → промпт-анализ → сохранение.
- Реализовать прототип на Python (FastAPI + очередь задач) и REST API.
- Оценить точность извлечения сущностей и задержку обработки.
Структура: Гл.1 — обзор ASR/NLP-подходов и аналогов (Naumen, Speech Analytics от CTI, Dasha.AI). Гл.2 — архитектура, диаграммы компонентов, схема данных. Гл.3 — тестирование на датасете, метрики, экономика внедрения.
Тема 2. Микросервисная архитектура аналитической платформы
Актуальность. Нагрузки банковского КЦ требуют горизонтального масштабирования. В статье речь идёт о промышленной системе, а значит — о сервисной декомпозиции.
Цель: доказать, что разбиение монолита на сервисы (загрузка, ASR, LLM, отчёты) снижает время отклика и упрощает деплой.
Задачи: выбрать брокер (Kafka/RabbitMQ), описать контракты между сервисами, развернуть в Kubernetes, настроить OpenTelemetry, замерить p95/p99.
Структура: Гл.1 — микросервисы vs монолит, критерии ISO/IEC 25010. Гл.2 — диаграммы C4, схемы БД, CI/CD-пайплайн. Гл.3 — нагрузочные тесты, RTO/RPO, стоимость инфраструктуры.
Тема 3. Метрики качества обслуживания на основе GenAI-разметки
Актуальность. ОТП Банк использует аналитику именно для «лучшего понимания клиентов» — то есть для управленческих решений. Значит, в ВКР можно уйти от «сделал сервис» к «получил измеримый эффект».
Цель: построить систему метрик (NPS-прогноз, вероятность оттока, качество скрипта) на текстах звонков.
Задачи: разметить корпус, обучить/настроить классификатор, валидировать метрики, построить дашборд.
Структура: Гл.1 — теория речевой аналитики и KPI КЦ. Гл.2 — модель данных, промпты, пайплайн. Гл.3 — эксперименты, A/B, оценка эффекта.
Аналитическая глава: как обосновать стек и не «поплыть» на защите
Первая глава ВКР обычно превращается в свалку обзоров. Здесь поможет приём «сравнение по критериям из статьи». Возьмите требования, которые неявно звучат в кейсе Naumen: потоковая обработка аудио, высокая точность на русском, интеграция с CRM, масштабирование под пиковые часы.
| Критерий | Вариант А (облачный ASR) | Вариант Б (self-hosted Whisper) | Вариант В (гибрид) |
|---|---|---|---|
| WER на русском | 8–12% | 10–15% | 8–13% |
| Стоимость за час | высокая | низкая (CAPEX) | средняя |
| Соответствие 152-ФЗ | риск | полное | полное |
| Время внедрения | дни | недели | недели |
Такой таблицы достаточно, чтобы во введении к проектной главе написать: «выбран гибридный вариант, так как он сочетает соответствие ГОСТ 34.602-89 в части защиты данных и приемлемый WER».
Проектная часть: схемы, алгоритмы, интеграция
Схема потока данных
Опишите пайплайн как последовательность: телефония → буфер (Kafka) → сервис нормализации → ASR → сервис промптов → хранилище результатов → BI. Каждый переход — отдельный блок на схеме с указанием протокола (SIP/RTP, gRPC, REST, WebSocket) и ожидаемой задержки. Это то, что проверяющий ищет в первую очередь.
Алгоритм анализа звонка
Приведите псевдокод — он отлично смотрится в приложении и снимает вопросы «а вы сами-то понимаете, как это работает?».
def analyze_call(audio_path):
text = asr.transcribe(audio_path)
segments = diarize(text)
entities = llm.extract(segments, prompt="причина, эмоция, риск оттока")
score = quality_model.predict(segments)
return {"entities": entities, "score": score}
Интеграция с CRM
Здесь используйте опыт ОТП Банка: аналитика ценна, когда результат попадает в карточку клиента. Опишите интеграцию через REST + webhooks, укажите формат JSON-контракта, обработку ошибок, повторные попытки. Это укрепляет раздел «практическая значимость».
Тестирование и метрики: чем доказывать, что система работает
Три группы метрик, которые стоит заложить в ВКР:
- Качество: WER, точность извлечения сущностей (F1), согласованность с ручной разметкой.
- Производительность: время обработки 1 минуты аудио, p95 задержки API, пропускная способность (звонков/час).
- Надёжность: RTO/RPO, процент ошибок, поведение при недоступности LLM-сервиса.
| Метрика | Инструмент | Целевое значение |
|---|---|---|
| WER | jiwer, собственный скрипт | ≤ 12% |
| p95 REST API | Locust / k6 | ≤ 800 мс |
| Задержка обработки | OpenTelemetry трейсы | ≤ 0,3 × длительность звонка |
| Доступность | Prometheus + Grafana | ≥ 99,5% |
Отдельно проговорите ISO/IEC 25010 — это удобный каркас, чтобы разложить требования на функциональную пригодность, производительность и сопровождаемость.
Чему вы научитесь на такой теме
- Обосновывать выбор ASR/NLP-компонентов через критерии, а не «потому что модно».
- Проектировать микросервисную архитектуру с брокером сообщений и контейнеризацией (Docker, Kubernetes).
- Строить пайплайны CI/CD и подключать наблюдаемость через OpenTelemetry.
- Оформлять техническую документацию по ГОСТ 34.602-89 и ГОСТ 19.201-78.
- Считать экономический эффект внедрения — от сокращения ручного прослушивания до роста удержания.
- Подмена понятий «ASR» и «речевая аналитика». ASR — это транскрибация, аналитика начинается там, где появляются сущности, эмоции и бизнес-метрики. Разведите их в глоссарии.
- Отсутствие количественных метрик. «Работает быстро» не защищается. Всегда давайте числа: WER, задержка, throughput.
- Игнорирование требований ГОСТ 34.602-89 к ТЗ. Если в работе есть раздел «Техническое задание» — оформите его по стандарту, а не в свободной форме.
FAQ по теме
Обязательно ли писать код для ВКР по речевой аналитике?
Нет, но прототип резко повышает шансы на «отлично». Минимальный вариант — скрипт на Python с вызовом готового ASR API и выводом разметки. Этого достаточно, чтобы показать работоспособность подхода.
Где брать тестовые данные, если нет доступа к реальным звонкам?
Подойдут открытые русскоязычные корпуса (Common Voice, OpenSTT), синтетические звонки на основе скриптов, а также публичные датасеты call-центров. В ВКР обязательно опишите ограничения датасета — это признак зрелости.
Как оформить UML/C4-диаграммы и не получить замечание?
Используйте C4 для контекста и контейнеров, UML Sequence — для сценариев интеграции. Каждая диаграмма должна иметь подпись с номером (Рисунок 2.3) и упоминание в тексте главы.
Насколько сложно защитить тему, если я использовал готовые LLM-API?
Совершенно нормально. Вопросы будут не к «самописности», а к обоснованию выбора, ограничениям (152-ФЗ, стоимость) и метрикам качества. Проговорите это в тексте — и защита пройдёт спокойно.
- Есть ссылка на источник (статья CNews) и корректное цитирование кейса.
- Задачи во введении совпадают с пунктами в заключении — один в один.
- Каждая метрика имеет метод измерения и целевое значение.
- Есть минимум одна схема архитектуры и одна диаграмма последовательности.
- ТЗ соответствует ГОСТ 34.602-89, оформление — ГОСТ 19.201-78.
- Раздел «Экономика» ссылается на конкретные цифры, а не «примерно».
- Список литературы включает источники не старше 5 лет.
Источник: Речевая аналитика Naumen c GenAI помогает «ОТП Банку» лучше понимать клиентов (опубликовано 2026-03-26)